关键观点
一次性压平会过早压缩上下文原始模型把前三个字符的嵌入全部拼接后,直接送入单个隐藏层预测下一个字符。扩展到八个字符时,虽然可以机械地增大第一层输入宽度,但所有上下文仍在第一步被压缩。讲者认为这种结构难以高效利用更长上下文,因此引入逐层融合的树状架构。每一层只合并相邻的两个表示,让信息随网络深度逐渐汇聚。
原始模型把前三个字符的嵌入全部拼接后,直接送入单个隐藏层预测下一个字符。扩展到八个字符时,虽然可以机械地增大第一层输入宽度,但所有上下文仍在第一步被压缩。讲者认为这种结构难以高效利用更长上下文,因此引入逐层融合的树状架构。每一层只合并相邻的两个表示,让信息随网络深度逐渐汇聚。
为什么重要: 渐进融合为扩大感受野和加深网络提供了更自然的结构,也为后续转换成膨胀因果卷积奠定基础。
支撑证据
we don't just want to feed them all into a single hidden layer because that squashes too much information too quickly
仅增加上下文长度就带来明显收益模型的 block size 从 3 增加到 8,即使用八个字符预测第九个字符。即使仍采用单隐藏层并一次性压平输入,验证损失也从约 2.10 降至约 2.02,生成姓名的主观质量也有所改善。这说明原模型首先受限于可用上下文,而不只是参数数量或深度。不过,这一结果只是粗略基线,仍有大量超参数没有调优。