Transformer 编码器层动画
展示 Transformer 编码器层的完整数据流:多头自注意力、残差连接、LayerNorm 和前馈网络。
Transformer Encoder Layer
编码器层接收已加入位置编码的输入序列 X,开始一层的前向处理流程。
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
Transformer 编码器层的结构是一个精妙的"三明治":多头注意力 → 残差+LayerNorm → FFN → 残差+LayerNorm。但"Pre-LN"和"Post-LN"之争持续了好几年——原始论文用 Post-LN(先做子层再归一化),但深层 Post-LN 训练不稳定。后来微软的研究发现 Pre-LN(先归一化再做子层)训练更稳定,可以堆叠上百层。代价是 Pre-LN 的最终效果可能略差——这就是"稳定性和性能的权衡"。如今大多数大模型(GPT、LLaMA)用 Pre-LN,但配合各种稳定化技巧。
来源:Xiong et al., "On Layer Normalization in the Transformer Architecture", ICML 2020
编码器层由多头自注意力和前馈网络组成,每个子层都配有残差连接与 LayerNorm,负责提取输入的上下文表示。
这些坑别踩
误区 1
编码器层之间参数共享。
正确理解
每一层有独立参数,堆叠多层是为了逐步提取更高层抽象。
误区 2
自注意力会让每个词平均看到所有词。
正确理解
是每个词都能看到所有词,但权重分布使重要位置获得更高关注,非均匀平均。
误区 3
层数越多效果越好。
正确理解
层数过多会过拟合且难训练,需配合残差与归一化且不是无限有益。
章节练习与面试准备
通过测试检验学习效果,通过面试题提升实战能力
章末测试
共 4 题 · 选择题
Transformer 编码器层(Encoder Layer)包含哪些子层,按顺序是?
编码器中的多头自注意力(Multi-Head Self-Attention)的输入来源是?
在编码器的 Add&Norm 中,Add(残差连接)和 Norm(LayerNorm)的顺序是?
原始 Transformer 的编码器由多少层堆叠而成?
面试经典题
共 4 题 · 先思考再看答案
请描述 Transformer 编码器层的完整前向计算流程。
编码器的多头自注意力与解码器的掩码自注意力、交叉注意力有何区别?
Post-Norm 与 Pre-Norm 有何区别?各自有什么优缺点?
编码器堆叠多层后,不同层学到了什么不同的信息?
💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺