知了AI学习平台Logo知了
算法动画 · 注意力

Transformer 编码器层动画

展示 Transformer 编码器层的完整数据流:多头自注意力、残差连接、LayerNorm 和前馈网络。

Transformer Encoder Layer

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
未激活·当前高亮(5 个元素)
1

编码器层接收已加入位置编码的输入序列 X,开始一层的前向处理流程。

第 1 步 / 共 714%
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

💡
概念

Transformer 编码器层的结构是一个精妙的"三明治":多头注意力 → 残差+LayerNorm → FFN → 残差+LayerNorm。但"Pre-LN"和"Post-LN"之争持续了好几年——原始论文用 Post-LN(先做子层再归一化),但深层 Post-LN 训练不稳定。后来微软的研究发现 Pre-LN(先归一化再做子层)训练更稳定,可以堆叠上百层。代价是 Pre-LN 的最终效果可能略差——这就是"稳定性和性能的权衡"。如今大多数大模型(GPT、LLaMA)用 Pre-LN,但配合各种稳定化技巧。

来源:Xiong et al., "On Layer Normalization in the Transformer Architecture", ICML 2020

一句话总结
💡

编码器层由多头自注意力和前馈网络组成,每个子层都配有残差连接与 LayerNorm,负责提取输入的上下文表示。

常见误区

这些坑别踩

✗

误区 1

编码器层之间参数共享。

✓

正确理解

每一层有独立参数,堆叠多层是为了逐步提取更高层抽象。

✗

误区 2

自注意力会让每个词平均看到所有词。

✓

正确理解

是每个词都能看到所有词,但权重分布使重要位置获得更高关注,非均匀平均。

✗

误区 3

层数越多效果越好。

✓

正确理解

层数过多会过拟合且难训练,需配合残差与归一化且不是无限有益。

巩固练习

章节练习与面试准备

通过测试检验学习效果,通过面试题提升实战能力

章末测试

共 4 题 · 选择题

1

Transformer 编码器层(Encoder Layer)包含哪些子层,按顺序是?

2

编码器中的多头自注意力(Multi-Head Self-Attention)的输入来源是?

3

在编码器的 Add&Norm 中,Add(残差连接)和 Norm(LayerNorm)的顺序是?

4

原始 Transformer 的编码器由多少层堆叠而成?

面试经典题

共 4 题 · 先思考再看答案

1
基础

请描述 Transformer 编码器层的完整前向计算流程。

2
中等

编码器的多头自注意力与解码器的掩码自注意力、交叉注意力有何区别?

3
困难

Post-Norm 与 Pre-Norm 有何区别?各自有什么优缺点?

4
中等

编码器堆叠多层后,不同层学到了什么不同的信息?

💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺