知了AI学习平台Logo知了
算法动画 · 注意力

Transformer 架构动画

展示 Transformer 的完整数据流:从词嵌入到位置编码,再到编码器堆叠与解码器输出。

Transformer

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
未激活·当前高亮(7 个元素)
1

输入句子被分词后,每个 token 通过 Embedding 层映射为高维向量。

第 1 步 / 共 714%
知识图谱

Transformer 架构总览

Transformer 由编码器和解码器组成,核心是自注意力机制和前馈网络。

组成组成核心机制位置信息包含包含包含配合配合Tran…Enco…Deco…注意力位置编码FFN残差连接层归一化
核心
概念
方法
应用
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

📜
历史

Transformer论文《Attention Is All You Need》发表于2017年,最初只是为机器翻译设计的。没人预料到它会成为几乎所有现代大模型(GPT、BERT、LLaMA)的基础架构——论文标题如今看来简直是预言。

来源:Vaswani et al., "Attention Is All You Need", NeurIPS 2017

📜
历史

Transformer论文最初的标题并不是"Attention Is All You Need"——团队曾考虑过更学术化的标题。最终选择这个朗朗上口的名字,后来它成为AI领域被引用最多的论文之一,标题本身也成了梗。

一句话总结
💡

Transformer 完全基于注意力机制摒弃循环结构,通过编码器提取表示、解码器自回归生成,实现并行训练与长依赖建模。

常见误区

这些坑别踩

✗

误区 1

Transformer 不需要位置信息。

✓

正确理解

自注意力本身是排列不变的,必须靠位置编码注入顺序信息。

✗

误区 2

编码器和解码器结构完全相同。

✓

正确理解

解码器多了掩码自注意力和交叉注意力,且推理时是自回归的。

✗

误区 3

Transformer 只能用于 NLP。

✓

正确理解

经过改造(如 ViT)已广泛应用于视觉、语音、多模态等领域。

巩固练习

章节练习与面试准备

通过测试检验学习效果,通过面试题提升实战能力

章末测试

共 4 题 · 选择题

1

Transformer 的核心创新是?

2

Transformer 中位置编码(Positional Encoding)的作用是?

3

Transformer 编码器中每个子层的结构是?

4

关于 Transformer 相比 RNN 的优势,下列说法正确的是?

面试经典题

共 5 题 · 先思考再看答案

1
基础

请介绍 Transformer 的整体架构及其组成部分。

2
中等

为什么 Transformer 需要位置编码?常见的方式有哪些?

3
中等

请解释 Transformer 中残差连接和 LayerNorm 的作用。

4
困难

编码器与解码器有什么区别?解码器为什么要用掩码注意力?

5
困难

Transformer 为什么能够高度并行训练?请从架构角度分析。

💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺