🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
💡
概念Transformer解码器比编码器多了一个"掩码多头注意力"子层,确保位置i只能看到位置≤i的信息——这就是"因果掩码"。没有它,模型在训练时就能"偷看"未来的答案,变成一个无用的复读机。
一句话总结
💡
解码器层在编码器基础上增加掩码自注意力和交叉注意力,实现自回归生成的同时利用编码器输出。
常见误区
这些坑别踩
✗
误区 1
解码器训练和推理时处理方式相同。
✓
正确理解
训练时用 teacher forcing 并行处理整个目标序列,推理时逐步自回归生成。
✗
误区 2
交叉注意力是解码器自己关注自己。
✓
正确理解
交叉注意力中 Query 来自解码器,Key/Value 来自编码器输出,是跨序列交互。
✗
误区 3
解码器不需要掩码。
✓
正确理解
掩码自注意力防止看到未来 token,保证自回归生成的合法性。
巩固练习
章节练习与面试准备
通过测试检验学习效果,通过面试题提升实战能力
章末测试
共 4 题 · 选择题
1
Transformer 解码器层(Decoder Layer)包含哪三个子层?
2
解码器在生成文本时采用什么方式?
3
解码器的交叉注意力(Cross-Attention)中,Q、K、V 分别来自哪里?
4
训练时解码器如何实现并行化,而推理时却是自回归的?
面试经典题
共 4 题 · 先思考再看答案
1
中等
请描述 Transformer 解码器层的完整前向流程,并对比编码器层。
2
中等
解释解码器自回归生成的完整流程,以及训练与推理的区别。
3
困难
什么是 KV-Cache?它如何加速解码器自回归推理?
4
困难
编码器-解码器架构(如原始 Transformer、T5)与仅编码器(BERT)或仅解码器(GPT)有何区别?
💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺