知了AI学习平台Logo知了
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

💡
概念

Transformer解码器比编码器多了一个"掩码多头注意力"子层,确保位置i只能看到位置≤i的信息——这就是"因果掩码"。没有它,模型在训练时就能"偷看"未来的答案,变成一个无用的复读机。

一句话总结
💡

解码器层在编码器基础上增加掩码自注意力和交叉注意力,实现自回归生成的同时利用编码器输出。

常见误区

这些坑别踩

✗

误区 1

解码器训练和推理时处理方式相同。

✓

正确理解

训练时用 teacher forcing 并行处理整个目标序列,推理时逐步自回归生成。

✗

误区 2

交叉注意力是解码器自己关注自己。

✓

正确理解

交叉注意力中 Query 来自解码器,Key/Value 来自编码器输出,是跨序列交互。

✗

误区 3

解码器不需要掩码。

✓

正确理解

掩码自注意力防止看到未来 token,保证自回归生成的合法性。

巩固练习

章节练习与面试准备

通过测试检验学习效果,通过面试题提升实战能力

章末测试

共 4 题 · 选择题

1

Transformer 解码器层(Decoder Layer)包含哪三个子层?

2

解码器在生成文本时采用什么方式?

3

解码器的交叉注意力(Cross-Attention)中,Q、K、V 分别来自哪里?

4

训练时解码器如何实现并行化,而推理时却是自回归的?

面试经典题

共 4 题 · 先思考再看答案

1
中等

请描述 Transformer 解码器层的完整前向流程,并对比编码器层。

2
中等

解释解码器自回归生成的完整流程,以及训练与推理的区别。

3
困难

什么是 KV-Cache?它如何加速解码器自回归推理?

4
困难

编码器-解码器架构(如原始 Transformer、T5)与仅编码器(BERT)或仅解码器(GPT)有何区别?

💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺