知了AI学习平台Logo知了
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

🎭
未来屏蔽术

Transformer解码器的因果掩码是一个上三角矩阵,把"未来"的位置设为负无穷,Softmax后变成0。这意味着生成第5个词时,模型只能看到前4个词——但在训练时,整个序列是一次性并行处理的,掩码让"并行计算"和"自回归生成"这对矛盾完美和解。

一句话总结
💡

掩码多头注意力在自注意力基础上用三角掩码屏蔽未来位置,确保生成时当前位置只能依赖已生成内容。

常见误区

这些坑别踩

✗

误区 1

掩码只是在推理时用。

✓

正确理解

训练时同样需要掩码,保证并行训练与逐步推理的行为一致。

✗

误区 2

掩码会把信息完全丢弃。

✓

正确理解

掩码只是把未来位置的注意力权重置为负无穷(经 softmax 归零),不是删除数据。

✗

误区 3

编码器也需要掩码注意力。

✓

正确理解

编码器处理完整输入无需因果掩码,只有解码器的自注意力需要(除填充掩码外)。

巩固练习

章节练习与面试准备

通过测试检验学习效果,通过面试题提升实战能力

章末测试

共 4 题 · 选择题

1

解码器中因果掩码(Causal Mask)的作用是?

2

Padding Mask 的作用是?

3

掩码在注意力计算中具体如何实现?

4

训练时解码器并行计算所有位置,因果掩码如何保证与推理一致性?

面试经典题

共 4 题 · 先思考再看答案

1
基础

请解释 Causal Mask(因果掩码)的原理,并说明为什么训练时需要它。

2
中等

Padding Mask 与 Causal Mask 如何在解码器中同时使用?

3
困难

掩码注意力在训练和推理阶段的行为有何差异?如何优化推理效率?

4
困难

除了因果掩码和填充掩码,Transformer 中还有哪些掩码技巧?

💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺