🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
🎭
未来屏蔽术Transformer解码器的因果掩码是一个上三角矩阵,把"未来"的位置设为负无穷,Softmax后变成0。这意味着生成第5个词时,模型只能看到前4个词——但在训练时,整个序列是一次性并行处理的,掩码让"并行计算"和"自回归生成"这对矛盾完美和解。
一句话总结
💡
掩码多头注意力在自注意力基础上用三角掩码屏蔽未来位置,确保生成时当前位置只能依赖已生成内容。
常见误区
这些坑别踩
✗
误区 1
掩码只是在推理时用。
✓
正确理解
训练时同样需要掩码,保证并行训练与逐步推理的行为一致。
✗
误区 2
掩码会把信息完全丢弃。
✓
正确理解
掩码只是把未来位置的注意力权重置为负无穷(经 softmax 归零),不是删除数据。
✗
误区 3
编码器也需要掩码注意力。
✓
正确理解
编码器处理完整输入无需因果掩码,只有解码器的自注意力需要(除填充掩码外)。
巩固练习
章节练习与面试准备
通过测试检验学习效果,通过面试题提升实战能力
章末测试
共 4 题 · 选择题
1
解码器中因果掩码(Causal Mask)的作用是?
2
Padding Mask 的作用是?
3
掩码在注意力计算中具体如何实现?
4
训练时解码器并行计算所有位置,因果掩码如何保证与推理一致性?
面试经典题
共 4 题 · 先思考再看答案
1
基础
请解释 Causal Mask(因果掩码)的原理,并说明为什么训练时需要它。
2
中等
Padding Mask 与 Causal Mask 如何在解码器中同时使用?
3
困难
掩码注意力在训练和推理阶段的行为有何差异?如何优化推理效率?
4
困难
除了因果掩码和填充掩码,Transformer 中还有哪些掩码技巧?
💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺