🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
💡
注意力的诞生2014年Bahdanau提出注意力机制时,初衷只是解决Seq2Seq的"压缩瓶颈"——让解码器在每一步都能"回头看"编码器的所有隐状态。没人想到这个"打补丁"的思路会在三年后演变成完全抛弃RNN的Transformer,重塑整个AI领域。
一句话总结
💡
注意力机制起源于解决 Seq2Seq 的固定上下文瓶颈,通过对齐源序列各位置动态加权聚焦相关信息。
常见误区
这些坑别踩
✗
误区 1
注意力就是 Transformer。
✓
正确理解
注意力机制最早出现在 RNN+Attention 中,Transformer 是去掉 RNN 只保留注意力的架构。
✗
误区 2
注意力权重等于相关性。
✓
正确理解
注意力权重是模型学到的软对齐分布,不一定对应人类理解的语义相关性。
✗
误区 3
注意力只在解码端有用。
✓
正确理解
编码端自注意力和编码-解码交叉注意力都有用,共同提升表示能力。