知了AI学习平台Logo知了
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

💡
注意力的诞生

2014年Bahdanau提出注意力机制时,初衷只是解决Seq2Seq的"压缩瓶颈"——让解码器在每一步都能"回头看"编码器的所有隐状态。没人想到这个"打补丁"的思路会在三年后演变成完全抛弃RNN的Transformer,重塑整个AI领域。

一句话总结
💡

注意力机制起源于解决 Seq2Seq 的固定上下文瓶颈,通过对齐源序列各位置动态加权聚焦相关信息。

常见误区

这些坑别踩

✗

误区 1

注意力就是 Transformer。

✓

正确理解

注意力机制最早出现在 RNN+Attention 中,Transformer 是去掉 RNN 只保留注意力的架构。

✗

误区 2

注意力权重等于相关性。

✓

正确理解

注意力权重是模型学到的软对齐分布,不一定对应人类理解的语义相关性。

✗

误区 3

注意力只在解码端有用。

✓

正确理解

编码端自注意力和编码-解码交叉注意力都有用,共同提升表示能力。