🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
🧭
位置编码的进化原始Transformer的绝对位置编码无法外推到训练时没见过的长度。RoPE(旋转位置编码)通过把位置信息编码为向量旋转角度,让模型天然支持相对位置外推——训练4K上下文的模型可以用RoPE加YaRN扩展到32K甚至更长。这种"旋转即位置"的思路简洁而强大,已成为开源大模型的标配。
一句话总结
💡
长上下文技术通过 RoPE、ALiBi 等相对位置编码和外插训练,扩展模型可处理的有效序列长度。
常见误区
这些坑别踩
✗
误区 1
上下文越长模型越聪明。
✓
正确理解
超出训练长度会精度骤降,且存在"中间被忽视"现象,更长不等于更好利用。
✗
误区 2
RoPE 能自动外推到任意长度。
✓
正确理解
原始 RoPE 外推能力有限,需配合位置插值或 NTK-aware 等扩展。
✗
误区 3
长上下文只需增大位置编码表。
✓
正确理解
注意力二次复杂度和 KV 缓存同样是瓶颈,需联合优化。