知了AI学习平台Logo知了
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

🧭
位置编码的进化

原始Transformer的绝对位置编码无法外推到训练时没见过的长度。RoPE(旋转位置编码)通过把位置信息编码为向量旋转角度,让模型天然支持相对位置外推——训练4K上下文的模型可以用RoPE加YaRN扩展到32K甚至更长。这种"旋转即位置"的思路简洁而强大,已成为开源大模型的标配。

一句话总结
💡

长上下文技术通过 RoPE、ALiBi 等相对位置编码和外插训练,扩展模型可处理的有效序列长度。

常见误区

这些坑别踩

✗

误区 1

上下文越长模型越聪明。

✓

正确理解

超出训练长度会精度骤降,且存在"中间被忽视"现象,更长不等于更好利用。

✗

误区 2

RoPE 能自动外推到任意长度。

✓

正确理解

原始 RoPE 外推能力有限,需配合位置插值或 NTK-aware 等扩展。

✗

误区 3

长上下文只需增大位置编码表。

✓

正确理解

注意力二次复杂度和 KV 缓存同样是瓶颈,需联合优化。