🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
⚡
缓存的代价KV Cache让大模型生成第N个token时无需重新计算前N-1个token的Key和Value,推理速度提升数十倍。但代价是显存占用随序列长度线性增长——生成长文本时,KV Cache可能比模型权重本身还大。这就是为什么后来出现了PagedAttention、GQA等各种"压缩缓存"的技术。
一句话总结
💡
KV Cache 缓存已生成 token 的 Key/Value 避免重复计算,是大模型自回归推理加速的关键技术。
常见误区
这些坑别踩
✗
误区 1
KV Cache 让推理不需要任何计算。
✓
正确理解
当前 token 的 Q 仍需与缓存 K 计算注意力,缓存只省去历史 token 的 K/V 重算。
✗
误区 2
KV Cache 不占显存。
✓
正确理解
KV Cache 随序列长度和层数线性增长,长上下文下是显存主要消耗者。
✗
误区 3
KV Cache 可以无限增长。
✓
正确理解
受显存限制,需用分页缓存(PagedAttention)或量化压缩管理。