知了AI学习平台Logo知了
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

⚡
缓存的代价

KV Cache让大模型生成第N个token时无需重新计算前N-1个token的Key和Value,推理速度提升数十倍。但代价是显存占用随序列长度线性增长——生成长文本时,KV Cache可能比模型权重本身还大。这就是为什么后来出现了PagedAttention、GQA等各种"压缩缓存"的技术。

一句话总结
💡

KV Cache 缓存已生成 token 的 Key/Value 避免重复计算,是大模型自回归推理加速的关键技术。

常见误区

这些坑别踩

✗

误区 1

KV Cache 让推理不需要任何计算。

✓

正确理解

当前 token 的 Q 仍需与缓存 K 计算注意力,缓存只省去历史 token 的 K/V 重算。

✗

误区 2

KV Cache 不占显存。

✓

正确理解

KV Cache 随序列长度和层数线性增长,长上下文下是显存主要消耗者。

✗

误区 3

KV Cache 可以无限增长。

✓

正确理解

受显存限制,需用分页缓存(PagedAttention)或量化压缩管理。