知了AI学习平台Logo知了
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

😲
反直觉

4-bit量化可以把70B模型从140GB压缩到35GB,损失却微乎其微。量化之所以有效,是因为大模型的权重分布高度集中,少量比特就能很好近似——这是"大模型比小模型更好压缩"的反直觉现象。

一句话总结
💡

量化将模型权重和激活从高精度(如 FP16)压缩到低精度(如 INT8/INT4),降低显存占用和加速推理。

常见误区

这些坑别踩

✗

误区 1

量化一定不会损失精度。

✓

正确理解

低比特量化(如 4-bit)通常有一定精度损失,需通过校准和混合精度缓解。

✗

误区 2

量化只压缩权重。

✓

正确理解

除权重量化(W8A16)外还有权重加激活量化(W8A8)及 KV 缓存量化等。

✗

误区 3

量化后训练和推理一样快。

✓

正确理解

量化主要加速推理,训练量化(QAT)还需额外流程,并非直接提速训练。