🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
😲
反直觉4-bit量化可以把70B模型从140GB压缩到35GB,损失却微乎其微。量化之所以有效,是因为大模型的权重分布高度集中,少量比特就能很好近似——这是"大模型比小模型更好压缩"的反直觉现象。
一句话总结
💡
量化将模型权重和激活从高精度(如 FP16)压缩到低精度(如 INT8/INT4),降低显存占用和加速推理。
常见误区
这些坑别踩
✗
误区 1
量化一定不会损失精度。
✓
正确理解
低比特量化(如 4-bit)通常有一定精度损失,需通过校准和混合精度缓解。
✗
误区 2
量化只压缩权重。
✓
正确理解
除权重量化(W8A16)外还有权重加激活量化(W8A8)及 KV 缓存量化等。
✗
误区 3
量化后训练和推理一样快。
✓
正确理解
量化主要加速推理,训练量化(QAT)还需额外流程,并非直接提速训练。