🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
✨
用算力换显存的交易梯度检查点(Gradient Checkpointing)是显存优化的经典技巧:前向传播时不保存中间激活值,反向传播时重新计算它们。这把激活内存从O(n)降到O(√n),代价是增加约33%的前向计算量。另一个关键技术是CPU卸载——把暂时不用的参数或优化器状态转移到CPU内存甚至NVMe SSD上,需要时再加载回来。这些技术让"穷人也能训大模型"成为现实:一张24GB显存的RTX 4090,配合这些技巧可以微调7B甚至13B参数的模型。
来源:Chen et al., "Training Deep Nets with Sublinear Memory Cost", 2016
一句话总结
💡
显存优化通过梯度检查点、激活重计算、ZeRO 和卸载等技术降低训练显存峰值。
常见误区
这些坑别踩
✗
误区 1
梯度检查点免费省显存。
✓
正确理解
它以重计算换显存,增加约 30% 计算量,是时间换空间。
✗
误区 2
卸载到 CPU 一定划算。
✓
正确理解
CPU 卸载省显存但增加数据搬运延迟,需权衡速度。
✗
误区 3
显存优化只影响能不能训练。
✓
正确理解
显存策略也影响训练速度,需综合优化。