知了AI学习平台Logo知了
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

✨
用算力换显存的交易

梯度检查点(Gradient Checkpointing)是显存优化的经典技巧:前向传播时不保存中间激活值,反向传播时重新计算它们。这把激活内存从O(n)降到O(√n),代价是增加约33%的前向计算量。另一个关键技术是CPU卸载——把暂时不用的参数或优化器状态转移到CPU内存甚至NVMe SSD上,需要时再加载回来。这些技术让"穷人也能训大模型"成为现实:一张24GB显存的RTX 4090,配合这些技巧可以微调7B甚至13B参数的模型。

来源:Chen et al., "Training Deep Nets with Sublinear Memory Cost", 2016

一句话总结
💡

显存优化通过梯度检查点、激活重计算、ZeRO 和卸载等技术降低训练显存峰值。

常见误区

这些坑别踩

✗

误区 1

梯度检查点免费省显存。

✓

正确理解

它以重计算换显存,增加约 30% 计算量,是时间换空间。

✗

误区 2

卸载到 CPU 一定划算。

✓

正确理解

CPU 卸载省显存但增加数据搬运延迟,需权衡速度。

✗

误区 3

显存优化只影响能不能训练。

✓

正确理解

显存策略也影响训练速度,需综合优化。