🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
😲
万亿参数的幕后功臣DeepSpeed由微软开发,其核心创新ZeRO(Zero Redundancy Optimizer)将优化器状态、梯度和模型参数分片到不同GPU上,消除了数据并行中的内存冗余。ZeRO-3可以将一个万亿参数模型的显存占用从单卡所需的16TB降至每卡仅约16GB——虽然总显存不变,但让单卡装不下的大模型成为可训练。DeepSpeed还引入了ZeRO-Offload,能将优化器状态卸载到CPU内存,用32GB显存的GPU就能训练10B参数模型。
来源:Rajbhandari et al., "ZeRO: Memory Optimizations Toward Training Trillion Parameter Models", 2019
一句话总结
💡
ZeRO 通过将优化器状态、梯度和参数分片到各设备,逐步消除数据并行中的显存冗余。
常见误区
这些坑别踩
✗
误区 1
ZeRO 和模型并行一样切模型。
✓
正确理解
ZeRO 在数据并行基础上分片显存冗余,逻辑上仍是数据并行。
✗
误区 2
ZeRO 阶段越高越好。
✓
正确理解
更高阶段省显存但增通信,需在显存与通信间权衡。
✗
误区 3
ZeRO 能训练任意大模型。
✓
正确理解
仍受设备和通信限制,超大规模需结合张量/流水线并行。