知了AI学习平台Logo知了
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

😲
万亿参数的幕后功臣

DeepSpeed由微软开发,其核心创新ZeRO(Zero Redundancy Optimizer)将优化器状态、梯度和模型参数分片到不同GPU上,消除了数据并行中的内存冗余。ZeRO-3可以将一个万亿参数模型的显存占用从单卡所需的16TB降至每卡仅约16GB——虽然总显存不变,但让单卡装不下的大模型成为可训练。DeepSpeed还引入了ZeRO-Offload,能将优化器状态卸载到CPU内存,用32GB显存的GPU就能训练10B参数模型。

来源:Rajbhandari et al., "ZeRO: Memory Optimizations Toward Training Trillion Parameter Models", 2019

一句话总结
💡

ZeRO 通过将优化器状态、梯度和参数分片到各设备,逐步消除数据并行中的显存冗余。

常见误区

这些坑别踩

✗

误区 1

ZeRO 和模型并行一样切模型。

✓

正确理解

ZeRO 在数据并行基础上分片显存冗余,逻辑上仍是数据并行。

✗

误区 2

ZeRO 阶段越高越好。

✓

正确理解

更高阶段省显存但增通信,需在显存与通信间权衡。

✗

误区 3

ZeRO 能训练任意大模型。

✓

正确理解

仍受设备和通信限制,超大规模需结合张量/流水线并行。