知识图谱
分布式训练策略
分布式训练通过多种并行策略将大模型的训练任务分配到多个设备上。
核心
概念
方法
应用
🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
😲
通信才是真正的瓶颈训练GPT-3的1750亿参数模型,需要在数千张GPU上运行数月,成本超过460万美元。在这些大规模训练中,30-50%的时间花在GPU之间的通信上而非计算上。一个反直觉的事实:增加GPU数量到一定程度后,训练速度不升反降——因为通信开销的增长超过了计算能力的增长。这就是为什么"扩展效率"(scaling efficiency)比峰值算力更重要:一个80%扩展效率的系统远胜于一个50%扩展效率的系统,即使后者峰值FLOPS更高。
来源:GPT-3 training cost estimate: Bloomberg, 2023
一句话总结
💡
分布式训练通过多机多卡并行加速大模型训练,核心是数据并行、模型并行与流水线并行等策略。
常见误区
这些坑别踩
✗
误区 1
加更多 GPU 一定线性加速。
✓
正确理解
通信开销使加速比递减,存在扩展瓶颈。
✗
误区 2
分布式训练和单卡训练代码一样。
✓
正确理解
需处理进程组、梯度同步和混合精度等分布式逻辑。
✗
误区 3
数据并行和模型并行没区别。
✓
正确理解
数据并行复制模型切数据,模型并行切模型,机制不同。