知了AI学习平台Logo知了
算法动画 · 神经网络

模型并行动画

展示模型并行如何将一个大模型拆分到多个 GPU 上,每个 GPU 负责模型的一部分计算。

Model Parallelism

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
未激活·当前高亮(4 个元素)
1

当模型太大无法放入单个 GPU 显存时,需要将模型拆分到多个 GPU 上,这就是模型并行。

第 1 步 / 共 714%
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

💡
把模型切成碎片

模型并行是最直观的分布式策略:当模型大到一张卡装不下时,就把模型的不同层放在不同卡上。但它有个致命问题——同一时刻只有一张卡在工作,其余全在等待,GPU利用率极低。这就是为什么纯粹的模型并行几乎没人单独使用。现代分布式训练几乎都采用"3D并行":数据并行切分批次、张量并行切分矩阵、流水线并行切分层——三种策略正交组合,才能高效利用数千张GPU。

一句话总结
💡

模型并行将单个大模型按层或按维度切分到多卡,解决单卡放不下的问题。

常见误区

这些坑别踩

✗

误区 1

模型并行就是数据并行的升级。

✓

正确理解

模型并行切分模型本身,和数据并行切数据是不同维度。

✗

误区 2

模型并行一定比数据并行快。

✓

正确理解

模型并行通信频繁,利用率可能很低,常需与数据并行结合。

✗

误区 3

任意切分都有效。

✓

正确理解

切分需平衡计算与通信,不当切分会造成大量空闲等待。