知了AI学习平台Logo知了
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

🎮
设备迁移的代价

.to(device)看起来只是把数据搬到GPU,但CPU和GPU之间的数据传输是整个训练流程中最被忽视的瓶颈。如果每个batch都从CPU传数据到GPU,PCIe带宽会成为限速因素——这就是为什么DataLoader的pin_memory=True能提速:它预先把数据锁页,让GPU直接DMA读取。

一句话总结
💡

GPU 训练通过将 Tensor 和模型迁移到 CUDA 设备实现大规模并行计算,显著加速训练。

常见误区

这些坑别踩

✗

误区 1

只要 model.to(device) 就能在 GPU 训练。

✓

正确理解

输入数据和标签也必须 to(device),否则设备不匹配会报错。

✗

误区 2

显存越大模型越快。

✓

正确理解

显存决定能放多大的模型与 batch,速度还取决于 GPU 算力、带宽和数据搬运效率。

✗

误区 3

多 GPU 会自动加速。

✓

正确理解

需用 DataParallel 或 DistributedDataParallel 显式并行,且通信开销可能抵消增益。