🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
🎮
设备迁移的代价.to(device)看起来只是把数据搬到GPU,但CPU和GPU之间的数据传输是整个训练流程中最被忽视的瓶颈。如果每个batch都从CPU传数据到GPU,PCIe带宽会成为限速因素——这就是为什么DataLoader的pin_memory=True能提速:它预先把数据锁页,让GPU直接DMA读取。
一句话总结
💡
GPU 训练通过将 Tensor 和模型迁移到 CUDA 设备实现大规模并行计算,显著加速训练。
常见误区
这些坑别踩
✗
误区 1
只要 model.to(device) 就能在 GPU 训练。
✓
正确理解
输入数据和标签也必须 to(device),否则设备不匹配会报错。
✗
误区 2
显存越大模型越快。
✓
正确理解
显存决定能放多大的模型与 batch,速度还取决于 GPU 算力、带宽和数据搬运效率。
✗
误区 3
多 GPU 会自动加速。
✓
正确理解
需用 DataParallel 或 DistributedDataParallel 显式并行,且通信开销可能抵消增益。