🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
🎛️
超参数的蝴蝶效应Transformer的warmup学习率策略看似奇怪:先线性增长再指数衰减。原因是LayerNorm在训练初期还不稳定,大学习率会让梯度爆炸;warmup给LayerNorm时间"热身"。去掉warmup直接用大学习率,模型可能永远训练不出来——这个细节曾让无数初学者踩坑。
一句话总结
💡
关键超参数包括模型维度、层数、头数、FFN 维度等,共同决定模型容量、计算量与训练效果。
常见误区
这些坑别踩
✗
误区 1
注意力头数越多越好。
✓
正确理解
头数过多会降低每个头的维度导致表达力下降,需与模型维度匹配。
✗
误区 2
模型维度只影响参数量不影响速度。
✓
正确理解
维度增大同时增加计算量和显存占用,影响训练速度。
✗
误区 3
超参数有通用最优值。
✓
正确理解
最优值依赖数据和任务,通常需基于经验范围进行搜索调优。