🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
✨
实用技巧梯度爆炸时,权重会变成NaN(无穷大)。常用对策是梯度裁剪——给梯度的模长设一个上限,超过就按比例缩放回来,就像给跑步机限速一样。
😲
反直觉全批量梯度下降(BGD)、随机梯度下降(SGD)和小批量梯度下降其实是一个谱系的两端。batch size=1的SGD噪声最大但每步最快;batch size=全数据的BGD最稳但每步最慢——Mini-batch是黄金折中。
一句话总结
💡
梯度是损失函数对参数的偏导数,指明参数调整方向,其大小反映调整幅度,是神经网络优化的核心。
常见误区
这些坑别踩
✗
误区 1
梯度大说明模型训练得很好。
✓
正确理解
梯度大表示当前参数离最优解较远或损失曲面陡峭,训练初期梯度大正常,但训练稳定后梯度应减小,梯度持续很大可能不稳定。
✗
误区 2
梯度为0就一定是最优解。
✓
正确理解
梯度为0的点可能是局部最优、全局最优或鞍点,在高维空间中鞍点比局部最优更常见,需要动量等技术逃离。
巩固练习
章节练习与面试准备
通过测试检验学习效果,通过面试题提升实战能力
章末测试
共 4 题 · 选择题
1
梯度(gradient)的数学定义是?
2
偏导数 ∂f/∂xᵢ 的含义是?
3
方向导数与梯度的关系是?
4
在多元函数优化中,为什么沿负梯度方向更新能降低函数值?
面试经典题
共 4 题 · 先思考再看答案
1
基础
请解释导数、偏导数、方向导数和梯度的概念及它们之间的关系。
2
中等
为什么梯度方向是函数增长最快的方向?请从数学上说明。
3
中等
梯度下降中步长(学习率)如何影响优化?步长过大或过小有什么问题?
4
困难
什么是鞍点?它在高维优化中为什么比局部极小更值得关注?
💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺