知了AI学习平台Logo知了
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

✨
实用技巧

梯度爆炸时,权重会变成NaN(无穷大)。常用对策是梯度裁剪——给梯度的模长设一个上限,超过就按比例缩放回来,就像给跑步机限速一样。

😲
反直觉

全批量梯度下降(BGD)、随机梯度下降(SGD)和小批量梯度下降其实是一个谱系的两端。batch size=1的SGD噪声最大但每步最快;batch size=全数据的BGD最稳但每步最慢——Mini-batch是黄金折中。

一句话总结
💡

梯度是损失函数对参数的偏导数,指明参数调整方向,其大小反映调整幅度,是神经网络优化的核心。

常见误区

这些坑别踩

✗

误区 1

梯度大说明模型训练得很好。

✓

正确理解

梯度大表示当前参数离最优解较远或损失曲面陡峭,训练初期梯度大正常,但训练稳定后梯度应减小,梯度持续很大可能不稳定。

✗

误区 2

梯度为0就一定是最优解。

✓

正确理解

梯度为0的点可能是局部最优、全局最优或鞍点,在高维空间中鞍点比局部最优更常见,需要动量等技术逃离。

巩固练习

章节练习与面试准备

通过测试检验学习效果,通过面试题提升实战能力

章末测试

共 4 题 · 选择题

1

梯度(gradient)的数学定义是?

2

偏导数 ∂f/∂xᵢ 的含义是?

3

方向导数与梯度的关系是?

4

在多元函数优化中,为什么沿负梯度方向更新能降低函数值?

面试经典题

共 4 题 · 先思考再看答案

1
基础

请解释导数、偏导数、方向导数和梯度的概念及它们之间的关系。

2
中等

为什么梯度方向是函数增长最快的方向?请从数学上说明。

3
中等

梯度下降中步长(学习率)如何影响优化?步长过大或过小有什么问题?

4
困难

什么是鞍点?它在高维优化中为什么比局部极小更值得关注?

💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺