知了AI学习平台Logo知了
算法动画 · 梯度

梯度下降变体对比动画

对比展示批量梯度下降(BGD)、随机梯度下降(SGD)和小批量梯度下降在损失曲面上的不同轨迹。

Batch / Stochastic / Mini-batch Gradient Descent

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
未激活·当前高亮(6 个元素)
1

展示等高线损失曲面,中心是最优解。三种梯度下降变体从同一起点出发进行对比。

第 1 步 / 共 714%
公式推导

梯度下降: 损失函数到参数更新

从损失函数的局部线性近似出发,利用梯度的负方向推导参数更新规则。

第 1 / 617%
1

损失函数

J(θ)=1m∑i=1mℓ(y^(i),y(i))J(\boldsymbol{\theta}) = \frac{1}{m} \sum_{i=1}^{m} \ell(\hat{y}^{(i)}, y^{(i)})
👉

关键部分

J(θ)J(\boldsymbol{\theta})

损失函数衡量模型预测与真实值的差距,目标是最小化 J(\boldsymbol{\theta})。

代码沙盒

梯度下降

使用 NumPy 实现梯度下降优化过程。

📌 一维梯度下降:在简单二次函数上应用梯度下降。

🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

😲
反直觉

全批量梯度下降(BGD)、随机梯度下降(SGD)和小批量梯度下降其实是一个谱系的两端。batch size=1的SGD噪声最大但每步最快;batch size=全数据的BGD最稳但每步最慢——Mini-batch是黄金折中。

一句话总结
💡

梯度下降通过沿负梯度方向迭代更新参数来最小化损失函数,是机器学习中最常用的优化方法。

常见误区

这些坑别踩

✗

误区 1

学习率越大收敛越快越好。

✓

正确理解

学习率过大可能导致振荡甚至发散,无法收敛到最优解,需要选择合适的学习率或使用学习率调度。

✗

误区 2

梯度下降一定能找到全局最优解。

✓

正确理解

梯度下降通常收敛到局部最优或鞍点,尤其是非凸问题(如神经网络)中,全局最优无法保证,但实践中局部最优往往足够好。

巩固练习

章节练习与面试准备

通过测试检验学习效果,通过面试题提升实战能力

章末测试

共 4 题 · 选择题

1

梯度下降的参数更新公式是?

2

批量梯度下降(BGD)的特点是?

3

随机梯度下降(SGD)相比批量梯度下降的主要优势是?

4

Mini-batch(小批量)梯度下降为何成为深度学习最常用方法?

面试经典题

共 4 题 · 先思考再看答案

1
基础

请对比批量梯度下降、随机梯度下降和小批量梯度下降。

2
中等

为什么 SGD 的随机性(噪声)反而有助于找到更好的解?

3
困难

梯度下降在非凸优化中可能遇到哪些问题?如何缓解?

4
中等

学习率衰减有哪些常见策略?为什么要衰减?

💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺