梯度下降变体对比动画
对比展示批量梯度下降(BGD)、随机梯度下降(SGD)和小批量梯度下降在损失曲面上的不同轨迹。
Batch / Stochastic / Mini-batch Gradient Descent
展示等高线损失曲面,中心是最优解。三种梯度下降变体从同一起点出发进行对比。
梯度下降: 损失函数到参数更新
从损失函数的局部线性近似出发,利用梯度的负方向推导参数更新规则。
损失函数
关键部分
损失函数衡量模型预测与真实值的差距,目标是最小化 J(\boldsymbol{\theta})。
梯度下降
使用 NumPy 实现梯度下降优化过程。
📌 一维梯度下降:在简单二次函数上应用梯度下降。
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
全批量梯度下降(BGD)、随机梯度下降(SGD)和小批量梯度下降其实是一个谱系的两端。batch size=1的SGD噪声最大但每步最快;batch size=全数据的BGD最稳但每步最慢——Mini-batch是黄金折中。
梯度下降通过沿负梯度方向迭代更新参数来最小化损失函数,是机器学习中最常用的优化方法。
这些坑别踩
误区 1
学习率越大收敛越快越好。
正确理解
学习率过大可能导致振荡甚至发散,无法收敛到最优解,需要选择合适的学习率或使用学习率调度。
误区 2
梯度下降一定能找到全局最优解。
正确理解
梯度下降通常收敛到局部最优或鞍点,尤其是非凸问题(如神经网络)中,全局最优无法保证,但实践中局部最优往往足够好。
章节练习与面试准备
通过测试检验学习效果,通过面试题提升实战能力
章末测试
共 4 题 · 选择题
梯度下降的参数更新公式是?
批量梯度下降(BGD)的特点是?
随机梯度下降(SGD)相比批量梯度下降的主要优势是?
Mini-batch(小批量)梯度下降为何成为深度学习最常用方法?
面试经典题
共 4 题 · 先思考再看答案
请对比批量梯度下降、随机梯度下降和小批量梯度下降。
为什么 SGD 的随机性(噪声)反而有助于找到更好的解?
梯度下降在非凸优化中可能遇到哪些问题?如何缓解?
学习率衰减有哪些常见策略?为什么要衰减?
💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺