知了AI学习平台Logo知了
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

⚖️
学习率的自适应

AdaGrad会为每个参数累积历史梯度的平方和,频繁更新的参数学习率自动变小。但它的致命缺陷是:平方和只增不减,学习率最终会衰减到零,模型提前"罢工"。RMSProp的修复方法简单到惊人——用指数移动平均替代累积和,让学习率"有记忆但不固执"。

一句话总结
💡

AdaGrad为每个参数自适应分配学习率(频繁更新的参数学习率小),RMSProp用指数衰减平均改进了AdaGrad学习率过早衰减的问题。

常见误区

这些坑别踩

✗

误区 1

AdaGrad和RMSProp完全一样。

✓

正确理解

AdaGrad累积所有历史梯度平方导致学习率单调递减最终趋于0,RMSProp用指数移动平均只关注近期梯度,解决了学习率衰减过快问题。

✗

误区 2

自适应学习率意味着完全不用调学习率。

✓

正确理解

自适应方法仍需设置基础学习率,只是为每个参数做了缩放,基础学习率过大或过小仍会影响训练效果。

巩固练习

章节练习与面试准备

通过测试检验学习效果,通过面试题提升实战能力

章末测试

共 4 题 · 选择题

1

AdaGrad 的核心思想是?

2

AdaGrad 的主要缺陷是?

3

RMSProp 如何改进 AdaGrad?

4

RMSProp 中衰减系数 β(rho)的作用是?

面试经典题

共 4 题 · 先思考再看答案

1
基础

请解释 AdaGrad 的原理及其适用场景。

2
中等

RMSProp 是如何解决 AdaGrad 学习率衰减过快问题的?

3
困难

自适应学习率优化器(AdaGrad/RMSProp/Adam)相比 SGD 的优缺点是什么?

4
中等

Adam 优化器是如何结合动量和 RMSProp 的?请写出其更新步骤。

💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺