🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
⚖️
学习率的自适应AdaGrad会为每个参数累积历史梯度的平方和,频繁更新的参数学习率自动变小。但它的致命缺陷是:平方和只增不减,学习率最终会衰减到零,模型提前"罢工"。RMSProp的修复方法简单到惊人——用指数移动平均替代累积和,让学习率"有记忆但不固执"。
一句话总结
💡
AdaGrad为每个参数自适应分配学习率(频繁更新的参数学习率小),RMSProp用指数衰减平均改进了AdaGrad学习率过早衰减的问题。
常见误区
这些坑别踩
✗
误区 1
AdaGrad和RMSProp完全一样。
✓
正确理解
AdaGrad累积所有历史梯度平方导致学习率单调递减最终趋于0,RMSProp用指数移动平均只关注近期梯度,解决了学习率衰减过快问题。
✗
误区 2
自适应学习率意味着完全不用调学习率。
✓
正确理解
自适应方法仍需设置基础学习率,只是为每个参数做了缩放,基础学习率过大或过小仍会影响训练效果。
巩固练习
章节练习与面试准备
通过测试检验学习效果,通过面试题提升实战能力
章末测试
共 4 题 · 选择题
1
AdaGrad 的核心思想是?
2
AdaGrad 的主要缺陷是?
3
RMSProp 如何改进 AdaGrad?
4
RMSProp 中衰减系数 β(rho)的作用是?
面试经典题
共 4 题 · 先思考再看答案
1
基础
请解释 AdaGrad 的原理及其适用场景。
2
中等
RMSProp 是如何解决 AdaGrad 学习率衰减过快问题的?
3
困难
自适应学习率优化器(AdaGrad/RMSProp/Adam)相比 SGD 的优缺点是什么?
4
中等
Adam 优化器是如何结合动量和 RMSProp 的?请写出其更新步骤。
💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺