Q-Learning 表格更新动画
展示 Q-Learning 如何通过试错交互不断更新 Q 表,最终学到从起点到终点的最优路径。
Q-Learning (Tabular)
一个 4×4 网格世界:左上角是起点 S,右下角是终点 G,中间有一个陷阱格 T(踩中扣分)。
Q-Learning更新: TD误差推导
从Q函数的贝尔曼方程出发,推导时序差分(TD)目标和TD误差,得到Q-Learning的更新规则。
Q函数的贝尔曼方程
关键部分
Q值等于即时奖励 R 加上下一状态动作对的折扣Q值的期望,这是Q-Learning的理论基础。
Q-Learning 强化学习
Q-Learning 通过学习状态-动作价值函数来寻找最优策略,是值函数强化学习的经典算法。
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
Q-Learning的Q代表"Quality"(质量),衡量在某个状态采取某个动作的好坏。它的美妙之处在于"off-policy"——可以用旧策略收集的数据更新当前策略,让数据利用率远高于on-policy方法。
Q-Learning是一种off-policy的时序差分算法,通过更新Q值表学习最优动作值函数。
这些坑别踩
误区 1
Q-Learning和SARSA是一样的。
正确理解
Q-Learning是off-policy,用max更新目标;SARSA是on-policy,用实际执行的动作更新,两者的探索策略和行为策略关系不同。
误区 2
Q-Learning可以处理任意大的状态空间。
正确理解
表格型Q-Learning受限于状态空间大小,状态过多时无法存储所有Q值,需要用函数逼近(如DQN)来泛化。
章节练习与面试准备
通过测试检验学习效果,通过面试题提升实战能力
章末测试
共 4 题 · 选择题
Q-Learning 算法的特点是?
Q-Learning 的更新公式是?
ε-greedy 策略的作用是?
Q-Learning 收敛到最优 Q 值需要满足的条件包括?
面试经典题
共 5 题 · 先思考再看答案
请详细描述 Q-Learning 算法的完整流程,并解释其为何是 off-policy。
请对比 Q-Learning 和 SARSA 的区别。
什么是时序差分(TD)学习?它相比蒙特卡洛有什么优势?
Q-Learning 表格法为什么在大状态空间失效?如何解决?
Q-Learning 中的过估计(overestimation)偏差是什么?Double Q-Learning 如何解决?
💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺