知了AI学习平台Logo知了
算法动画 · 决策树

Q-Learning 表格更新动画

展示 Q-Learning 如何通过试错交互不断更新 Q 表,最终学到从起点到终点的最优路径。

Q-Learning (Tabular)

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
未激活·当前高亮(6 个元素)
1

一个 4×4 网格世界:左上角是起点 S,右下角是终点 G,中间有一个陷阱格 T(踩中扣分)。

第 1 步 / 共 714%
公式推导

Q-Learning更新: TD误差推导

从Q函数的贝尔曼方程出发,推导时序差分(TD)目标和TD误差,得到Q-Learning的更新规则。

第 1 / 617%
1

Q函数的贝尔曼方程

Qπ(s,a)=E[R+γQπ(s′,a′)∣s,a]Q^\pi(s, a) = E\left[ R + \gamma Q^\pi(s', a') \mid s, a \right]
👉

关键部分

R+γQπ(s′,a′)R + \gamma Q^\pi(s', a')

Q值等于即时奖励 R 加上下一状态动作对的折扣Q值的期望,这是Q-Learning的理论基础。

知识图谱

Q-Learning 强化学习

Q-Learning 通过学习状态-动作价值函数来寻找最优策略,是值函数强化学习的经典算法。

学习优化目标探索策略理论基础依赖于依赖于包含选择Q-Le…Q值奖励状态动作ε-gr…贝尔曼方程
核心
概念
方法
应用
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

💡
概念

Q-Learning的Q代表"Quality"(质量),衡量在某个状态采取某个动作的好坏。它的美妙之处在于"off-policy"——可以用旧策略收集的数据更新当前策略,让数据利用率远高于on-policy方法。

一句话总结
💡

Q-Learning是一种off-policy的时序差分算法,通过更新Q值表学习最优动作值函数。

常见误区

这些坑别踩

✗

误区 1

Q-Learning和SARSA是一样的。

✓

正确理解

Q-Learning是off-policy,用max更新目标;SARSA是on-policy,用实际执行的动作更新,两者的探索策略和行为策略关系不同。

✗

误区 2

Q-Learning可以处理任意大的状态空间。

✓

正确理解

表格型Q-Learning受限于状态空间大小,状态过多时无法存储所有Q值,需要用函数逼近(如DQN)来泛化。

巩固练习

章节练习与面试准备

通过测试检验学习效果,通过面试题提升实战能力

章末测试

共 4 题 · 选择题

1

Q-Learning 算法的特点是?

2

Q-Learning 的更新公式是?

3

ε-greedy 策略的作用是?

4

Q-Learning 收敛到最优 Q 值需要满足的条件包括?

面试经典题

共 5 题 · 先思考再看答案

1
中等

请详细描述 Q-Learning 算法的完整流程,并解释其为何是 off-policy。

2
中等

请对比 Q-Learning 和 SARSA 的区别。

3
基础

什么是时序差分(TD)学习?它相比蒙特卡洛有什么优势?

4
中等

Q-Learning 表格法为什么在大状态空间失效?如何解决?

5
困难

Q-Learning 中的过估计(overestimation)偏差是什么?Double Q-Learning 如何解决?

💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺