知了AI学习平台Logo知了
公式推导

贝尔曼方程: 从MDP到值函数

从马尔可夫决策过程出发,定义状态值函数和动作值函数,推导贝尔曼方程及其最优形式。

第 1 / 617%
1

马尔可夫决策过程 (MDP)

M=(S,A,P,R,γ)\mathcal{M} = (\mathcal{S}, \mathcal{A}, P, R, \gamma)
👉

关键部分

(S,A,P,R,γ)(\mathcal{S}, \mathcal{A}, P, R, \gamma)

MDP由状态集 \mathcal{S}、动作集 \mathcal{A}、转移概率 P、奖励函数 R 和折扣因子 \gamma 组成,满足马尔可夫性。

🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

📜
历史

贝尔曼方程是强化学习的"基本定律",由动态规划之父 Richard Bellman 在 1957 年提出。它把一个"长远问题"递归分解为"当前一步 + 剩余问题":V(s) = R + γV(s')。这个看似简单的递推关系蕴含着深刻的哲学——长远价值等于即时奖励加上"未来状态的折现价值"。Q-learning 的天才之处在于用"最大化"替代了贝尔曼方程中的"期望"——它不假设知道状态转移概率,而是通过经验采样来估计。这正是"无模型"强化学习的根基。

来源:Bellman, "Dynamic Programming", 1957

一句话总结
💡

值函数评估状态或状态-动作的长期累积奖励期望,贝尔曼方程给出值函数的递归分解关系。

常见误区

这些坑别踩

✗

误区 1

值函数就是当前状态下获得的即时奖励。

✓

正确理解

值函数衡量的是从当前状态出发的长期累积奖励期望(包含未来奖励),而非仅即时奖励,这是强化学习关注长期回报的关键。

✗

误区 2

贝尔曼方程只能用于求解,无法用于计算。

✓

正确理解

贝尔曼方程既可精确求解(如动态规划),也是值迭代、Q-Learning等算法的理论基础,通过迭代逼近求解。

巩固练习

章节练习与面试准备

通过测试检验学习效果,通过面试题提升实战能力

章末测试

共 4 题 · 选择题

1

状态价值函数 Vπ(s) 的定义是?

2

动作价值函数 Qπ(s,a) 的含义是?

3

Vπ(s) 的贝尔曼方程(期望形式)是?

4

关于最优价值函数,下列说法正确的是?

面试经典题

共 5 题 · 先思考再看答案

1
基础

请解释状态价值函数 V 和动作价值函数 Q 的区别与联系。

2
中等

什么是贝尔曼方程?请写出 V 和 Q 的贝尔曼方程并解释其递归含义。

3
困难

什么是贝尔曼最优方程?它为什么是非线性的?如何求解?

4
中等

如何评估一个策略的好坏?请说明策略评估的几种方法。

5
困难

在深度强化学习中,为什么常使用优势函数 A(s,a)=Q(s,a)-V(s)?

💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺