贝尔曼方程: 从MDP到值函数
从马尔可夫决策过程出发,定义状态值函数和动作值函数,推导贝尔曼方程及其最优形式。
马尔可夫决策过程 (MDP)
关键部分
MDP由状态集 \mathcal{S}、动作集 \mathcal{A}、转移概率 P、奖励函数 R 和折扣因子 \gamma 组成,满足马尔可夫性。
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
贝尔曼方程是强化学习的"基本定律",由动态规划之父 Richard Bellman 在 1957 年提出。它把一个"长远问题"递归分解为"当前一步 + 剩余问题":V(s) = R + γV(s')。这个看似简单的递推关系蕴含着深刻的哲学——长远价值等于即时奖励加上"未来状态的折现价值"。Q-learning 的天才之处在于用"最大化"替代了贝尔曼方程中的"期望"——它不假设知道状态转移概率,而是通过经验采样来估计。这正是"无模型"强化学习的根基。
来源:Bellman, "Dynamic Programming", 1957
值函数评估状态或状态-动作的长期累积奖励期望,贝尔曼方程给出值函数的递归分解关系。
这些坑别踩
误区 1
值函数就是当前状态下获得的即时奖励。
正确理解
值函数衡量的是从当前状态出发的长期累积奖励期望(包含未来奖励),而非仅即时奖励,这是强化学习关注长期回报的关键。
误区 2
贝尔曼方程只能用于求解,无法用于计算。
正确理解
贝尔曼方程既可精确求解(如动态规划),也是值迭代、Q-Learning等算法的理论基础,通过迭代逼近求解。
章节练习与面试准备
通过测试检验学习效果,通过面试题提升实战能力
章末测试
共 4 题 · 选择题
状态价值函数 Vπ(s) 的定义是?
动作价值函数 Qπ(s,a) 的含义是?
Vπ(s) 的贝尔曼方程(期望形式)是?
关于最优价值函数,下列说法正确的是?
面试经典题
共 5 题 · 先思考再看答案
请解释状态价值函数 V 和动作价值函数 Q 的区别与联系。
什么是贝尔曼方程?请写出 V 和 Q 的贝尔曼方程并解释其递归含义。
什么是贝尔曼最优方程?它为什么是非线性的?如何求解?
如何评估一个策略的好坏?请说明策略评估的几种方法。
在深度强化学习中,为什么常使用优势函数 A(s,a)=Q(s,a)-V(s)?
💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺