MDP 状态转移动画
展示马尔可夫决策过程(MDP)中智能体如何通过状态转移和奖励信号进行决策。
Markov Decision Process (MDP)
MDP 由五元组 (S, A, P, R, γ) 定义:状态集 S、动作集 A、转移概率 P、奖励函数 R、折扣因子 γ。
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
马尔可夫决策过程(MDP)的核心假设是"马尔可夫性"——未来只取决于当前状态,与历史无关。这个假设在现实中几乎从不严格成立:自动驾驶的决策显然需要考虑过去几秒的路况,而非只看当前一帧。解决方案是把足够多的历史信息编码进当前状态(如用 RNN 或 Transformer 处理观察序列),让"扩展状态"近似满足马尔可夫性。MDP 的五元组 (S, A, P, R, γ) 中,γ (折扣因子) 控制智能体有多"短视"——γ=0 只看眼前一步,γ=1 看到无限远,实践中通常取 0.99。
马尔可夫决策过程用五元组(S, A, P, R, γ)建模序列决策问题,其核心是状态转移满足马尔可夫性。
这些坑别踩
误区 1
马尔可夫性意味着未来与过去完全无关。
正确理解
马尔可夫性指给定当前状态和动作后,未来转移与历史无关,当前状态已包含所有相关信息,而非说历史完全无用。
误区 2
所有决策问题都能直接用MDP建模。
正确理解
MDP假设状态可观测且转移有马尔可夫性,部分可观测问题需用POMDP,实际问题建模时状态设计是关键难点。
章节练习与面试准备
通过测试检验学习效果,通过面试题提升实战能力
章末测试
共 4 题 · 选择题
马尔可夫性质(Markov Property)是指?
马尔可夫决策过程(MDP)由哪些要素组成?
强化学习中折扣因子 γ 的作用是?
关于 MDP 的状态转移函数 P(s′|s,a),下列说法正确的是?
面试经典题
共 5 题 · 先思考再看答案
什么是马尔可夫决策过程?它为什么是强化学习的数学基础?
请解释马尔可夫性,并说明为什么它对强化学习算法至关重要。
MDP 中的折扣因子 γ 如何选择?它对策略行为有什么影响?
什么是部分可观测马尔可夫决策过程(POMDP)?它和 MDP 有何区别?
请写出 MDP 中状态价值函数的贝尔曼方程,并解释其含义。
💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺