知了AI学习平台Logo知了
算法动画 · 决策树

MDP 状态转移动画

展示马尔可夫决策过程(MDP)中智能体如何通过状态转移和奖励信号进行决策。

Markov Decision Process (MDP)

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
未激活·当前高亮(6 个元素)
1

MDP 由五元组 (S, A, P, R, γ) 定义:状态集 S、动作集 A、转移概率 P、奖励函数 R、折扣因子 γ。

第 1 步 / 共 714%
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

💡
概念

马尔可夫决策过程(MDP)的核心假设是"马尔可夫性"——未来只取决于当前状态,与历史无关。这个假设在现实中几乎从不严格成立:自动驾驶的决策显然需要考虑过去几秒的路况,而非只看当前一帧。解决方案是把足够多的历史信息编码进当前状态(如用 RNN 或 Transformer 处理观察序列),让"扩展状态"近似满足马尔可夫性。MDP 的五元组 (S, A, P, R, γ) 中,γ (折扣因子) 控制智能体有多"短视"——γ=0 只看眼前一步,γ=1 看到无限远,实践中通常取 0.99。

一句话总结
💡

马尔可夫决策过程用五元组(S, A, P, R, γ)建模序列决策问题,其核心是状态转移满足马尔可夫性。

常见误区

这些坑别踩

✗

误区 1

马尔可夫性意味着未来与过去完全无关。

✓

正确理解

马尔可夫性指给定当前状态和动作后,未来转移与历史无关,当前状态已包含所有相关信息,而非说历史完全无用。

✗

误区 2

所有决策问题都能直接用MDP建模。

✓

正确理解

MDP假设状态可观测且转移有马尔可夫性,部分可观测问题需用POMDP,实际问题建模时状态设计是关键难点。

巩固练习

章节练习与面试准备

通过测试检验学习效果,通过面试题提升实战能力

章末测试

共 4 题 · 选择题

1

马尔可夫性质(Markov Property)是指?

2

马尔可夫决策过程(MDP)由哪些要素组成?

3

强化学习中折扣因子 γ 的作用是?

4

关于 MDP 的状态转移函数 P(s′|s,a),下列说法正确的是?

面试经典题

共 5 题 · 先思考再看答案

1
基础

什么是马尔可夫决策过程?它为什么是强化学习的数学基础?

2
中等

请解释马尔可夫性,并说明为什么它对强化学习算法至关重要。

3
中等

MDP 中的折扣因子 γ 如何选择?它对策略行为有什么影响?

4
困难

什么是部分可观测马尔可夫决策过程(POMDP)?它和 MDP 有何区别?

5
中等

请写出 MDP 中状态价值函数的贝尔曼方程,并解释其含义。

💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺