知了AI学习平台Logo知了
算法动画 · 梯度

策略梯度动画

展示策略梯度方法如何直接优化策略网络参数,通过上升梯度最大化期望回报。

Policy Gradient (REINFORCE)

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
未激活·当前高亮(5 个元素)
1

策略梯度直接参数化策略 π_θ(a|s),不通过值函数间接推导,适合连续动作空间。

第 1 步 / 共 714%
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

💡
概念

策略梯度有一个著名的"高方差"问题:同一个策略在不同 episode 中可能得到差异巨大的回报(如下棋有时赢 10 步有时输 10 步)。REINFORCE 算法的梯度估计方差大到几乎无法训练。引入"基线"(baseline)是降方差的关键技巧——从回报中减去状态值函数 V(s),得到"优势函数" A(s,a) = Q(s,a) - V(s)。这个减法不改变梯度的期望(因为基线不依赖动作),但能把方差降低一个数量级。PPO、A3C 等现代算法都建立在优势函数的基础上。

来源:Williams, "Simple statistical gradient-following algorithms for connectionist reinforcement learning", 1992

一句话总结
💡

策略梯度方法直接参数化策略函数,通过对累积奖励的期望求梯度来优化策略参数。

常见误区

这些坑别踩

✗

误区 1

策略梯度方法一定比值函数方法好。

✓

正确理解

策略梯度适合连续动作空间和随机策略场景,但通常方差大、样本效率低,实践中常与值函数结合(如Actor-Critic)。

✗

误区 2

策略梯度直接优化每个动作的好坏。

✓

正确理解

策略梯度优化的是策略的期望回报,通过对数策略梯度加权回报来更新,提升好动作概率、降低差动作概率。

巩固练习

章节练习与面试准备

通过测试检验学习效果,通过面试题提升实战能力

章末测试

共 4 题 · 选择题

1

策略梯度方法的核心思想是?

2

REINFORCE 算法的策略梯度公式中,梯度方向与什么成正比?

3

相比确定性策略,随机策略 π(a|s) 的优势是?

4

策略梯度中引入基线(baseline)的目的是?

面试经典题

共 5 题 · 先思考再看答案

1
困难

请推导策略梯度定理,并解释 ∇log π 的作用。

2
中等

请描述 REINFORCE 算法的流程及其优缺点。

3
中等

什么是策略梯度中的信用分配问题?如何缓解?

4
困难

on-policy 策略梯度为什么样本效率低?重要性采样如何缓解?

5
中等

策略梯度方法相比值函数方法(如 DQN)有什么优劣?

💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺