策略梯度动画
展示策略梯度方法如何直接优化策略网络参数,通过上升梯度最大化期望回报。
Policy Gradient (REINFORCE)
策略梯度直接参数化策略 π_θ(a|s),不通过值函数间接推导,适合连续动作空间。
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
策略梯度有一个著名的"高方差"问题:同一个策略在不同 episode 中可能得到差异巨大的回报(如下棋有时赢 10 步有时输 10 步)。REINFORCE 算法的梯度估计方差大到几乎无法训练。引入"基线"(baseline)是降方差的关键技巧——从回报中减去状态值函数 V(s),得到"优势函数" A(s,a) = Q(s,a) - V(s)。这个减法不改变梯度的期望(因为基线不依赖动作),但能把方差降低一个数量级。PPO、A3C 等现代算法都建立在优势函数的基础上。
来源:Williams, "Simple statistical gradient-following algorithms for connectionist reinforcement learning", 1992
策略梯度方法直接参数化策略函数,通过对累积奖励的期望求梯度来优化策略参数。
这些坑别踩
误区 1
策略梯度方法一定比值函数方法好。
正确理解
策略梯度适合连续动作空间和随机策略场景,但通常方差大、样本效率低,实践中常与值函数结合(如Actor-Critic)。
误区 2
策略梯度直接优化每个动作的好坏。
正确理解
策略梯度优化的是策略的期望回报,通过对数策略梯度加权回报来更新,提升好动作概率、降低差动作概率。
章节练习与面试准备
通过测试检验学习效果,通过面试题提升实战能力
章末测试
共 4 题 · 选择题
策略梯度方法的核心思想是?
REINFORCE 算法的策略梯度公式中,梯度方向与什么成正比?
相比确定性策略,随机策略 π(a|s) 的优势是?
策略梯度中引入基线(baseline)的目的是?
面试经典题
共 5 题 · 先思考再看答案
请推导策略梯度定理,并解释 ∇log π 的作用。
请描述 REINFORCE 算法的流程及其优缺点。
什么是策略梯度中的信用分配问题?如何缓解?
on-policy 策略梯度为什么样本效率低?重要性采样如何缓解?
策略梯度方法相比值函数方法(如 DQN)有什么优劣?
💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺