Actor-Critic 动画
展示 Actor-Critic 架构如何结合策略梯度和值函数估计,实现稳定高效的强化学习。
Actor-Critic
Actor-Critic 结合了策略方法(Actor)和价值方法(Critic)两种 RL 范式,双网络协同工作。
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
Actor-Critic 的名字来自戏剧:Actor 是"演员",负责表演(选动作);Critic 是"评论家",负责打分(评估动作好坏)。两者的训练目标不同:Actor 最大化累积奖励,Critic 最小化评估误差。PPO (Proximal Policy Optimization) 是 Actor-Critic 家族中最成功的算法,它用"裁剪"机制限制策略更新幅度——每步更新不超过旧策略的 ±20%,防止"一步走太远"导致崩溃。OpenAI 用 PPO 训练了 ChatGPT 的 RLHF 阶段,让模型从"胡言乱语"变成"有用助手"。
来源:Schulman et al., "Proximal Policy Optimization Algorithms", 2017
Actor-Critic结合策略梯度和值函数,Actor更新策略、Critic评估策略,PPO通过裁剪机制稳定策略更新。
这些坑别踩
误区 1
Actor和Critic是同一个网络做两件事。
正确理解
Actor和Critic可以是两个独立的网络(或共享部分参数),Actor负责输出动作,Critic负责评估状态价值,职责不同。
误区 2
PPO就是普通的策略梯度算法。
正确理解
PPO通过裁剪目标函数限制策略更新幅度,避免破坏性的大步更新,比普通策略梯度更稳定,是目前最广泛使用的策略优化算法之一。
章节练习与面试准备
通过测试检验学习效果,通过面试题提升实战能力
章末测试
共 4 题 · 选择题
Actor-Critic 架构中,Actor 和 Critic 分别负责?
优势函数 A(s,a)=Q(s,a)-V(s) 的作用是?
PPO 算法中 clip 操作的目的是?
关于 PPO 的特点,下列说法正确的是?
面试经典题
共 5 题 · 先思考再看答案
请解释 Actor-Critic 框架,并说明它如何结合值函数与策略方法。
请详细说明 PPO 算法的原理,包括 clip 目标与 GAE。
A2C/A3C、PPO、TRPO 之间有什么联系与区别?
PPO 相比 SAC、TD3 等 off-policy 算法有什么优劣?
什么是熵正则化(entropy regularization)?它在 Actor-Critic 中有什么作用?
💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺