知了AI学习平台Logo知了
算法动画 · 神经网络

Actor-Critic 动画

展示 Actor-Critic 架构如何结合策略梯度和值函数估计,实现稳定高效的强化学习。

Actor-Critic

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
未激活·当前高亮(4 个元素)
1

Actor-Critic 结合了策略方法(Actor)和价值方法(Critic)两种 RL 范式,双网络协同工作。

第 1 步 / 共 714%
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

📜
历史

Actor-Critic 的名字来自戏剧:Actor 是"演员",负责表演(选动作);Critic 是"评论家",负责打分(评估动作好坏)。两者的训练目标不同:Actor 最大化累积奖励,Critic 最小化评估误差。PPO (Proximal Policy Optimization) 是 Actor-Critic 家族中最成功的算法,它用"裁剪"机制限制策略更新幅度——每步更新不超过旧策略的 ±20%,防止"一步走太远"导致崩溃。OpenAI 用 PPO 训练了 ChatGPT 的 RLHF 阶段,让模型从"胡言乱语"变成"有用助手"。

来源:Schulman et al., "Proximal Policy Optimization Algorithms", 2017

一句话总结
💡

Actor-Critic结合策略梯度和值函数,Actor更新策略、Critic评估策略,PPO通过裁剪机制稳定策略更新。

常见误区

这些坑别踩

✗

误区 1

Actor和Critic是同一个网络做两件事。

✓

正确理解

Actor和Critic可以是两个独立的网络(或共享部分参数),Actor负责输出动作,Critic负责评估状态价值,职责不同。

✗

误区 2

PPO就是普通的策略梯度算法。

✓

正确理解

PPO通过裁剪目标函数限制策略更新幅度,避免破坏性的大步更新,比普通策略梯度更稳定,是目前最广泛使用的策略优化算法之一。

巩固练习

章节练习与面试准备

通过测试检验学习效果,通过面试题提升实战能力

章末测试

共 4 题 · 选择题

1

Actor-Critic 架构中,Actor 和 Critic 分别负责?

2

优势函数 A(s,a)=Q(s,a)-V(s) 的作用是?

3

PPO 算法中 clip 操作的目的是?

4

关于 PPO 的特点,下列说法正确的是?

面试经典题

共 5 题 · 先思考再看答案

1
中等

请解释 Actor-Critic 框架,并说明它如何结合值函数与策略方法。

2
困难

请详细说明 PPO 算法的原理,包括 clip 目标与 GAE。

3
中等

A2C/A3C、PPO、TRPO 之间有什么联系与区别?

4
困难

PPO 相比 SAC、TD3 等 off-policy 算法有什么优劣?

5
中等

什么是熵正则化(entropy regularization)?它在 Actor-Critic 中有什么作用?

💡 建议:先独立思考并组织语言,再对照参考答案查漏补缺