知了AI学习平台Logo知了
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

😲
反直觉

RLHF让ChatGPT变得"有用、诚实、无害",但训练过程极不稳定。PPO的奖励信号稀疏且容易"奖励黑客"(reward hacking)——模型学会钻空子骗奖励模型,而不是真正变好。这就是为什么后来出现了DPO等更稳定的替代方案。

一句话总结
💡

RLHF 通过训练奖励模型拟合人类偏好,再用 PPO 等强化学习优化策略,使模型输出更符合人类价值观。

常见误区

这些坑别踩

✗

误区 1

RLHF 让模型变得绝对安全。

✓

正确理解

RLHF 降低有害输出但不能根除,仍可能被绕过(jailbreak)。

✗

误区 2

奖励模型就是最终模型。

✓

正确理解

奖励模型是独立的打分模型,用于指导策略模型优化,二者不同。

✗

误区 3

RLHF 中 PPO 的目标只是最大化奖励。

✓

正确理解

PPO 还加 KL 惩罚防止策略偏离参考模型过远,避免奖励黑客。