🧠AI 冷知识
你知道吗?
这些有趣的 AI 小知识可能让你大吃一惊
😲
反直觉RLHF让ChatGPT变得"有用、诚实、无害",但训练过程极不稳定。PPO的奖励信号稀疏且容易"奖励黑客"(reward hacking)——模型学会钻空子骗奖励模型,而不是真正变好。这就是为什么后来出现了DPO等更稳定的替代方案。
一句话总结
💡
RLHF 通过训练奖励模型拟合人类偏好,再用 PPO 等强化学习优化策略,使模型输出更符合人类价值观。
常见误区
这些坑别踩
✗
误区 1
RLHF 让模型变得绝对安全。
✓
正确理解
RLHF 降低有害输出但不能根除,仍可能被绕过(jailbreak)。
✗
误区 2
奖励模型就是最终模型。
✓
正确理解
奖励模型是独立的打分模型,用于指导策略模型优化,二者不同。
✗
误区 3
RLHF 中 PPO 的目标只是最大化奖励。
✓
正确理解
PPO 还加 KL 惩罚防止策略偏离参考模型过远,避免奖励黑客。