知了AI学习平台Logo知了
🧠AI 冷知识

你知道吗?

这些有趣的 AI 小知识可能让你大吃一惊

💤
Dreamer系列

Dreamer算法字面意义上就在"做梦"——它在自己学到的世界模型中模拟未来的场景来练习技能,就像运动员在比赛前在脑中反复演练动作。这种"梦中学习"让它的样本效率比传统RL高出上百倍。

一句话总结
💡

Dreamer 在隐空间世界模型中通过想象(rollout)训练 actor-critic 策略,实现高效基于模型的强化学习。

常见误区

这些坑别踩

✗

误区 1

Dreamer 在真实环境中试错训练。

✓

正确理解

Dreamer 主要在世界模型想象中训练策略,大幅减少真实交互。

✗

误区 2

想象训练的策略一定能在真实环境生效。

✓

正确理解

世界模型偏差会导致策略迁移误差,需提升模型准确度。

✗

误区 3

Dreamer 不需要奖励信号。

✓

正确理解

它仍需奖励定义,只是用世界模型想象奖励而非每步真环境奖励。