桃子桃子快讯
返回首页
研究论文

DreamerV3 持续学习研究:世界模型记住,行动者遗忘

一项预注册实验研究表明,DreamerV3 类智能体在任务序列中遗忘源于行动者而非世界模型,分级梦境复演可在零环境交互下…

2026.07.24 · 周五3 分钟阅读

一项围绕 DreamerV3 类模型强化学习智能体的预注册实验研究,对「持续强化学习中究竟哪个组件在遗忘」这一被默认接受却从未被量化的问题进行了拆解。研究发现,在「永不清理回放缓冲」的设定下,世界模型几乎完整保留了对旧任务的可观测记忆,而遗忘实际上发生在行动者层面。更具实践意义的是,作者提出了一种「分级梦境复演」(graded dream rehearsal)机制,无需任务标签、参数保持恒定,即可在四任务链与八任务链的连续训练中实现 3/3 全部保留,而普通的回放基线在四任务链上为 0/3。

核心发现:遗忘是「通道问题」而非「记忆问题」

研究者在 DreamerV3 系列智能体上做了一组组件级探针实验(全程 n=3 种子)。在无穷回放设定下:

  • 世界模型对旧任务的奖励判别保留率接近 1.0,价值估计与终止结构同样可测量。
  • 行动者的行为策略则在任务切换后显著坍塌。

这意味着在世界模型完整保留经验的前提下,从「想象回放」中继续做强化学习,行动者仍会丢失旧技能——干预实验显示 0/3 种子能恢复该技能。

分级梦境复演:零环境交互的自模仿

针对上述定位,作者提出了一个关键干预:

  • 冻结世界模型,使用同一份想象轨迹,将强化学习替换为对世界模型自身「分级梦境」进行监督式自模仿学习。
  • 该方法在 3/3 种子上恢复了已丢失的技能,全程不与环境交互。
  • 训练中按固定节奏穿插执行,便得到一个「无任务标签、参数量不变」的持续学习器。

实验数据与统计显著性

论文给出的对比结果包括:

  • 四任务链:分级梦境复演 3/3 通过,普通回放 0/3 通过。
  • 八任务链:分级梦境复演 3/3 通过,同样优于匹配的「真实回合克隆」基线。
  • 与真实回合克隆的配对差值为 +0.13,自举 95% 置信区间为 [0.07, 0.24],所有种子完全分离。

「梦境打分」步骤不可省略

作者特别强调梦境分级环节是承重步骤,并刻画了两类打分校准失败模式,给出了可离线选档的检验方法(offline selection gauge),可在污染最终结果前识别并纠正,同时提出一条「已实现优先」(realized-first)打分规则来同时关上这两类失败。所有实验均经过预注册协议承诺,每一条被推翻的假设均被报告。

适用范围与局限

研究对象限定在 DreamerV3 家族智能体与无穷回放设定下,种子数为 3,仅覆盖世界模型类方法。该方法在依赖显式任务标签或真实环境交互的传统持续学习范式中的迁移效果尚待进一步验证。论文同时提供了代码、预注册记录与运行数据以便复现。

信源