桃子桃子快讯
返回首页
开源

150 美元从零训练 1.57B 参数世界模型

研究者用不到 150 美元、基于 Procgen 数据,从零复现 1.57B 参数 Dreamer 4 世界模型并开源代…

2026.08.24 · 周一2 分钟阅读

一名开发者在 Reddit r/LocalLLaMA 社区分享了自己的最新尝试:基于 Dreamer 4 架构,从零训练了一个 1.57B 参数的世界模型,总成本不到 150 美元,并已开源训练代码与可交互 Demo。

首次尝试与失败

作者最初尝试在 Genie 架构上搭建世界模型,生成视频质量尚可,但交互控制几乎失效——按键操作对画面几乎没有影响。他分析原因在于 Genie 的动作被无监督压缩成 8 个离散码,这种粒度对动作响应来说过于粗糙,因此决定转向 Dreamer 4 重新开始。

第二轮方案的关键指标

第二轮基于 Dreamer 4 的训练取得了明显进展,主要指标如下:

  • Tokenizer 重建质量:PSNR 40.41(作为对比,Genie 论文报告为 35.7)
  • 端到端 FVD:32.19
  • 动作可控的连续帧长度:在失控前可维持 144 帧
  • 模型规模:1.57B 参数
  • 训练数据:9.6M 帧
  • 总成本:约 150 美元

数据策略:Procgen 而非爬取视频

作者在文中强调了两点关键经验。其一是数据来源:与多数世界模型研究爬取互联网视频不同,他们使用 Procgen 程序化生成每一帧画面,并在每个时间步都能获得真实的动作标签,从而可以真正检验模型是否在响应用户输入,而不是仅生成看起来合理的运动。其二是成本:150 美元的训练预算足以完成一次完整的世界模型训练实验,意味着前沿研究所需的资源门槛正在快速下降,作者认为这一点尚未被业界充分意识到。

开源与可复现

作者公开了交互式 Demo 网站以及完整的训练代码仓库,便于其他研究者复现或继续推进。下一步工作可能包括扩大数据规模、延长可控序列长度,以及在更多样化的环境中验证动作跟随能力。

信源