WorldDiT 开源:399M 参数的世界-动作扩散模型
WorldDiT 是一个 399M 参数的扩散 Transformer,统一世界建模与连续动作生成,在 LIBERO 四…
WorldDiT 是一个面向机器人模拟任务的统一扩散 Transformer 骨干网络,将连续动作生成与未来 RGB patch 预测耦合在同一条主干中。作者以「bageldotcom」名义在 Hacker News 发布 Show HN,并同步在 Hugging Face 开源了模型权重、推理运行时与评测脚本。整套方案以 LIBERO 基准为评估场景,提供四个 suite 的 checkpoint。
模型规模与基准成绩
WorldDiT 总参数 3.99 亿,可训练参数约 1.35 亿。在 LIBERO 的四套基准上,官方报告的平均成功率为 94.9%(2000 个 episode 中 1898 个成功),分项成绩为:
- Spatial:98.0%
- Object:97.0%
- Goal:92.8%
- Long:91.8%
作者声称,在已发表、拥有完整四 suite 平均成绩的方法中,WorldDiT 落在「总参数 vs. 平均成功率」的 Pareto 前沿上。需要注意的是,由于不同方法采用的评估协议不同,该图只汇总了公开结果,并非在同一协议下的直接对比。
架构与推理流程
WorldDiT 以扩散 Transformer 为骨干,将最近三步观测(包含主视角与腕部相机图像、机械臂状态)以及一条语言指令作为条件:
- 训练时,骨干同时学习一个 7 步动作 chunk 以及一个辅助的未来归一化 RGB patch 目标。
- 部署时,RGB patch 词元与 RGB 预测头被排除在推理图外,仅将编码后的历史作为条件注入动作速度场。
- 推理经过 20 步 flow 采样后,控制器执行 chunk 中的前 3 个动作,然后更新观测窗口并重新规划。
这一设计把算力集中在动作生成上,RGB 预测只作为辅助监督信号存在。
开源仓库与复现细节
仓库结构紧凑,包含 checkpoints、推理依赖(MAE ViT-B 与 OpenAI CLIP ViT-B/32 的冻结权重)、inference.py、eval.py 与 config.json。环境要求为 Python 3.12,并依赖 robosuite==1.4.1。官方在 8 张 RTX Pro 6000 Blackwell 上完成干净环境的复现验证,评估结果基于每 suite 500 个 episode:其中 300 个用于分阶段挑选 checkpoint,200 个与挑选集不重叠。
推理 API 接受主相机图像 [B, 3, 3, 224, 224]、腕部图像、机械臂状态以及文本词元,直接输出动作。支持 LIBERO 四套 suite 的完整评估,并可在单卡或多卡上运行,rank 0 会打印分任务成功率并写入 results.json。
适用边界与意义
从规模和方法上看,WorldDiT 更像是一份针对 LIBERO 这一具身智能基准的精细化研究发布,而不是面向通用机器人控制的通用大模型。它把「世界模型」与「动作生成」统一在同一条扩散 Transformer 上,并通过 Pareto 前沿的视角强调参数效率。对从事机器人模仿学习、扩散策略或世界建模研究的团队而言,这是一个可直接跑通的参考实现;但对更广泛的 LLM 或多模态社区而言,外溢影响有限。
