训练世界模型的物体恒存能力:WROP 基准与 16B 模型 PWM-WROP
研究者构建 150 项认知科学任务的 WROP 数据集,训练 16B 视频世界模型 PWM-WROP,在盲测 Elo 评…
一项来自 arXiv 的研究探讨了视频生成世界模型是否具备人类式的「物体恒存」认知先验,并尝试通过专门设计的核心认知数据集来训练这一能力。研究团队发布了名为 WROP(World Reasoning with Object Permanence)的数据基础设施,并在该基准上对 14 个视频模型进行了系统评测。
研究动机:物体恒存与物理智能
物体恒存与固体性是人类认知先验的标志性特征,也是当前世界模型研究试图复现的关键能力。近年来的视频生成模型被广泛视作世界模型的一种范式,已涌现出初步的推理能力,被认为是构建类人物理智能的潜在路径。研究团队提出两个核心问题:视频模型本身是否天然具备物体恒存能力?如果不具备,能否用受核心认知科学启发的数据集将其训练出来?
WROP 数据集与评测机制
研究团队基于认知科学文献手工设计了 150 项任务,覆盖六个认知类别:
- 物体恒存(object permanence)
- 固体性(solidity)
- 遮挡推理
- 物体连续性
- 容器与支撑
- 形状守恒
为避免数据集对特定视觉风格过拟合,团队在 Blender 中为每项任务构建了生成器,并对速度、光照、相机角度等干扰参数进行随机化,同时保留每项任务的认知结构,使得每项任务可获得 10,000+ 样本。最终发布的训练语料为 150 万样本,并配套一份包含 300 道问题的考核试卷。
评测结果与 PWM-WROP 模型
研究团队在 WROP 上评测了 14 个视频模型,涵盖三类范式:
- 3 个参考生视频(reference-to-video)模型
- 7 个视频编辑(edit)模型
- 4 个续生(continuation)模型
其中,研究团队自研的 PWM-WROP 为 16B 参数的世界模型。在盲测 pairwise Elo 研究中,PWM-WROP 在续生类模型中排名第一,综合排名位列第三,仅次于两个参考生视频模型之间无显著差异的统计并列。团队同时开源了训练语料、考试题、模型回答、得分、权重,以及基于 PyTorch 原生实现、可在 AWS Trainium2 上运行的训练栈 PWM。
意义与局限
该工作展示了通过核心认知数据训练世界模型的可行性,并提供了一个可复现的评测基准。但作为 arXiv 预印本,研究尚未经过同行评审,且评测模型中既包含开源模型也包含闭源模型,对比口径的统一性有待进一步验证。其结论能否迁移到更大规模或更通用的视频模型,仍需后续工作检验。
