CG-World:面向世界模型的结构化大规模数据集
研究者发布 CG-World,从工业 CG 管线中抽取约 85 万段 1–5 秒的时序对齐样本,支持反事实推理与具身策略…
一项来自 arXiv 的研究介绍了 CG-World,这是一个面向世界模型(World Models)训练需求而设计的大规模世界状态数据集与配套协议。研究团队注意到,现有的视频、机器人与仿真数据集通常只能捕捉状态、动作、事件与观测中的部分维度,难以支持对联合动力学的完整建模。为弥补这一空缺,CG-World 从工业级计算机图形(CG)制作管线中提取数据,能够显式记录中间状态,包括多模态语义、空间结构、骨骼与控制器状态、运动曲线、相机与光照参数、物理缓存、接触事件以及多通道渲染结果。
数据规模与结构
CG-World v1 包含约 85 万段在时间上严格对齐的片段,每段时长 1–5 秒。数据被组织为统一的时空样本,并明确分离以下五个维度:
- 潜在状态(latent states)
- 观测(observations)
- 关系(relations)
- 事件(events)
- 分支元数据(branch metadata)
这种分层设计使得训练时能够针对不同学习目标灵活取用所需的层级。
分支谱系与反事实推理
为支持干预学习与反事实推理,CG-World 定义了一套完整的「分支谱系」(branch lineage),覆盖以下几类轨迹:
- 事实轨迹(factual trajectories)
- 观测干预(observation interventions)
- 动作干预(action interventions)
- 机制干预(mechanism interventions)
- 严格反事实分支(strict counterfactual branches)
每条分支均显式标注干预目标(intervention targets)、不变性约束(invariants)以及替代性后果(alternative outcomes),为训练可追溯、可控制的生成模型提供结构化监督信号。
评估任务与初步结果
研究团队在三个任务上对数据集进行了验证:
- 几何条件下的视频生成
- 动作预测
- 闭环视觉-语言-动作(VLA)策略迁移
结果显示,CG-World 能够在受控生成、动作建模与具身策略迁移等任务上提供可复用的结构化监督。
后续计划
作者表示将持续扩充 CG-World 并推动社区协作,目标是以此为基础构建面向世界模型、Physical AI 与具身智能的共享数据基础设施。该论文目前以 arXiv 预印本形式发布,编号 2607.26452v1。
