五大高校联合发布首份机器人三视角世界模型榜单
北大、清华、北航、上交、中科大联合发起 TriWorldBench,首个面向机器人三视角世界模型的评测榜单公布首周结果。
北京大学、清华大学、北京航空航天大学、上海交通大学、中国科学技术大学五所高校近日联合发起的 TriWorldBench Challenge,正式公布首周榜单更新结果。该榜单是首个面向机器人三视角世界模型的评测体系,旨在推动世界模型从「视觉生成」走向「世界理解」,目前已开放给全球研究团队参与。
首周榜单:三支团队占据前三
首周比赛中,CASIA-DRL 团队的 WoVR_Plus 模型、同济空间智能团队的 BetaBWM 模型、以及 Fysics AI 的 Fysiverse-Video 模型位列前三。
TriWorldBench 自发布以来,官网总访问量已破万,测评工具下载量超 200,14 支正式参赛队伍在一周内完成注册提交。三视角世界模型的竞争焦点,正从单一视图的视觉保真度,转向头部、左腕、右腕三路视角间的时空一致性与物理逻辑自洽性。
为什么需要三视角评测
传统视频生成模型的评价更多关注画面清晰度、内容匹配度与流畅度,但机器人面对的是一个动态、连续、具有物理规律的真实世界。头部摄像头提供整体环境与任务状态信息,左右腕部摄像头贴近操作区域,捕捉抓取、接触等细节。三路视角共同构成机器人对世界的完整认知。
因此,TriWorldBench 把「三个摄像头看到的是同一个世界」作为核心考察点,评估模型是否具备真实世界理解能力,而非仅仅生成「看起来真实」的视频。
评测维度与方法
TriWorldBench 包含 500 个三视角同步 episode,覆盖 50 个机器人操作任务,围绕六个维度汇总 19 项评测信号,并以 TWB-Score 作为榜单总分:
- 三视角一致性:判断机械臂状态、动作阶段、接触关系、目标物体是否相互兼容;
- 任务执行能力:判断指令执行、轨迹正确性、抓取与释放合理性;
- 物理与 3D 一致性:物体位置关系、动作变化与跨视角空间对应;
- 运动质量:从 STATE 标注识别应动与应静视角,错误状态会被扣分;
- 时序一致性:动作连贯与时间逻辑;
- 视觉质量:在任务约束下修正后的画质与美学评分。
系统并不会简单平均三路视频分数,而是把指标分配到证据最可靠的相机:头部视角用于判断全局任务进度与轨迹,左右腕部视角用于检查接触稳定性与局部几何。
不止于排名,更是一份「体检报告」
TriWorldBench 在榜单总分之外,保留了六大维度、单项指标、逐视角、head-wrist 配对和联合三视角的细粒度结果。研究团队既能比较排名,也能定位模型问题究竟出在任务、运动、画质,还是三路摄像头之间的世界状态不一致。VLM 语义评测协议在正式冻结前,会先与人类专家的打分和排序对齐,以减少评测偏差。
TriWorldBench Challenge 官方网站与 GitHub 仓库已同步开放,欢迎具身世界模型、具身智能、视频生成、多视角生成与理解方向的研究团队参与交流,持续更新的榜单将记录具身世界模型技术的演进轨迹。
