桃子桃子快讯
返回首页
研究论文

五大高校联合发布首份机器人三视角世界模型榜单

北大、清华、北航、上交、中科大联合发起 TriWorldBench,首个面向机器人三视角世界模型的评测榜单公布首周结果。

2026.08.11 · 周二3 分钟阅读

北京大学、清华大学、北京航空航天大学、上海交通大学、中国科学技术大学五所高校近日联合发起的 TriWorldBench Challenge,正式公布首周榜单更新结果。该榜单是首个面向机器人三视角世界模型的评测体系,旨在推动世界模型从「视觉生成」走向「世界理解」,目前已开放给全球研究团队参与。

首周榜单:三支团队占据前三

首周比赛中,CASIA-DRL 团队的 WoVR_Plus 模型、同济空间智能团队的 BetaBWM 模型、以及 Fysics AI 的 Fysiverse-Video 模型位列前三。

TriWorldBench 自发布以来,官网总访问量已破万,测评工具下载量超 200,14 支正式参赛队伍在一周内完成注册提交。三视角世界模型的竞争焦点,正从单一视图的视觉保真度,转向头部、左腕、右腕三路视角间的时空一致性与物理逻辑自洽性。

为什么需要三视角评测

传统视频生成模型的评价更多关注画面清晰度、内容匹配度与流畅度,但机器人面对的是一个动态、连续、具有物理规律的真实世界。头部摄像头提供整体环境与任务状态信息,左右腕部摄像头贴近操作区域,捕捉抓取、接触等细节。三路视角共同构成机器人对世界的完整认知。

因此,TriWorldBench 把「三个摄像头看到的是同一个世界」作为核心考察点,评估模型是否具备真实世界理解能力,而非仅仅生成「看起来真实」的视频。

评测维度与方法

TriWorldBench 包含 500 个三视角同步 episode,覆盖 50 个机器人操作任务,围绕六个维度汇总 19 项评测信号,并以 TWB-Score 作为榜单总分:

  • 三视角一致性:判断机械臂状态、动作阶段、接触关系、目标物体是否相互兼容;
  • 任务执行能力:判断指令执行、轨迹正确性、抓取与释放合理性;
  • 物理与 3D 一致性:物体位置关系、动作变化与跨视角空间对应;
  • 运动质量:从 STATE 标注识别应动与应静视角,错误状态会被扣分;
  • 时序一致性:动作连贯与时间逻辑;
  • 视觉质量:在任务约束下修正后的画质与美学评分。

系统并不会简单平均三路视频分数,而是把指标分配到证据最可靠的相机:头部视角用于判断全局任务进度与轨迹,左右腕部视角用于检查接触稳定性与局部几何。

不止于排名,更是一份「体检报告」

TriWorldBench 在榜单总分之外,保留了六大维度、单项指标、逐视角、head-wrist 配对和联合三视角的细粒度结果。研究团队既能比较排名,也能定位模型问题究竟出在任务、运动、画质,还是三路摄像头之间的世界状态不一致。VLM 语义评测协议在正式冻结前,会先与人类专家的打分和排序对齐,以减少评测偏差。

TriWorldBench Challenge 官方网站与 GitHub 仓库已同步开放,欢迎具身世界模型、具身智能、视频生成、多视角生成与理解方向的研究团队参与交流,持续更新的榜单将记录具身世界模型技术的演进轨迹。

信源