CurrentWorld-0:跨本体多视角力触觉统一的机器人世界仿真器
Current Robotics 推出交互式世界仿真器 CurrentWorld-0,首次把跨本体动作、多视角一致性与力…
Current Robotics 团队正式发布交互式世界仿真器 CurrentWorld-0,首次把跨本体动作推演、多视角一致性预测与力-触觉反馈统一进同一套系统,被视为继 Curr-0 人形全身精细操作模型之后的又一重磅工作。
团队创始人祝毅晨曾任美的集团具身智能部部长,已发表 40 余篇顶会论文,学术引用超过 5,200 次。其早期提出的 TinyVLA、DiffusionVLA、DexVLA 等工作,分别发表至 ICML、CoRL 等顶会;Physical Intelligence 的里程碑论文 π0 也引用了 TinyVLA 与 ScaleDP。
从视频生成到机器人评测的鸿沟
视频生成模型在大规模预训练后,已具备较强的视觉与运动先验:物体被遮挡不会消失,形状不会突变,运动在时间上也通常是连续的。这对视频生成是优势,却会给机器人评测带来隐患。
机器人训练数据里充斥着大量「伸手—抓住—拿起」之类的成功轨迹。当一个尚未训练好的策略把手伸偏,视频先验有时会替它把后续结果往「成功」上补:机械臂实际没抓稳,生成画面里的物体却仍然跟着手走。真实执行已经失败,世界模型给出的未来却依然顺利完成任务——评测结果由此失真。
Current Robotics 在 dWorldEval 中专门研究的,就是世界模型的「动作可控性」(action controllability):动作发生变化,世界必须跟着变;动作已经失败,模型也不能替策略把结果纠正回来。CurrentWorld-0 将这一原则作为最底层的设计约束。
跨本体、多视角与力-触觉的统一
要让世界仿真器真正服务于不同机器人评测,必须同时解决三个层面的耦合。
首先,动作接口因本体而异。固定双臂、移动升降双臂、人形机器人的动作空间完全不同,CurrentWorld-0 不规定统一动作格式,而是为每个本体保留独立的 Action Subspace,再把这些不同形式的动作继续推演下去。
其次,多视角必须保持时间一致。机器人通常同时依赖第三视角全局相机、头部相机与腕部相机,CurrentWorld-0 需要让多路画面共同记录同一次事件,物体、机器人和场景状态随操作同步推进,避免出现「第三视角看到杯子前移十几厘米、腕部相机却仍停在原处」这类漂移。
最后,力与触觉反馈必须纳入预测。夹爪位置正确不代表真的捏住了薯片,刀刃贴住黄瓜也不代表已经削下去。CurrentWorld-0 把工具何时真正受力、接触是否实际发生、抓取是否稳定等像素之外的状态,与视觉预测同步输出。
综合来看,CurrentWorld-0 试图还原的是「动作输入 → 环境响应 → 接触发生 → 物理反馈」的完整过程。
人类接管:把中间状态重新打开
真实机器人执行任务时,某个中间状态往往难以原样复现。CurrentWorld-0 内置了基于 Hi-WM(Human-in-the-World-Model)思路的接管机制:策略自主执行进入潜在失败状态时,操作员可通过遥操作接管,从当前位置继续动作;当前状态也可以保存与回滚,换一种方式在同一个节点重新尝试。
每次接管都会把后续交互重新展开,新的接触带来对应的力-触觉反馈,操作员的纠正动作也被完整记录。这些交互轨迹可进一步用于 policy post-training,使同一状态能被多次重新调用,从不同动作选择里继续探索。
殊途同归:评测环节的价值锚点
机器人本体、数据、模型与控制方式都在持续分岔,但能力最终都要回到真实世界接受检验。CurrentWorld-0 想扮演的角色,是终点前最后一道关卡:让尚未被现实检验过的策略,先在仿真里跑一遍、错一遍、改一遍,再走向部署。
路可以有一千种,而世界只有一个。
