桃子桃子快讯
返回首页
行业动态

宇树与智元机器人共用通用大脑,10分钟零打断完成家务协作

一段流传视频显示宇树G1与智元远征A3在同一通用大脑驱动下自主规划、协同完成多项家务任务,被视为具身智能领域的重要进展。

2026.08.27 · 周四4 分钟阅读

一段时长约10分钟的视频近日在科技媒体圈流传,画面中两台来自不同厂商的人形机器人——宇树科技 G1 与智元机器人远征 A3——在约15平方米的狭小出租屋内,自主完成擦玻璃、洗衣服、收纳整理、开关冰箱、食材解冻判断等一系列家务任务,全程未出现人工指令介入或明显卡顿。这段未经官方确认的视频引发行业高度关注,被不少从业者视为具身智能领域的标志性演示。

视频中的核心能力展示

据科技媒体量子位报道,视频拍摄条件较为「原始」:场地狭小、光线不均、摄像机视角受限,且未做剪辑或分镜处理。但正是在这一接近真实家庭的环境里,两台机器人展现出多项此前公开Demo中少见的能力。

  • 长时序连续作业:10分钟内不间断执行多步骤任务,没有传统模型常见的误差累积崩溃现象。
  • 动态任务切换与状态恢复:中途闹钟响起临时插入「收纳桌面与冰箱」指令,机器人完成插入任务后,又精确恢复此前被中断的洗衣取衣流程。
  • 基于物理推理的自主决策:宇树 G1 擦玻璃时发现内侧仍有污渍,主动侧身将刮水器伸出窗外擦拭外侧;面对够不到的高处柜子,自主找到箱子并「踢」到柜子旁尝试垫高。
  • 跨品牌实时协同:智元机器人观察到宇树搬运困难后,主动将围巾挂到宇树颈部配合其操作,最终由身高更高的智元将围巾折叠放入衣柜,双方全程无语言交流。

技术路线讨论:与 VLA、WAM 的差异

行业此前主流的具身智能技术路线主要分为两类:VLA(视觉-语言-动作模型)和 WAM(世界动作模型)。

  • VLA 路线(如 RT-2、OpenVLA):直接根据图像与语言指令输出动作,依赖大量人类遥操作数据训练。优势是推理速度快、部署轻量,但本质上学习的是「画面到动作」的统计映射,不真正理解物理因果,对未见过场景泛化能力弱,且与硬件深度绑定。
  • WAM 路线:先预测执行动作后的世界画面,再反推动作。具备一定物理预判能力,但「知行割裂」问题突出——想象空间内的推演难以转化为满足真实动力学约束的关节轨迹,且推理算力开销大、实时落地难。

据该视频观察分析,演示中的模型在多个关键场景中展现出与上述两类路线不同的行为特征:对遮挡、接触、形变等场景进行实时计算而非依赖训练数据回忆;同一套模型可同时驱动宇树 G1 与智元远征 A3 两个构型差异显著的硬件平台(身高分别为1.3米和1.7米),实现了跨品牌本体的统一调度。

行业影响与待验证的问题

若该演示的技术路径最终被验证为可规模化,将对当前具身智能行业的分工模式产生深远影响:硬件厂商可能不再需要自研算法,而是专注于关节、续航与成本控制;AI 公司则专注于提升「通用大脑」的推理与泛化能力,行业有望形成「通用大脑+专业本体+场景应用」的三层分工。

值得关注的是,有未经证实的信息称该模型仅用「几十个小时」的视频数据就达到上述效果。如果属实,将对当前行业「数据越多越聪明」的 Scaling Law 叙事形成挑战,意味着对物理规则的理解可能比数据堆砌更关键。

不过,仍需保持审慎:视频中的「神秘团队」身份尚未公开,也未发布任何技术报告或论文,所有能力判断均基于视频画面的外部观察;训练数据规模、模型架构、推理硬件等关键细节均无从核实。在官方信息公布之前,这段视频更适合作为具身智能能力边界的探索性参考,而非可直接复现的技术结论。

信源