桃子桃子快讯
返回首页
模型发布

Google DeepMind 发布 Gemini Robotics ER 2:聚焦视频理解与多机器人协作

DeepMind 推出面向机器人的具身推理模型 Gemini Robotics ER 2,在任务编排、进度追踪与多机协作…

2026.07.30 · 周四4 分钟阅读

Google DeepMind 于 7 月 30 日正式推出 Gemini Robotics ER 2,这是一款面向机器人的「具身推理」(embodied reasoning)模型,被定位为机器人的「高级大脑」。相比此前的 ER 1.6,新版本在视频理解、任务编排以及多机器人协作三个维度上实现明显升级,并已通过 Gemini API、Google AI Studio 向开发者开放,同时在 Gemini Enterprise Agent Platform 提供私有预览。

模型定位与核心能力

Gemini Robotics ER 2 强调「边思考、边执行」的工作方式:模型在持续处理视频流的同时,可以调用底层视觉-语言-动作(VLA)模型或导航 API 完成具体动作,从而避免传统方案中常见的「停下来思考」式卡顿。模型还可以原生调用 Google 搜索等工具,或由开发者自定义函数,以扩展机器人的信息获取能力。

为适配实时物理场景,Gemini Robotics ER 2 接入 Gemini Live API 的双向流式接口,针对延迟敏感任务做了优化,使高层推理与底层执行可以并行进行。DeepMind 用 Boston Dynamics 的 Spot 做了演示:通过编排 Spot 的导航与机械臂接口,机器人可响应自然语言指令去取回物品。相关示例代码已开源在 GitHub。

视频理解与任务进度判断

判断「一个任务是否已经完成」是机器人领域的核心难题之一。Gemini Robotics ER 2 在两类基础能力上取得进展:

  • 连续进度分类(Progress Classification):将视频帧按完成度划分到 0–20%、20–40%、40–60%、60–80%、80–100% 五个区间,让机器人具备实时态势感知,必要时可重试失败步骤而无需重启整个工作流。该任务上 Gemini Robotics ER 2 准确率达到 57.4%,超过上一代及同档前沿模型。
  • 精确关键时刻定位(Moment Finding):识别视频中关键事件发生的精确帧,例如「何时停止往杯中倒咖啡」。Gemini Robotics ER 2 在该任务上准确率达到 91.3%,平均绝对距离为 0.96 秒,在保持亚秒级延迟的同时,计算成本仅为更大体量模型的一小部分,执行速度约为后者的 4 倍。

这两项能力让机器人能够在拧灯泡、系垃圾袋等长链路任务中,准确判断是否达到规格要求再切换到下一步。

工具编排性能提升

DeepMind 在三种控制模式下评估了 Gemini Robotics ER 2 的工具编排能力,包括真实 VLA、仿真 VLA 以及人类远程操控。结果显示,新模型在所有三种模式下均稳定优于 ER 1.6。开发者可以将 VLA 模型或导航 API 声明为工具,并向模型持续流式传输多模态视频、音频或文本,构建完整的具身代理(physical agent)流程。

多机器人协作

Gemini Robotics ER 2 支持异构机器人在共享空间内协作:不同形态的机器人(例如室内轮式机器人与适合复杂地形的仿人机器人)可以通过共享的语义理解相互交接任务。DeepMind 在演示中让 Apptronik 的 Apollo 2 与 Franka 的 F3 Duo 协同完成了单一机器人难以独立完成的复杂任务流。

开发者如何上手

  • 通过 Gemini API 与 Google AI Studio 公开接入 Gemini Robotics ER 2。
  • Gemini Enterprise Agent Platform 开放私有预览。
  • GitHub 上提供与 Boston Dynamics Spot 集成等参考示例,涵盖模型配置与提示词编写方式。

DeepMind 表示,这一版本让机器人能够在真实物理环境中更可靠地完成多步骤任务,并为构建更通用的「物理 AI」应用提供了基础组件。

信源