Google DeepMind 发布 Gemini Robotics ER 2:聚焦视频理解与多机器人协作
DeepMind 推出面向机器人的具身推理模型 Gemini Robotics ER 2,在任务编排、进度追踪与多机协作…
Google DeepMind 于 7 月 30 日正式推出 Gemini Robotics ER 2,这是一款面向机器人的「具身推理」(embodied reasoning)模型,被定位为机器人的「高级大脑」。相比此前的 ER 1.6,新版本在视频理解、任务编排以及多机器人协作三个维度上实现明显升级,并已通过 Gemini API、Google AI Studio 向开发者开放,同时在 Gemini Enterprise Agent Platform 提供私有预览。
模型定位与核心能力
Gemini Robotics ER 2 强调「边思考、边执行」的工作方式:模型在持续处理视频流的同时,可以调用底层视觉-语言-动作(VLA)模型或导航 API 完成具体动作,从而避免传统方案中常见的「停下来思考」式卡顿。模型还可以原生调用 Google 搜索等工具,或由开发者自定义函数,以扩展机器人的信息获取能力。
为适配实时物理场景,Gemini Robotics ER 2 接入 Gemini Live API 的双向流式接口,针对延迟敏感任务做了优化,使高层推理与底层执行可以并行进行。DeepMind 用 Boston Dynamics 的 Spot 做了演示:通过编排 Spot 的导航与机械臂接口,机器人可响应自然语言指令去取回物品。相关示例代码已开源在 GitHub。
视频理解与任务进度判断
判断「一个任务是否已经完成」是机器人领域的核心难题之一。Gemini Robotics ER 2 在两类基础能力上取得进展:
- 连续进度分类(Progress Classification):将视频帧按完成度划分到 0–20%、20–40%、40–60%、60–80%、80–100% 五个区间,让机器人具备实时态势感知,必要时可重试失败步骤而无需重启整个工作流。该任务上 Gemini Robotics ER 2 准确率达到 57.4%,超过上一代及同档前沿模型。
- 精确关键时刻定位(Moment Finding):识别视频中关键事件发生的精确帧,例如「何时停止往杯中倒咖啡」。Gemini Robotics ER 2 在该任务上准确率达到 91.3%,平均绝对距离为 0.96 秒,在保持亚秒级延迟的同时,计算成本仅为更大体量模型的一小部分,执行速度约为后者的 4 倍。
这两项能力让机器人能够在拧灯泡、系垃圾袋等长链路任务中,准确判断是否达到规格要求再切换到下一步。
工具编排性能提升
DeepMind 在三种控制模式下评估了 Gemini Robotics ER 2 的工具编排能力,包括真实 VLA、仿真 VLA 以及人类远程操控。结果显示,新模型在所有三种模式下均稳定优于 ER 1.6。开发者可以将 VLA 模型或导航 API 声明为工具,并向模型持续流式传输多模态视频、音频或文本,构建完整的具身代理(physical agent)流程。
多机器人协作
Gemini Robotics ER 2 支持异构机器人在共享空间内协作:不同形态的机器人(例如室内轮式机器人与适合复杂地形的仿人机器人)可以通过共享的语义理解相互交接任务。DeepMind 在演示中让 Apptronik 的 Apollo 2 与 Franka 的 F3 Duo 协同完成了单一机器人难以独立完成的复杂任务流。
开发者如何上手
- 通过 Gemini API 与 Google AI Studio 公开接入 Gemini Robotics ER 2。
- Gemini Enterprise Agent Platform 开放私有预览。
- GitHub 上提供与 Boston Dynamics Spot 集成等参考示例,涵盖模型配置与提示词编写方式。
DeepMind 表示,这一版本让机器人能够在真实物理环境中更可靠地完成多步骤任务,并为构建更通用的「物理 AI」应用提供了基础组件。
