桃子桃子快讯
返回首页
模型发布

Google 发布 Gemini Robotics ER 2 具身推理模型

Google 推出 Gemini Robotics ER 2,支持原始视频流输入与多类型仪器读取,具身推理能力再升级。

2026.07.30 · 周四2 分钟阅读

Google 近日推出了 Gemini Robotics ER 2,这是一款面向具身智能场景的推理模型。该模型在原有 Gemini Robotics 基础上,围绕实时感知、仪器识别与空间理解三个方向进行了强化,目标是在机器人执行物理任务时提供更可靠的视觉与认知支撑。

从静态帧切换到原始视频流

新模型最显著的变化在于成功/失败检测的输入方式:Gemini Robotics ER 2 不再依赖单帧静态图像,而是直接处理原始视频流。这一改动使模型能够在任务执行过程中持续观察,及时发现例如液体溢出、打滑或对位偏差等中期失败信号,从而为机器人系统的实时纠错提供基础。

仪器读取能力扩展

Gemini Robotics ER 2 将通用仪器读取能力从原先的圆形表盘与视镜,进一步扩展到数字显示屏、线性刻度、标尺以及液体温度计等更广泛的工业与实验场景。官方测试覆盖了 10 种不同类型的仪器,覆盖范围的扩大意味着该模型在工业巡检、实验室自动化等场景中的实用性进一步提升。

空间视觉问答能力增强

依托 Gemini 系列在多模态理解上的整体进步,Gemini Robotics ER 2 的空间视觉问答(VQA)能力也得到了改进,使其能够更准确地回答与三维空间布局、物体关系相关的视觉问题。

总结与展望

整体来看,Gemini Robotics ER 2 是一次面向具身智能落地场景的功能迭代,重点放在实时性、识别广度与空间推理三个维度。但目前公开信息中尚未包含具体的 benchmark 数值、参数规模或部署细节,后续效果仍需结合实际应用进一步评估。

信源