桃子桃子快讯
返回首页
模型发布

Generalist AI 发布 GEN-1.5,机器人迈入「看一遍就会」时代

Generalist AI 发布 GEN-1.5,机器人可凭 3-12 秒演示零训练执行任务,one-shot 成功率…

2026.08.21 · 周五6 分钟阅读

8 月 20 日,硅谷机器人公司 Generalist AI 正式发布新一代具身智能基础模型 GEN-1.5。模型可凭借一段 3 至 12 秒的动作演示,无需任何训练或微调即执行任务,在 10 项操作任务上的 one-shot 平均成功率达 59%,few-shot 模式提升至 83%。多位顶尖研究者将这一节点类比为 2020 年 GPT-3 的发布,认为具身智能走到了自己的「GPT-3 时刻」。

核心能力:看一遍即会执行

GEN-1.5 的关键能力被称为「物理提示」(Physical Prompting):用户将一段包含传感器数据和动作轨迹的真实演示塞入模型 30 秒的上下文记忆窗口,剩余空间用来接收实时环境观测,模型立即尝试执行,全程不涉及任何梯度更新。

在 10 项测试任务中——包括拧开玻璃罐盖、拉开笔袋拉链、从钱包取钱、叠纸、叠杯子、翻手机、用刷子扫积木、打开书本封面、撕开真空垫、清扫垃圾——one-shot(仅看一遍演示、零梯度步骤)平均成功率为 59%(标准差 ±10%),few-shot(5 分钟数据、约 50 次演示、10 个梯度步骤)平均成功率 83%(标准差 ±9%)。作为参照,2020 年 GPT-3 在语言任务上的对应数字约为 45% 与 65%,两组数字结构高度相似。

即兴发挥:能力从预训练中涌现

GEN-1.5 最让研究者震动的并非模仿,而是即兴能力。例如,给定一段用刷子将积木扫入碗中的演示后,将工具替换为一根香蕉,模型会横握香蕉扫动积木;将工具替换为簸箕,模型切换策略,用另一只手把积木推上簸箕再抬起倒入碗中——「扫」与「铲起倒」是两种完全不同的接触序列,训练数据从未教过。Generalist AI 用最近邻语言搜索在约 189 万段预训练场景中检索,未找到类似的簸箕用法。

类似的涌现行为反复出现:

  • 碗被纸张盖住时,模型自行掀开纸再放入积木;
  • 乐高积木粘在机械手指尖时,模型用另一只手将其拨下;
  • 训练数据只演示单手旋转罐盖,模型在部分尝试中自发切换到双手操作;
  • 仅被训练放一块积木的模型开始自发按颜色分拣多块积木。

这些能力的共同来源是超大规模预训练。GEN-1.5 已连续预训练超过 8 个月,经历三个训练阶段。官方验证集曲线显示,模型「下一步动作预测误差」持续下降,尚未出现收敛迹象。团队还发现一个反直觉现象:微调的梯度步骤越少,即兴能力反而越强。10 个梯度步骤仅改变模型参数的 0.15%,「更接近于提醒模型一些它几乎已经知道的事情」。

跨越两道鸿沟

GEN-1.5 还展示了两项此前难以实现的跨域能力:

  • 仿真到现实迁移:在模拟器中录制一段演示塞入上下文窗口,真实机器人可直接执行,并可泛化到不同机械手和新的物体位置,尽管预训练数据中不含任何仿真数据。
  • 人手演示到机械手复现:在部分测试中,研究人员用自己的双手在机器人摄像头前演示动作,机械手随后复现了任务。

Generalist AI 表示,这些能力均非刻意设计——没有专门促进上下文学习的架构改动,没有元学习循环,没有鼓励即兴的辅助训练目标,「它们从大规模物理数据的预训练中自行出现」。

资本与团队背景

Generalist AI 核心团队包括来自谷歌 DeepMind 机器人团队的 Pete Florence 与 Andy Zeng,以及来自波士顿动力的 Andrew Barry。2025 年 6 月,公司完成 4 亿美元融资,由 Radical Ventures 领投,英伟达与 Bezos Expeditions 参投,投后估值 20 亿美元;李飞飞、小米联合创始人林斌、Zoom 创始人袁政均以个人身份参与。消息显示公司正以 30 亿美元估值洽谈新一轮融资。

行业沸腾与理性冷水

GEN-1.5 发布正值具身智能领域最密集的一周:8 月 19 日 WRC 世界机器人大会在北京亦庄开幕(300 余家企业、超过 2000 件展品),同日宇树科技科创板上市开盘报 1100 元/股,市值约 4449 亿元;8 月 22 日第二届世界人形机器人运动会在国家速滑馆「冰丝带」开赛,666 支队伍、2056 台机器人参赛 51 个项目,队伍数量较首届增长 138%。

研究社区反应强烈。Pete Florence 在 X 上写道:「广泛的 one-shot 上下文学习一直是我心中最清晰的目标……现在我看到了将近十年的想象走进现实世界。」卡内基梅隆大学 Chris Paxton 称这「可能是真正的 GPT 时刻」,并表示「操作学习的圣杯毫无疑问就是 one-shot learning」。英伟达机器人技术总监 Jim Fan 分析了涌现能力的两个关键来源:训练数据中自然存在的对称重复动作模式(如反复拧螺丝),以及「失败—恢复—继续」的完整弧线。

但冷静的声音同样存在。Jim Fan 在同一条推文的评论区中补充:「演示目前仍然有点太简单了,还不能下结论。」需要注意的是,所有结果均为 Generalist AI 自行报告,尚未经过独立验证;测试任务仍属简单短程操作,距离真实场景中的长程复杂任务差距明显。

将 GEN-1.5 的位置类比于 2020 年的 GPT-3——「能力粗糙但方向明确,任务简单但 Scaling 趋势清晰」。如果具身智能的 Scaling 曲线确实未见收敛,下一轮竞争的核心资源将变成谁拥有足够多的物理交互数据,这与 2021 年大语言模型领域进入数据争夺战的剧本,如出一辙。

信源