桃子桃子快讯
返回首页
模型发布

机器人「GPT-3时刻」?Generalist AI发布GEN-1.5看3秒演示即可学会新任务

Generalist AI发布机器人基础模型GEN-1.5,可通过3–12秒示范视频零训练学会新任务,平均成功率59%。

2026.08.21 · 周五4 分钟阅读

具身智能公司 Generalist AI 近日发布新一代机器人基础模型 GEN-1.5,主打「One-shot Learning」能力:只需给机器人看 3–12 秒的动作示范,它就能在零训练的情况下临场学会新任务,团队将其称为「物理版 Prompt Engineering」。

核心能力:看演示即学,还能拼接技能

GEN-1.5 的工作方式与 GPT-3 的上下文学习(In-Context Learning)高度相似——不是重新训练模型,而是把示范动作直接塞进 Context,让模型自己临场理解任务。

  • 短演示上手:人类示范 3–12 秒,机器人无需任何梯度更新或微调即可执行,整套学习—执行过程约在「半分钟」内完成。
  • 可拼接:先看 A 动作再展示 B 动作,模型可自主将两段技能串联成连续任务,中间衔接由模型自行补全。
  • 跨域迁移:训练阶段并未专门学过对应任务的真实数据,模拟器里的虚拟演示(脚本策略、强化学习代理、人类遥操作)同样可作为 Physical Prompt,下游可直接在真实世界 1:1 复现。
  • 举一反三:示范用刷子扫东西,把刷子换成香蕉后机器人仍会继续扫;再加入簸箕,模型会自行发展出「一手扫一手接」的双手协作。

表现数据:单次示范成功率 59%

Generalist 在 10 种任务上对 GEN-1.5 进行了测试,结果如下:

  • 仅给 1 次 Physical Prompt、0 梯度更新:平均成功率 59%
  • 每个任务再补 5 分钟数据、做 10 步梯度更新:成功率可升至 83%

团队坦白承认,通过上下文方式临时学到的技能,目前稳定性仍不及真正 Fine-tune 之后的模型,且测试任务多为短程、相对原子化的操作。但其意义在于:这些能力是预训练过程中自己「冒出来」的,并未刻意设计。

涌现来源:长期大规模物理数据预训练

GEN-1.5 是团队连续预训练 8 个多个月的成果。Generalist 表示,他们在训练过程中并没有专门为 One-shot Learning 设计模型架构、Meta Learning 循环或额外目标函数——这些能力在不断堆数据、堆规模的过程中自然涌现。

  • 路径大致是:新任务所需数据从「几百步微调」一路缩减到「几十步」,再到「10 步」,最后变为「1 分钟数据 + 1 个梯度 Step」,最终甚至做到「0 步」。
  • Generalist 认为,这与 GPT-3 当年的转折相似:模型规模与预训练数据累积到一定程度后,Few-shot、In-Context Learning 等能力变得足够明显。

其内在逻辑是:真实世界中的动作天然具有连续性——拧完一颗螺丝往往还有第二颗、抓取失败后人会下意识重新握住。这些「重复、延续、失败恢复」的数据不断为后续动作提供上下文,使模型逐渐学会「先看刚才发生了什么,再决定下一步怎么做」。

行业反响与潜在意义

消息发布后,社交媒体上不少评论将其与 GPT-3 的「涌现时刻」并列讨论。如果 GEN-1.5 的能力可以继续 Scale,机器人编程范式可能从「逐任务示教/编程」转向「示范即部署」——出厂的机器人只需记住四个字:看着学。

不过,团队也强调目前的 59% 成功率远谈不上「百发百中」,需要更多任务、更长轨迹、更大规模的数据来验证涌现规律是否真的具备可扩展性。

参考链接:

信源