机器人「GPT-3时刻」?Generalist AI发布GEN-1.5看3秒演示即可学会新任务
Generalist AI发布机器人基础模型GEN-1.5,可通过3–12秒示范视频零训练学会新任务,平均成功率59%。
具身智能公司 Generalist AI 近日发布新一代机器人基础模型 GEN-1.5,主打「One-shot Learning」能力:只需给机器人看 3–12 秒的动作示范,它就能在零训练的情况下临场学会新任务,团队将其称为「物理版 Prompt Engineering」。
核心能力:看演示即学,还能拼接技能
GEN-1.5 的工作方式与 GPT-3 的上下文学习(In-Context Learning)高度相似——不是重新训练模型,而是把示范动作直接塞进 Context,让模型自己临场理解任务。
- 短演示上手:人类示范 3–12 秒,机器人无需任何梯度更新或微调即可执行,整套学习—执行过程约在「半分钟」内完成。
- 可拼接:先看 A 动作再展示 B 动作,模型可自主将两段技能串联成连续任务,中间衔接由模型自行补全。
- 跨域迁移:训练阶段并未专门学过对应任务的真实数据,模拟器里的虚拟演示(脚本策略、强化学习代理、人类遥操作)同样可作为 Physical Prompt,下游可直接在真实世界 1:1 复现。
- 举一反三:示范用刷子扫东西,把刷子换成香蕉后机器人仍会继续扫;再加入簸箕,模型会自行发展出「一手扫一手接」的双手协作。
表现数据:单次示范成功率 59%
Generalist 在 10 种任务上对 GEN-1.5 进行了测试,结果如下:
- 仅给 1 次 Physical Prompt、0 梯度更新:平均成功率 59%;
- 每个任务再补 5 分钟数据、做 10 步梯度更新:成功率可升至 83%。
团队坦白承认,通过上下文方式临时学到的技能,目前稳定性仍不及真正 Fine-tune 之后的模型,且测试任务多为短程、相对原子化的操作。但其意义在于:这些能力是预训练过程中自己「冒出来」的,并未刻意设计。
涌现来源:长期大规模物理数据预训练
GEN-1.5 是团队连续预训练 8 个多个月的成果。Generalist 表示,他们在训练过程中并没有专门为 One-shot Learning 设计模型架构、Meta Learning 循环或额外目标函数——这些能力在不断堆数据、堆规模的过程中自然涌现。
- 路径大致是:新任务所需数据从「几百步微调」一路缩减到「几十步」,再到「10 步」,最后变为「1 分钟数据 + 1 个梯度 Step」,最终甚至做到「0 步」。
- Generalist 认为,这与 GPT-3 当年的转折相似:模型规模与预训练数据累积到一定程度后,Few-shot、In-Context Learning 等能力变得足够明显。
其内在逻辑是:真实世界中的动作天然具有连续性——拧完一颗螺丝往往还有第二颗、抓取失败后人会下意识重新握住。这些「重复、延续、失败恢复」的数据不断为后续动作提供上下文,使模型逐渐学会「先看刚才发生了什么,再决定下一步怎么做」。
行业反响与潜在意义
消息发布后,社交媒体上不少评论将其与 GPT-3 的「涌现时刻」并列讨论。如果 GEN-1.5 的能力可以继续 Scale,机器人编程范式可能从「逐任务示教/编程」转向「示范即部署」——出厂的机器人只需记住四个字:看着学。
不过,团队也强调目前的 59% 成功率远谈不上「百发百中」,需要更多任务、更长轨迹、更大规模的数据来验证涌现规律是否真的具备可扩展性。
参考链接:
- Generalist AI 博客:https://generalistai.com/blog/gen-1.5#one-shot-in-context
- Generalist AI 官方 X:https://x.com/GeneralistAI/status/2090161945307664621
