Generalist 发布 GEN-1.5:物理 AI 接近「GPT-3 时刻」
Generalist 发布 GEN-1.5 具身基座模型,展示「物理提示」能力——机器人看一次示范即可学会新任务,被业内…
具身智能公司 Generalist 正式发布 GEN-1.5 基座模型,展示了一项被研究者称为「圣杯」的新能力——物理提示(physical prompting):研究人员只用一只简易夹爪示范一次 3 到 12 秒的操作,机器人不进行任何参数更新,便能在新位置和新初始状态下尝试同一项任务。曾参与 Google DeepMind Gemini Robotics 的研究者 Ted Xiao 认为,这是机器人领域迄今最好的「看一次就能学」结果,让他想起第一次使用 GPT-3 的感受。
「物理提示」与直接泛化
GEN-1.5 展示了三种学习与使用新能力的方式。第一种是面对没见过的变化直接换一种办法:学过把积木放进碗,遇到碗被盖住会先移开盖子;乐高卡在夹爪上会用另一只手取下;学过单手开罐,有时会换成双手开。任务本身学过,变化没有学过,模型直接对新工具、新障碍和意外情况做出泛化。
第二种是只看一次示范就开始做新任务。Generalist 把这种机制称为「physical prompting」,与给大语言模型一段提示词类似:示范没有被训练进模型,只是临时告诉它「这一次要做什么」。在 10 项新任务上,一次提示的平均成功率为 59%。提示还可以组合——分别示范两个任务,GEN-1.5 会把它们接成连续动作,并补上示范里没有的调整位置、换手和重新抓取;来自模拟器的动作也可以提示现实中的机器人,人用双手示范时,机器人也会尝试复现。
第三种是用几分钟数据把新任务学得更稳。研究人员提供 1 到 5 分钟、约 10 到 50 次演示,再调整 1 到 10 次模型参数。使用约 5 分钟数据和 10 次调整时,10 项任务的平均成功率可从 59% 提高到 83%。这仍然是训练,但已经从过去的数百次调整压缩到几次。
训练梯度从数百次压缩到 0 次
GEN-1.5 与 GEN-1 几乎同时启动,连续预训练超过八个月。随着训练推进,新任务所需的参数调整从数百次降到数十次、10 次,再降到 1 次,最后变成 0 次。即便调整 10 次,模型内部参数的整体变化也不到 0.15%。用 Generalist 的说法,这已经不像从头学习,更像是在提醒模型一件它几乎已经会做的事。
GEN-1.5 同时处理视频、其他传感器、语言和机器人状态。示范被放进 30 秒上下文窗口,其余空间持续加入机器人最新看到的画面;模型以 100Hz 输出动作轨迹,并在执行中继续观察和修正。预训练数据只是从家庭、仓库和工厂活动中随机截取的连续片段,测试时突然插入一段来自别处的动作——原本不是训练中刻意安排过的形式——模型却知道应该接着做。
至于为什么会出现这种能力,Generalist 尚未给出确定答案。一种猜测是,人类工作中天然充满重复:拧完一颗螺丝通常还要拧下一颗。另一部分线索来自失败,人会失手、调整、重新抓起物体后继续工作。如果这些不完美的过程没有被在数据清洗时剪掉,模型看到的就是完整的「失误—修正—继续」。英伟达机器人研究负责人 Jim Fan 认为,这可能正是 GEN-1.5 会恢复和换办法的重要原因。
Generalist 的 scaling 路线与数据飞轮
Generalist 成立于 2024 年,三位联合创始人 Pete Florence 和 Andy Zeng 来自 Google DeepMind,曾参与 PaLM-E、RT-2 等具身模型;Andrew Barry 曾是 Boston Dynamics 资深研究员,团队成员还来自 OpenAI、自动驾驶和其他机器人公司。公司不打算再造一款明星人形机器人,而是想训练一套可以进入不同机械臂、夹爪和工具的底层智能。
公司过去两年的核心押注是「物理智能也可以 scaling」。2025 年 11 月发布 GEN-0 时,公司已积累超过 27 万小时真实操作数据,每周仍在增加约 1 万小时;用不同规模模型反复实验后,发现 10 亿参数很快学不动,60 亿参数开始明显受益,70 亿参数以上海量物理经验才能更稳定地迁移到新任务。GEN-0 随后被扩大到 100 亿参数以上,扩大预训练后 16 组新任务的动作预测误差同时下降。
到 2026 年 4 月的 GEN-1,数据已超过 50 万小时。使用约 1 小时机器人任务数据后,一组简单任务的平均成功率从 GEN-0 的 64% 提升到 99%,折盒和手机包装等任务速度提高到此前系统的约 3 倍。GEN-1 约 99% 的参数从头训练,并不依附 Gemini、GPT 等语言图像模型——公司认为,当真实操作数据达到几十万小时,模型可以主要从物理经验中建立能力。
数据采集路线更接近 UMI:让人手持带相机的「机器人手」直接在家庭、仓库和工厂里干活,再把动作转换成机器人可学习的数据。公司已公开数千套低成本采集硬件,并称训练系统一天可读取相当于 6.85 年的人类操作经验。今年 7 月,Generalist 还为 GEN-1 接入五指手、夹钳、电动螺丝刀、打蛋器等不同工具,以及约 9000 种标准夹爪改装形态。
资本押注与「GPT-3 时刻」的边界
今年 6 月,Generalist 完成 4 亿美元融资,累计融资超 5 亿美元,估值达 20 亿美元,由 Radical Ventures 领投,英伟达、Bezos Expeditions、8VC、Union Square Ventures、Norwest 和 Spark Capital 等参与。早期投资方 Boldstart 强调的核心是 Generalist 的「数据手」以及由此建立的数据循环。
在中国端,鹿明机器人联合 CTO 丁琰估算,即便完全照着 Generalist 已公开的采集方式重建,仅制造采集硬件就需要四到六个月;若要积累 27 万小时数据,至少需要约 1000 人持续采集大半年甚至一年,「半年到一年追上」对一个刚起步的团队来说都过于乐观。深度机智创始人陈凯提到,Generalist 用大规模人类操作数据展示出模型能力,又以 27 万小时数据跑出清晰的 scaling 结果,原本被认为难以迁移到机器人的人类数据,开始成为资本愿意下注的技术路线。
九个月前 GEN-0 的发布被部分业内人士视为机器人最接近「GPT-1 时刻」的尝试;这一次,Generalist 把参照物直接换成了 GPT-3。但从一次提示 59% 的成功率、几次调整后 83% 的成功率来看,它离一台可以放心交付工作的机器人仍有距离。它已经出现在一条清晰的 scaling 曲线上——机器人智能的涌现,正变得肉眼可见。
