Skild AI 发布具身模型 S1:一次演示学会 10 分钟长程任务
Skild AI 发布机器人基础模型 S1,无需后训练,仅看一次演示即可完成最长 10 分钟未见过的复杂任务,OOD 任…
导语
北美具身初创 Skild AI 发布全新机器人基础模型 S1,主打上下文学习(in-context learning)能力:无需任何后训练微调,仅观看一段人类示范视频,机器人即可完成从未见过的复杂操作流程,最长任务可达 10 分钟以上。这是具身智能领域继 Generalist Gen 1.5 之后,又一次把「看一遍就学会」推向长程任务的工作,被部分业内人士视为机器人迈向 GPT 时刻的信号。
从 BERT 时代,迈向 GPT 时代
传统机器人学习新技能的方式,与早期大模型类似:先在海量数据上预训练,再针对具体任务收集数据做后训练。但与语言模型不同,机器人所需的预训练与后训练数据都要在现实世界中采集,成本远高于互联网文本。
Skild AI 在技术博客中直接质疑:如果每学一个新任务仍需要几十、几百小时真机数据再重新后训练,那「基础模型」究竟基础在哪?他们的答案是上下文学习——就像 GPT-3 之后的大模型,用户在 Prompt 里给几个例子,模型就能临时学会新任务,而无需改动权重。Skild 认为机器人目前仍困在类似 BERT 时代,S1 正是要把机器人推向同一次范式转换:预训练真正的价值,是让机器人最终获得「从上下文里直接学习」的能力。
S1 的上下文学习:看一遍,做 10 分钟
S1 检验上下文学习的两个维度:一是能否学会训练时从未见过的新技能,二是能否把已有技能重新组合,完成长程复杂任务。官方演示中,机器人仅观看一段翻煎饼的视频,便学会了整套制作流程;植物换盆任务里,从录制演示到机器人自主完成仅花了 11 分钟。
相较上周 Generalist Gen 1.5 展示的 3–12 秒级视频,S1 此次把上下文学习的任务长度直接拉到最长 10 分钟,机器人需要理解任务-动作意图,做到见招拆招,而非简单行为克隆。整个过程中,S1 没有使用任何 fine-tuning 或 post-training,模型权重完全不变,同一套权重完成了所有展示任务。
实验:ICL 能否 scale
Skild 在训练见过任务和未见任务(OOD)上,对比了 ICL 视频 Prompt 与传统语言 Prompt VLA。结果显示:当训练数据仅 1000 小时时,语言 Prompt 效果更好;但随着数据规模增加,ICL 逐渐反超。
- 10 万小时训练数据下,见过任务上:ICL 96%,语言 Prompt 89%。
- 关键 OOD 任务上:ICL 66%,语言 Prompt 仅 9%,差距超过 7 倍。
- 泛化性测试中,语言 Prompt VLA 性能下降幅度最高达 ICL 的 3 倍。
One-shot learning 方面,S1 在新任务上不做任何后训练,仅看一条视频演示,成功率即达 66%;传统 VLA 约需 380 次演示的后训练才能追平同一水平;继续堆到 2000 次演示,传统 post-training 最终可做到 86%。Skild 将其概括为 ICL scaling law:数据越多,模型不只会更多技能,而是越来越会「从演示里学技能」。
Skild AI 是谁
Skild 成立于 2023 年,由两位 CMU 机器人研究所教授 Deepak Pathak 与 Abhinav Gupta 联合创立,二人早在 2022 年便合作过 WHIRL,用人类视频实现机器人 one-shot imitation。2024 年走出隐身模式即拿下 3 亿美元 A 轮、估值 15 亿美元;今年 1 月完成 14 亿美元 C 轮,估值超 140 亿美元,由 SoftBank 领投,英伟达、贝索斯等继续跟投。
相比 PI 强调「机器人 GPT」、Generalist 强调 one-shot learner、Genesis AI 等强调全栈,Skild 的定位是「Any robot, any task, one brain」,强调跨 embodiment,同一个 Skild Brain 可跑在机械臂、四足、人形等不同身体上。S1 的 ICL 能力也是这一路线的自然延伸:2025 年 9 月 LocoFormer → 2026 年 2 月首次 In-Domain ICL → 5 月第一次翻煎饼 → 8 月 S1 发布,把上下文学习推到 10 分钟级 OOD 长程任务。
