Skild AI 发布 S1 模型:上下文学习将机器人任务长度推至 10 分钟
北美具身初创 Skild AI 发布机器人基础模型 S1,无需后训练,机器人观看一段示范视频即可完成最长 10 分钟的未…
北美具身智能初创 Skild AI 近日发布机器人基础模型 S1,主打「上下文学习」(in-context learning,ICL):无需针对新任务做后训练微调,机器人只需观看一段人类示范视频,就能照猫画虎完成一整套从未见过的复杂操作。在官方演示中,机器人完成了煎饼、冲泡咖啡、植物换盆以及设备组装等长程任务,单条示范视频最长可达 10 分钟。
核心数据:OOD 任务成功率 66%,远超语言 Prompt VLA
Skild AI 在技术博客中给出的实验结果显示,S1 在训练时未见过的新任务上,仅凭单条示范视频即可达到 66% 的成功率;而采用传统语言 Prompt 的 VLA 模型,同类任务成功率仅 9%,差距超过 7 倍。
如果走传统后训练微调路线,需要约 380 次任务级演示才能追平 S1 单次演示的效果;继续堆数据到 2000 次后,传统路线才能将成功率推到 86%。换言之,S1 把「新技能的学习成本」从「教几百遍」压缩到了「示范一遍」。
技术路线:从 BERT 时代走向 GPT 时代
Skild AI 将当前机器人学习范式类比为 NLP 领域的「BERT 时代」:每遇到一个新任务,都需要收集数据并微调模型权重,而机器人数据采集成本远高于互联网文本,这让后训练难以规模化。
S1 的目标是实现与 GPT-3 相似的范式跃迁——不改动模型权重,仅以示范视频作为「Prompt」,让机器人在推理阶段直接从上下文里学会新技能。模型在整个演示过程中权重完全冻结,没有使用 fine-tuning,也没有 post-training。
缩放趋势:数据越多,越「会从演示里学」
Skild AI 同时公布了一组 ICL 与语言 Prompt VLA 的缩放实验:当训练数据仅 1000 小时时,语言 Prompt 效果更优;随着数据规模增加,ICL 逐步反超。
- 训练数据 10 万小时、训练时见过的任务:ICL 96%,语言 Prompt 89%。
- 训练数据 10 万小时、OOD(未见)任务:ICL 66%,语言 Prompt 9%。
- 改变实验条件后,语言 Prompt VLA 的性能下降幅度最高达到 ICL 的 3 倍。
Skild 将此称为「ICL scaling law」:数据规模扩大带来的不仅是技能数量增加,模型从演示中学习技能的能力本身也在变强。
公司背景:估值两年翻近 10 倍
Skild AI 由卡内基梅隆大学机器人研究所的 Deepak Pathak 与 Abhinav Gupta 于 2023 年共同创立。两人长期从事机器人学习、强化学习与自监督视觉研究,2022 年曾合作 WHIRL 项目,探索机器人通过观看人类视频进行 one-shot imitation,是 S1 路线的直接前身。
融资方面,Skild AI 于 2024 年走出隐身模式即完成 3 亿美元 A 轮融资,估值 15 亿美元;2025 年 1 月又完成 14 亿美元 C 轮,估值突破 140 亿美元,由软银领投,英伟达、贝索斯等机构跟投。
定位与数据策略:Any Robot, Any Task, One Brain
Skild AI 强调跨硬件形态的通用智能层,希望同一套「Skild Brain」能够运行在机械臂、四足机器人、人形机器人等不同本体上。在数据策略上,公司同时采集真机遥操、UMI、第一视角人类视频与仿真数据,覆盖 hardware proximity、diversity 与 scalability 三个维度。
从 2025 年 9 月的 LocoFormer,到 2026 年 2 月的首次 In-Domain ICL,再到煎饼演示与本次 S1 发布,Skild AI 沿着「上下文学习」这条路线持续推进,将任务长度从秒级拉到了 10 分钟量级。对于具身智能领域而言,S1 的真正意义在于把机器人新技能的学习成本,从「几百次演示」拉向了「一次示范」。
