Skild AI机器人自我对弈140年,练成"梅西终结者"
美国具身智能独角兽Skild AI借助self-play,在虚拟世界杯自我对弈约140年,让人形机器人Messinato…
美国具身智能独角兽 Skild AI 近日展示了其人形机器人「Messinator」的足球技能。这台机器人借助 AlphaGo 同款的 self-play(自我对弈)方法,在 NVIDIA Isaac Sim 搭建的虚拟足球场中进行了约 140 年等效时长的训练,最终将盘带、护球、射门等技能从仿真迁移到真实硬件,并在真人对抗中完成进球。
从虚拟世界杯到真实球场
Messinator 由 Skild AI 此前推出的机器人基础模型 S1 驱动。S1 的核心能力是「上下文学习」——只需给一段任务示范视频,模型就能把视频当作提示词,理解意图并转化为适合自身身体的执行方式,遇到新任务无需重新训练。
但 Skild AI 认为,纯靠人类数据训练,机器人能力上限会受限于人类经验。因此团队在 S1 基础上叠加了强化学习和 self-play:把机器人放进虚拟足球场,只设定一个终极奖励目标——进球拿高分。盘带、护球、抢断、倒地起身这些动作,均无单独奖励。
训练中的对手只是机器人自己此前保存的模型版本。每一次自我迭代后,新版本又会成为下一轮更强的对手。据 Skild AI 技术博客介绍,机器人初期连走路都困难;等效训练到「大学生年纪」时便学会了摔倒后自行爬起;随着对手变强,更复杂的盘带和身体对抗行为陆续涌现,保留这些动作的唯一理由是「它们能帮自己赢球」。
Skild Brain:跨硬件的通用机器人大脑
self-play 之外,Messinator 的基本功来自 Skild Brain——Skild AI 于 2025 年 7 月正式推出的机器人基础模型,主张「Any robot, any task, one brain」,即用同一颗大脑控制不同形态的机器人执行不同任务。
在公开的 omni-bodied 训练中,团队在仿真中生成了约 10 万种结构各异的机器人身体,让同一个模型累计训练约 1000 个仿真年。测试阶段,模型还需接管训练时从未见过的机器人:即便机器人断腿、关节锁死、轮子卡住或额外负重,模型也能在线调整重心,几秒钟内恢复平衡。
这一路线背后的逻辑是:见过的身体越多,模型越无法靠死记硬背过关,只能去理解平衡、关节、重心和动力背后的通用物理规律。
两位 CMU 教授联手创业
Skild AI 成立于 2023 年,脱胎于卡内基梅隆大学机器人研究体系。联合创始人兼 CEO Deepak Pathak 师从加州大学伯克利分校的 Alyosha Efros 和 Trevor Darrell,曾在 Meta AI Research 任研究员,现任 CMU 机器人研究所和机器学习系教授,其「好奇心驱动的探索」研究是让机器人通过内在动机自主学习新能力的代表性工作。
另一位联合创始人兼总裁 Abhinav Gupta 博士毕业于马里兰大学,现任 CMU 机器人研究所教授,曾参与建立 Facebook AI Research 匹兹堡实验室,长期从事大规模视觉学习、自监督学习、机器人操作和物理常识研究,获斯隆研究奖、PAMI 青年研究员奖、IAPR J.K. Aggarwal Prize 等荣誉。
团队成员还包括来自斯坦福、UC 伯克利等高校的研究人才,以及来自 Meta、Tesla、NVIDIA、Google、Amazon、Everyday Robotics 等机构的工程师。
意义与展望
Skild AI 通过 Messinator 演示了一个核心观点:机器人不一定要由人类手把手教会新动作,也可以自己练、自己输、自己总结、再自己变强。从 10 万种机器人身体到 140 年等效的虚拟世界杯,self-play 方法论正在从围棋、象棋等抽象博弈,向物理世界的运动控制延伸,也为通用机器人基础模型的训练范式提供了新的参考路径。
