桃子桃子快讯
返回首页
研究论文

刷视频也能教机器人干活?人类动作预训练的规模效应

Figure、Dyna 与亮源新创相继验证:用大规模人类视频预训练机器人,迁移指标随规模可预测下降。

2026.09.23 · 周三6 分钟阅读

Figure 把 Helix 2.5 带进了旧金山湾区 30 个陌生家庭,执行叠毛巾、铺床、收拾客厅三项任务。机器人到达现场后不采集新数据、不更新权重、不更换模型,仅依靠预训练得到的策略完成执行。Figure 将这种表现称为「零样本」,但严格地说,三项任务此前都已在其他环境数据上做过适配,「零样本」指面对新环境、新布局和新物体实例时无需现场重训。

Index 预训练把陌生家庭任务成功率从 9% 拉到 56%

Figure 公布的实验同时保持架构、优化方式、超参数、下游数据和评估方法不变,只切换是否经过 Index 预训练。结果显示:

  • 未经过 Index 预训练:30 个陌生家庭完整任务成功率 9%
  • 经过 Index 预训练:同一组任务成功率 56%

这里的 56% 要求完整完成任务;只要玩具没有全部进篮子、或出于安全原因需要人工干预,整个回合直接判失败。两组模型之间的唯一变量就是是否经过 Index 预训练。

另一组实验转向离线评测。Figure 用四档严格嵌套的 Index 数据子集训练模型,预训练数据规模跨越 8 倍,模型大小和下游训练方式保持一致。每个模型再用相同任务数据微调,然后比较留出测试集上的机器人动作预测损失。结果显示,随着数据规模翻倍,验证损失规律下降;Figure 用小规模实验拟合趋势、再外推到最大规模,官方称预测误差仅相当于整个 8 倍范围内损失变化的 0.54%。

这两组实验回答的不是同一个问题:第一组回答「有没有大规模人类行为预训练,会不会影响真实机器人执行结果」;第二组回答「当人类数据预训练规模继续扩大,离线迁移指标是否呈现可预测的规模效应」。Figure 目前尚未公开 1×、2×、4×、8× Index 预训练分别对应的真实机器人闭环成功率,因此不能直接据此外推「预训练规模越大,真实任务成功率按同一规律持续提升」。

Dyna-2:1000 小时到 100 万小时的迁移曲线

Dyna Robotics 此前已展示过更完整的从预训练到闭环的证据。8 月发布的 Dyna-2 把第一视角人类视频按 1000 小时、1 万小时、10 万小时、100 万小时四档严格嵌套构建数据集,更大规模只是在较小集合上继续追加,各来源比例保持一致。

四档模型用同一套机器人后训练方法适配到 14 个真实机器人任务,平均归一化得分依次达到任务可达上限的 20%、28%、45% 和 53%。Dyna 的消融实验还进一步追问规模效应的来源:

  • 单独预测动作时,模型随数据增加出现严重而不稳定的过拟合
  • 加入未来视频预测后,39 个机器人任务的迁移表现整体改善
  • 进一步增加无动作标签、只用于视频预测的人类视频后,跨本体表现才随数据规模呈稳定单调提升

结论是:数据规模扩大能否带来稳定收益,取决于「数据是什么」以及「模型被要求从中学什么」。

Figure 的人类数据供应链与算力扩张

Figure 在 Index 发布稿中明确表态:要规模化训练真正通用的机器人,所需数据并不存在于来源广泛的互联网视频。于是 Figure 搭建了自有的人类数据供应链:Creator 创作者网络在真实家庭和工作场所采集任务视频。截至 8 月底,Index 已收到超过 1600 万条视频,累计向创作者支付 1500 万美元;Helix 2.5 发布时,新数据正以约 35 分钟/秒的速度进入 Index。流程上还叠加了质量过滤、反作弊、去重、再平衡和文本标注。

算力方面,9 月初 Figure 与英国 AI 云厂商 Nscale 达成战略合作:

  • 初始算力承诺价值 35 亿美元
  • 未来合作规模可能扩大到 60 亿美元以上
  • 计划基于英伟达 Vera Rubin 平台部署最高 10 万颗 GPU

Figure CEO Brett Adcock 直言,Helix 下一阶段越来越受制于数据和算力。这是一条资本密集、但对数据分布拥有更强控制力的路线:长尾缺什么,就在现实世界定向补什么。

亮源新创 Light-O1:1200 亿 token 的迁移缩放定律

另一类团队不专门采集数据,而是尝试从互联网公开视频中提取可迁移信号。CoMo 从互联网视频中学习连续潜在运动表示并生成伪动作;HuRo 把视角各异的人类视频「机器人化」,转成更接近机器人观察和动作分布的数据;Rhoda 则用因果视频模型先预测世界变化,再通过逆动力学模型把预测转换成机器人动作。

亮源新创选择了一条更激进的路:直接把预训练数据源推向互联网规模。9 月 21 日发布的 Light-O1 先从互联网中第三视角人类行为视频恢复结构化人类动作,再编码成统一的人形动作表示,与视觉、语言信息一起做自回归预训练,得到一个「人类动作先验(Human Action Prior)」。

  • 预训练规模从 37.5 亿 token 扩展到 1200 亿 token
  • 最大规模约对应 10 万小时人类动作
  • 目标域覆盖第一视角人类数据、公开机器人数据和亮源自研人形机器人数据

随着人类动作预训练规模扩大,适配后的动作预测误差、全身姿态误差和腕部位置误差均持续下降,并呈幂律趋势。亮源新创将此称为「迁移缩放定律(Transfer Scaling Law)」。值得强调的是,该结论基于目标域适配后的开环预测指标,并非真实机器人闭环任务成功率。

三条路线的边界仍未消失

把 Figure、Dyna 与亮源新创放在一起看,2026 年的机器人预训练已经形成一个比「人类数据有没有用」更具体的问题:人类经验能不能像文本之于大模型那样,成为机器人预训练中一种可以持续扩展、并能预测下游收益的数据来源?

目前能确认的是:

  • Figure 的预训练把真实机器人闭环成功率从 9% 拉到 56%
  • Dyna 在 14 个任务上展示人类视频规模扩大带来的闭环表现提升
  • 亮源新创首次在多本体人形机器人目标域上验证互联网规模人类动作预训练的迁移缩放定律

但不同「规模效应」并非同一条曲线:开环迁移指标随规模下降,不等于闭环真机成功率会按相同规律连续提升。从离线迁移到闭环表现之间的鸿沟,仍是下一步需要回答的问题。

信源