桃子桃子快讯
返回首页
研究论文

机器人模仿学习评测失灵:成功率可能计入了「错误」的成功

本周多篇论文与新模型从不同角度指出,机器人模仿学习的成功率指标未能覆盖功能替代、形变容差、干扰物体等条件。

2026.08.28 · 周五5 分钟阅读

机器人模仿学习长期依赖「成功率」这一单一指标,但本周四篇论文从不同角度指出同一问题:在功能替代、形变容差、干扰物体等条件下,现有指标会把不达标甚至「碾压物体」的运行计入成功。与此同时,Isaac-0.5、Dyna 与 GEN-1.5 等新工作从数据配比、基础设施与上下文学习三方面给出回应。

评测指标的「盲区」正在被系统暴露

Imitator Game(IG-10K) 把同一任务拆成四个递进层级:L0 场景与人示范完全一致,L1–L2 逐步拉开场景距离,L3 则要求机器人用不同物体达成同一目标——即「功能替代」。九款主流模型在 L0–L2 上表现稳定,到 L3 全部崩塌,零样本成功率均低于 13%。有意思的是,输入人类视频的策略明显优于输入文本描述,说明视频中丢失了一些文本无法承载的信息。

同一周还有三篇论文重复了类似指控:

  • InstructMove 把缺失物体重新放回场景,其中多个可抓取,只有一个匹配指令,从而暴露出视觉语言动作(VLA)策略「读场景、不读指令」的捷径。
  • SoftVTBench 在成功判定中加入形变容差:物体被碾压超出设定阈值即视为失败。Diffusion Policy、π0.5、FastWAM 在全部 12 个测试配置中都出现了「压碎却计为通过」的情况。
  • WorldEcho 测试作为学习模拟器使用的世界模型是否遵循喂入的动作:来自示范数据的动作可行,但半训练策略产生的探索性动作要么被忽略,要么渲染出无意义结果——而后者恰恰是真正需要模拟器的输入。

四组实验各不相同,却汇聚于同一结论:原指标从未检查的条件——不同物体、竞争性干扰物、形变阈值、非示范动作——都可能让现有成功率虚高。

数据与基础设施:新基准与新瓶颈

IG-10K 本身也提供了数据集与平台:

  • 包含超过 20,000 条人-机器人配对回合,覆盖 50+ 任务、6 个领域,兼顾真实与仿真环境。
  • 配套开源平台 Imitator Arena,支持盲测 A/B 人工评估。
  • 在 IG-10K 预训练后,再用 10 条配对示范做微调即可获得显著增益,且增益随预训练规模放大。

Dyna 团队发布的 DYNA-2 基础设施报告则披露了数据流水线的真实瓶颈:

  • 原始录像摄入环节曾以 14,000 episode-hours / 周 的速度处理,按此速率攒够 100 万小时需要一年多。
  • 改为 DAG 分解与装箱式批处理后,上限提升至 440,000 episode-hours / 周。
  • 训练运行所需的 manifest(回合清单)构建过去要遍历数千万条记录、耗时 48 小时,现已改为单次数据仓查询,对 5,000 万行表秒级返回。
  • 集群内 NVMe 缓存把一次 PB 级读取从 57.9 天压缩到 5.8 天,GPU 利用率维持在 98%。
  • 团队总结:瓶颈在存储格式、摄入、清单之间依次迁移,工程的核心是找到当前瓶颈,而非堆机器。

新模型:从数据配比到上下文学习

Isaac-0.5 是一款 360 亿参数的稀疏模型,覆盖视频理解、具身推理、空间定位与控制。Perceptron 团队用 35+ 机器人系统、10 万小时机器人经验、100 万小时通用视频与 3 万亿多模态 token 进行训练。关键发现是数据「替代曲线」:

  • 在动作预测损失目标 2.50 处,一组配比是 1,000 小时通用视频配约 5,900 小时遥控操作。
  • 另一组配比是 100 万小时通用视频配约 28 小时遥控操作。
  • 团队称之为「遥控操作需求 210× 削减」。

需要注意的是,该曲线拟合自单一实验室的网格搜索,损失目标也是团队自定,目前权重尚未发布。代码与 LeRobot 集成已按 Apache-2.0 开源。

GEN-1.5 把 3–12 秒的感运动示范读入 30 秒上下文窗口后直接执行任务,无需梯度更新、无需微调、无需任务专属代码:

  • 零样本一次性提示在 10 个操控任务上平均成功率 59%。
  • 加入少量额外训练数据后提升至 83%。

上下文学习在控制领域被尝试了两年,GEN-1.5 是迄今最清晰的可行性证明。

潜在动作与人体运动数据

一篇综述类论文把现有「潜在动作」方法统一进同一自编码框架,对建模范式、学习目标、整合策略三类共 41 个设计选择做了消融,并检验四种代理指标与下游操控性能的相关性。结果显示,以潜在动作微调 VLM 主干可获得比替代方案更强的初始化。

OmniHM-5M 从互联网视频中挖掘 1,500 万条人体运动,发布其中 500 万条,舍弃其余 1,000 万条。

小结

评测端的数据集、平台与诊断工具,与模型端的数据配比、基础设施、上下文学习在这一周同步推进。对从业者更直接的启示是:找到与你任务匹配的那条额外条件——不同物体、干扰物、形变容差或非示范动作——加入自己的评测管线,再用候选 checkpoint 实测一遍。

信源