桃子桃子快讯
返回首页
行业动态

Jim Fan 解读 GEN-1.5:机器人基础模型的「不完美」数据哲学

NVIDIA 研究员 Jim Fan 撰文剖析 GEN-1.5 机器人模型成功的关键:保留人类自然重复与失败恢复数据,并…

2026.08.20 · 周四2 分钟阅读

NVIDIA 知名 AI 研究员 Jim Fan 近日在 X 平台发文,对近期引发关注的 GEN-1.5 机器人基础模型进行了技术层面的深度解读。他指出,GEN-1.5 的关键不在架构层面的花哨创新,而在于对人类自然操作数据中「不完美」部分的保留与利用,这一思路对整个机器人学习领域具有方法论启发意义。

数据中的天然重复是核心信号

Jim Fan 表示,GEN-1.5 成功的秘密藏在人类采集数据中的天然重复动作里。这类重复主要来自两类场景:

  • 对称性模式:分拣、整理、装配等任务几乎不可能「一气呵成」。以 IKEA 装配手册为例,绝大多数物体具有对称结构——拧完螺栓 A 接着拧螺栓 B,再处理下一对。每一个 {螺栓 A, 螺栓 B} 组合在上下文中自然衔接,第二个动作几乎成为第一个动作的「免费训练信号」与「提示词」。
  • 失败恢复:人类在操作中频繁掉落物品,只是恢复速度极快以至于难以察觉。这种「下意识修复」构成了人类身体能力的一半。关键在于保留失败的前半段,而不是修剪掉——模型如果消费的是「失误—接住—继续」这一完整弧线,测试时恢复行为就会自然涌现。

Jim Fan 特别强调:「上下文内改进」恰恰来自「不」对数据进行过度清洗。

UMI 取代远程操作:去掉中间层

另一关键要素是数据采集方式 UMI(Universal Manipulation Interface)。Jim Fan 长期主张远程操作(teleop)模式终将被淘汰,GEN-1.5 正在为这一判断钉上最后一颗钉子。

  • UMI 本质上是人类直接佩戴机器人夹爪采集数据:人 → 数据,路径极短。
  • 远程操作则插入了一层隔阂:人 → VR / 骨骼设备 → 机器人 → 数据。

中间层会「滤掉」人类的物理直觉——那些与物体交互时的微妙手法、微调动作、零件卡入位时的手感,几乎无法在无法直接感受环境的情况下被记录下来。

零样本泛化与上下文学习的边界

数据规模充足后,许多行为可实现零样本。例如,面对训练分布中相似场景的新物体,模型无需微调即可「知道」如何操作。但 Jim Fan 也指出,上下文学习是否真正有效,取决于测试场景与训练分布的接近程度。

目前的演示仍偏简单,尚不足以得出确定性结论。整体而言,他持谨慎乐观态度——这无疑是机器人领域令人振奋的一天。

信源