研究论文
Jim Fan、李飞飞团队 RoboTTT:把机器人上下文拉到 8K 时间步
英伟达 Jim Fan 与李飞飞团队推出 RoboTTT,将机器人视觉运动上下文扩展到 8K 时间步,性能比现有方法高…
2026.07.27 · 周一约 5 分钟阅读
受限于极短的上下文窗口,机器人很容易「忘记」刚刚发生的一切。英伟达高级研究科学家 Jim Fan 与斯坦福大学教授李飞飞团队及其合作者,最近推出了机器人模型与训练方案 RoboTTT(Test-Time-Training Robot Policies),把视觉运动上下文扩展到 8K 时间步,相当于 5 分钟的「肌肉记忆」,性能比现有 SOTA 策略高出 3 个数量级,且不增加推理延迟。Jim Fan 也在 X 上发文称:「很快,即使是 100 万上下文,也不再是幻想。」
核心思路:把 TTT 嵌入机器人基础模型
RoboTTT 的关键设计是把「测试时训练(Test-Time-Training, TTT)」嵌入到机器人策略网络里,用「快速权重(fast weights)」充当模型的循环状态。每接收一次传感器输入,模型就执行一步梯度更新,把历史信息写入权重。由于隐藏状态大小固定,机器人可以在较低开销下保留更长的历史信息,并在部署后继续学习。
研究团队将「上下文长度」明确列为机器人基础模型的新 scaling 方向:使用 8K 时间步上下文训练的 RoboTTT,比用 1K 时间步预训练的同一模型取得了 +62% 的性能提升,且目前没有看到饱和迹象。
模型架构与训练方法
RoboTTT 由视觉-语言模型(VLM)骨干和带有 TTT 层的 DiT 动作头组成:
- 架构:注意力层处理单个时间步内的信息,TTT 层加在注意力层之后,负责沿时间维度整合跨时间信息。为提高效率,模型不直接把全部视觉-语言 token 输入 TTT,而是使用少量 register token 在时间维度上传递信息;TTT 输出经 Tanh Gating 后再与注意力输出相加,以保留预训练能力。
- 序列训练:结合「序列动作强制」与截断反向传播(TBPTT)。序列动作强制为每个动作块独立采样噪声水平,稳定 flow-matching 训练;TBPTT 把长序列切分为片段,只在片段内反传梯度,但让快速权重继续跨片段传递,从而把显存开销控制在片段长度范围内。
- 长上下文约束:把部分时间步仅作为上下文使用,写入快速权重但不参与动作损失。基于这一机制,模型可以从两类上下文中学习——人类视频模仿(one-shot)和 DAgger 蒸馏纠错。
实验结果:上下文越长,闭环表现越好
研究团队在三个长程双臂装配任务上对 RoboTTT 进行了评估:
- 主评估:RoboTTT 平均任务完成分数达到 79%,高于单步上下文基线 GR00T N1.7 和将 TTT 层替换为 Gated DeltaNet 的 GDN;在平均约 5 分钟、包含 10 个阶段的「Gear Bot」任务上,RoboTTT 是唯一完整完成任务的方法。
- 预训练长度扩展:把预训练上下文从 128 扩展到 8K 时间步后,RoboTTT-8K 平均任务完成分数达到 71.5%,比 1K 版本高 63%,比短上下文基线高 57%;作为对比,GDN 没有获得同样的性能提升。
- 一次性模仿:在电路装配任务中,机器人仅凭上下文中的人类视频判断要装配哪种配置,RoboTTT 在 10 次未见配置试验中成功 6 次,得分 65%;GDN 没有取得完全成功,得分仅 33%。
- 扰动恢复:人类在执行过程中移除已安装部件时,RoboTTT 能根据自身部署情况返回并重新安装。车顶被移除时恢复率为 75%(GDN 65%、短上下文基线 50%);轮胎被移除时与 GDN 同为 90%,均高于短上下文基线。
- 即时纠错:DAgger 蒸馏让 RoboTTT 学习到一种隐式纠错算法,能在线从自身错误中恢复,无需人工干预,平均提升 33%,远超标准 DAgger 的 9%。
不足与未来方向
研究团队也坦承几点局限:
- 训练成本:推理时成本保持恒定,但训练更长上下文仍会带来额外开销,未来需要更高效的 TTT 训练技术(如 TNT)来降低开销。
- TTT 目标函数:当前方案仍是对 TTT 整合方式的初步探索,面向机器人的 TTT 层目标函数(类似视觉领域的相关工作)是下一步值得研究的方向。
- 失败模式覆盖:RoboTTT 尚未覆盖部署中可能出现的全部失败模式;与强化学习结合、直接优化任务成功率,有望进一步提升实际执行表现。
