开源
NVIDIA 与伯克利开源 T-Rex:让机器人拥有触觉感知
NVIDIA 与伯克利开源 T-Rex 触觉学习方法,以双时钟异步 Transformer 架构将触觉作为一等公民,同步…
2026.08.22 · 周六约 2 分钟阅读
NVIDIA 与加州大学伯克利分校联合开源了一套面向机器人触觉感知的方法 T-Rex,并把「触觉」作为模型的一等公民重新设计整套架构。项目负责人 Jim Fan(NVIDIA)指出,触觉是机器人领域被严重低估的模态——视觉在物体接触发生的瞬间就会力不从心,而这一次,研究者希望让机器人真正「感受」接触力。
双时钟异步 Mixture-of-Transformer
T-Rex 的核心是一套在不同频率上运行的 Transformer 组合:
- 慢速视觉运动专家(visuomotor expert)负责整体动作规划;
- 快速触觉专家(tactile expert)在每个「视觉 tick」内进行 4 次「触觉 tick」的高频修正。
由于力的变化速度快于摄像头帧的更新频率,单一时钟无法兼顾「看」与「摸」,于是架构必须异步运转,由触觉专家接管接触瞬间的精细调整。
迄今最大规模的触觉数据集
团队同步开源了一份约 50 小时、约 5,500 段 episode 的高质量机器人操作数据集,号称目前已知最大的公开触觉数据集。其采集于当前最优的触觉手硬件,灵巧操作自由度达 22,且经过精细的多模态时间同步处理。该数据集现已在 HuggingFace 上发布,配套方法与训练流程一并开源。
训练策略:EgoScale 的自然延伸
T-Rex 的训练方法延续了团队此前的 EgoScale 工作:先在人类第一人称视频上进行大规模预训练,再加入丰富的触觉机器人操作数据进行「mid-training」。实验结果显示,这种「无接触预训练 + 强接触中训」的组合,能够很好地把视觉先验迁移到精细接触操作任务上。
谁在做、为何重要
该项目是 NVIDIA 与 Berkeley 的合作研究。研究者认为,视觉像素虽多且易得,但在接触发生那一刻就会力竭;而触觉将承接机器人操作「最后一公里」的任务——下一轮的扩展曲线,将以「触觉小时数」来衡量。
