桃子桃子快讯
返回首页
研究论文

NeoteAI 联合复旦连发三份报告,开源 3 万小时触觉数据集

新智具身与复旦大学发布 N0 系列三份技术报告,开源超 3 万小时视觉-触觉交互数据,并提出统一触觉表征模型及融合触觉的…

2026.07.26 · 周日4 分钟阅读

机器人插头边缘反复摩擦却难以插入、抓取塑料瓶时力道失控导致瓶身瘪陷——这类「视觉判定无误、物理交互瞬间翻车」的现象,长期困扰着具身智能的落地。近日,上海新智具身智能科技有限公司(NeoteAI)联合复旦大学可信具身智能研究院,正式发布 N0 系列三份技术报告,把触觉从「辅助模态」跃升为「核心基建」,并同步开源项目数据与模型。

N0-Foundation:统一触觉「方言」,构建 3 万小时语料库

触觉数据的规模化应用长期受制于设备格式互不兼容:凝胶形变图、电容矩阵、六维力向量犹如缺乏统一语法的方言,难以在同一模型中融合。为此,NeoteAI 搭建了 NeoData 数据集,关键指标如下:

  • 包含超 3 万小时视觉-触觉交互操作数据;
  • 约 140 万条操作片段,33 亿个时间步;
  • 对应 80 亿帧 RGB 画面与 100 亿帧触觉图像;
  • 动用 Franka、Piper、UR5e 等 6 种机器人本体;
  • 覆盖 450 项真实长程任务,由 90 位操作员采集;
  • 已开源 5000 小时视觉-触觉交互操作数据。

研究团队同时提出 NeoForce 统一表征模型,可在底层硬件各异的情况下学习到具备迁移能力、时序结构化的触觉表征,相当于为机器人提供了一套「触觉普通话」。

N0-VTLA:用「触觉预判」赋能轻量级 VLA

触觉信号仅在接触瞬间产生高频响应,其余时间处于「静默」状态,极易被海量视觉 Token 淹没;同时,当前触觉本质上是对已发生动作的滞后反馈。N0-VTLA 给出的方案是:不依赖当前触觉,而是预测未来 50 步内的触觉演变。

模型将当前触觉编码为紧凑潜在 Token,结合视觉上下文预判滑移、受力等趋势,指导动作模块提前调整。实测数据显示:

  • 插插头任务成功率 85%,而纯视觉方案仅 60%;
  • 拔钥匙任务成功率 99%,纯视觉方案为 35%;
  • 在毛巾折叠、书包收纳、纸箱折叠等长程任务上,成功率从 50%、35%、20% 大幅跃升至 95%、80%、75%。

此外,模型结合部署后数据与 human-in-the-loop 数据训练进度评估模型,能够识别「退步」与「救场」等复杂行为,再借助离线强化学习实现从失败经验中持续进化。

N0-TWAM:在世界模型中重构「触觉想象」

如果说 N0-VTLA 是加装预判雷达,N0-TWAM 则对机器人「认知中枢」做了重构:它把触觉放进世界模型,让机器人在动手之前先在「想象」里完整推演操作视角和手感。

N0-TWAM 采用混合专家架构,内置视频、触觉、动作三个异步专家网络,视频专家从预训练模型热启动,总参数量 72 亿,仅为全宽方案的一半。测试结果如下:

  • 仿真平均成功率 84.5%,世界模型最强基线仅 36%;
  • 真机 8 项任务平均成功率 46.3%,LingBot-VA 为 21.9%。

消融实验进一步证实,去除「未来触觉预测」或「当前触觉条件」均会导致性能显著下降,确立了触觉在世界模型中的不可或缺性。

触觉:具身智能的下一个 Scaling Law?

三份报告合起来看,释放出明确的行业信号:N0-Foundation 验证了触觉模态具备类似视觉的 Scaling 潜力;N0-VTLA 证明触觉可自然接入现有 VLA 架构;N0-TWAM 确立触觉在世界模型顶层设计中的核心地位。这意味着机器人的认知范式正从「视觉驱动」向「视触融合」演进,开始像婴儿一样通过主动的触觉探索来验证假设并规划下一步动作。

尽管真实场景下的数据采集成本、跨本体泛化能力与推理实时性仍是工程难题,但 NeoteAI 的这组工作已实质性推动触觉从「小众研究方向」跃升为「具身智能核心基建」。具身智能的下一篇章,或许不再仅仅是「让机器人看懂世界」,而是真正「让机器人摸透世界」。

项目链接:https://research.neoteai.com

信源