桃子桃子快讯
返回首页
模型发布

智在无界发布Being-H0.8:首个隐式触觉世界动作模型

基于50万小时人类视频训练,Being-H0.8首次将触觉纳入隐式世界—动作模型,在真实双臂机器人上完成捏薯片等精巧任务…

2026.07.28 · 周二4 分钟阅读

国内具身智能公司 BeingBeyond(智在无界)正式发布 Being-H0.8,称其为「首个基于人类视频数据的隐式触觉世界动作模型」。该模型将触觉感知纳入「预测—执行—反馈」完整链路,使机器人能够提前预判接触,并在执行过程中依据触觉反馈实时调整动作。在真实双臂机器人实验中,Being-H0.8 完成了包中取物、毛笔写字、挤牙膏、夹薯片等依赖精细触觉的高难度任务。

模型架构:触觉进入隐空间

Being-H0.8 由四个核心模块组成:负责预测交互后果的 Mixture of Transformers(MoT)、负责执行与实时调整的「慢—快动作专家」、负责统一触觉输入的「通用触觉编码器」,以及负责对齐人手与机器人动作空间的 TopoHand。

核心创新在于,模型并不在像素层面完整重建未来画面,而是在隐空间中预测与任务真正相关的交互后果,例如是否发生接触、接触会引发怎样的状态变化,并据此调节动作生成。「慢—快」双流设计兼顾效率与反馈:慢速流缓存视觉、语言与隐世界状态,维持整体动作计划;快速流则在动作执行中读取最新触觉,仅重生成下一小段动作。

数据底座:50 万小时人类视频

Being-H0.8 的训练数据底座来自智在无界长期积累的第一人称视频数据,规模超过 50 万小时,与数十家数据供应商合作,是目前国内规模最大的人类操作视频数据池。

团队搭建了一套面向数十万小时视频的处理管线:剔除无效片段、切分长视频、补充细粒度语言描述;使用 MANO 手部表示配合 HMR 恢复裸手运动轨迹,再利用 Caliball 补齐相机参数;针对机器人数据则重新整理 URDF,统一关节约定与相机坐标系。最终形成高质量数据集 UniHand3.0。

从无触觉视频中「长出」触觉数据

UniHand3.0 的关键步骤,是将没有显式触觉记录的视频转化为可训练的触觉数据:

  • 第一步:使用 TactoHand 在 MANO 手部 778 个顶点上预测接触标注与邻近度标注,通过三维几何关系判断接触是否真实发生。TactoHand 使用 21 个数据源、共计 3010 万帧训练。
  • 第二步:引入约 55 小时、540 万同步帧的压力手套数据,将真实压力信号投影到 MANO 表面,弥补视觉推断在物理信息上的不足。
  • 第三步:通用触觉编码器在统一手部拓扑上建立由粗到细的触觉金字塔,并通过 Perceiver 结构将不同长度、不同密度的触觉信号压缩为固定数量的触觉 token。
  • 第四步:TopoHand 将手部表示拆分为手腕位姿、形态编码、20 个规范关节角和夹爪张开量,对齐人手、灵巧手与平行夹爪的动作语言。

团队与技术路线

BeingBeyond 成立于 2025 年 5 月,创始人卢宗青是北京大学计算机学院长聘副教授、智源学者,长期从事强化学习与多模态模型研究。

Being-H 系列的发展可分为三个阶段:Being-H0 至 H0.5 验证人类视频预训练具身模型的可行性;H0.5 至 H0.7 解决跨本体学习与隐式世界建模的规模化问题;H0.8 则进入「高质量使用人类视频」阶段,重点转向数据清洗、动作恢复、触觉标注与表征统一,试图从海量原始视频中提取更具物理意义的训练信号。

对智在无界而言,核心壁垒已不只是数据规模本身,而是能否把数据收集、清洗、动作恢复、触觉标注、世界建模与机器人控制连成一条完整链路,把原始视频持续转化为机器人可学习的物理经验。

信源