桃子桃子快讯
返回首页
行业动态

潜界科技 LatentVerse 获数亿元种子轮,要做具身原生大脑

清华博士生创立的具身智能公司 LatentVerse 完成数亿元融资,提出统一触觉动作模型路线,计划一季度后发布 16B…

2026.08.11 · 周二3 分钟阅读

具身智能公司 LatentVerse(潜界科技)已完成数亿元人民币种子轮融资,第一轮投资方包括高瓴创投、清流资本、智元、星动纪元及英诺天使等基金。这是 36 氪旗下「智能涌现」独家披露的消息。公司由 2001 年出生的清华大学交叉学院在读博士胡钰承于今年 4 月从字节跳动 Seed 离职后创立,团队成员来自清华大学、南洋理工、北京大学、Qwen、字节、小米等机构。

与传统 VLA(视觉-语言-行动)或纯世界模型路线不同,LatentVerse 选择将 VLM(视觉语言模型)和世界模型统一在同一个架构中,定位为「原生具身基座模型」。创始人胡钰承是最早一批证明「世界模型能直接指导机器人动作」的研究者之一,曾在 2024 年初提出多模态扩散 VLA(PAD),并于同年 11 月发布首个实现闭环推理的视频动作模型 VPP,被业界视为 WAM(World Action Model)的开山之作。

技术路线:统一触觉动作模型

LatentVerse 正在训练的首款模型为 UTAM(Unified Tactile Action Model,统一触觉动作模型),由团队此前提出的 UAM 演进而来,同时输出视觉、语言和触觉反馈信号。模型内部包含四个专家模块:

  • 视觉语言专家:理解任务意图;
  • 世界模型专家:将过去从视频中学到的技能组合起来,规划新任务流程;
  • 动作专家:从推理链中生成粗粒度的 Latent action,如「伸手去拿杯子」;
  • 触觉专家:将粗动作解码为精细的末端控制信号,在手指触碰杯壁后实时调整力度与姿态。

前半段为开环执行,后半段为触觉闭环修正,模拟人类「先伸手、再凭手感微调」的操作逻辑。

数据策略:三层来源与无本体采集

LatentVerse 的数据策略分为三层:

  • 摇操数据(VR 采集、带精确动作标注)只用于训练动作专家;
  • 人手采集的 Ego-centric 数据用于训练理解与世界模型专家;
  • 开源视频数据同样用于训练理解与世界模型专家。

团队押注无本体数采路线,正在自研数据采集手套,并与部分采集基地展开合作。胡钰承表示,目标是通过可穿戴设备让非专业人士参与采集,将单小时采集成本从千元级别降至百元以内。

进展与规划

  • 计划一个季度后发布首个参数量为 16B 的具身基座模型;
  • 目标在一年到一年半内积累数十万小时训练数据;
  • 场景聚焦酒店清理、家庭抓取柔软物体等需要泛化、长程与灵巧操作能力的非结构化环境。

胡钰承认为,泛化、长程与灵巧不是三个彼此独立的技术指标,而是机器人商业化必须同时满足的能力条件。他强调,具身模型的能力涌现不能简单照搬 LLM 的发展路径,在推动数据规模化的同时,也需要充分利用异构数据中的结构化信息,构建统一表征。

目前,LatentVerse 团队覆盖具身智能核心算法、灵巧手、仿真、三维视觉等方向,整体较为年轻精炼。这家成立仅数月的公司,正试图在具身智能赛道走出 VLA 与纯世界模型之外的第三条路线。

信源