面壁智能开源 1.5B VLA 模型,进入具身智能第一梯队
面壁智能发布 MiniCPM-Robot 系列:1.5B 通用 VLA 模型在主流榜单跻身第一梯队,延迟接近 π0.5…
面壁智能在世界人工智能大会(WAIC)期间正式发布并开源 MiniCPM-Robot 系列模型,包含 1.5B 参数的通用 VLA 模型 MiniCPM-RobotManip 与 0.9B 参数的跟踪导航模型 MiniCPM-RobotTrack,同时配套开源具身智能推理框架 PhyAI。整套发布瞄准的是「模型小、跑得动、用得起」的真实机器人落地需求。
模型组合:操作、跟踪、推理框架三位一体
MiniCPM-Robot 系列由两个分工明确的模型加一个底座组成:
- MiniCPM-RobotManip:1.5B 参数的通用 VLA 模型,控制机械臂完成三明治组装等长程操作任务。
- MiniCPM-RobotTrack:0.9B 参数的跟踪导航模型,基于 MiniCPM4-0.5B,让机器狗根据自然语言指令在动态环境中持续跟住指定目标。
- PhyAI:由明体科技联合北京邮电大学、北京大学研发的开源推理框架,负责把不同 VLA 模型更快地适配到真实硬件上。
1.5B 跻身第一梯队,延迟接近 π0.5 一半
在 LIBERO、Calvin、RoboTwin2 等主流 VLA 评测中,MiniCPM-RobotManip 整体表现进入第一梯队,与 π0.5 等模型处于相近水平。真正拉开差距的是上下文记忆能力:
- 在专门考察上下文的 RMBench 上,π0.5 得分约为 10 分,接近随机水平;MiniCPM-RobotManip 达到约 53 分。
- 在 H100、bf16 精度下,单次决策延迟约 120 毫秒,π0.5 约 234 毫秒,前者接近后者一半。
背后是两个关键工程手段:视觉 Token 压缩与流式计算。前者让模型用更短的数据表示保留关键画面内容,后者让已处理的历史信息可以复用,新画面只需接续计算,避免任务越长计算量越滚越大。
机器狗本地 5Hz,断网仍能持续跟踪
MiniCPM-RobotTrack 围绕宇树 Go2 做了端侧系统级优化,关键指标包括:
- 原生本地算力下稳定 5Hz 以上,端到端响应延迟约 180 毫秒。
- 单目标、多人干扰、模糊指令三类任务的跟踪率分别为 89.8%、73.4%、80.4%,均为开源方案最优。
- 相比 OpenTrackVLA,三项跟踪率分别提升 7.0、14.6、6.5 个百分点;相比闭源 TrackVLA++,单目标与模糊目标跟踪分别高出 8.8 和 17.0 个百分点。
面壁还搭建了一套自进化数据管线,先清洗异常轨迹,再让模型在仿真与真机中主动暴露薄弱环节,由专家策略纠偏后回流训练,针对目标横穿、快速转向、短时遮挡等长尾场景持续补强。
PhyAI 推理框架:把模型更快搬到真机
PhyAI 解决的是「模型训完到跑上硬件」之间的工程鸿沟:
- 在 RTX 5090 上运行 π0、π0.5 和 GR00T 时,相较官方仓库分别实现约 2.85 倍、1.82 倍和 2.28 倍加速。
- 适配 MiniCPM-Robot 系列时,先通过 CUDA Graph 把推理帧率从 10.12Hz 提升到 33.28Hz,再借助定制融合算子在 H20 上进一步提高到 36.77Hz。
围绕宇树 Go2 的完整运行链路,PhyAI 配合模型实现了拔掉网卡也能基于本地摄像头画面与文字指令完成识别、跟踪与运动控制。
落地合作:从展厅到工厂
模型之外,面壁也披露了两类典型落地合作:
- 与乐聚机器人合作:把端侧多模态大模型、夸父本体与导航系统组合为展厅导览 Agent 与园区巡检 Agent,前者在无网环境下基于本地知识库完成讲解与避障,后者把敏感画面留在本地。
- 与吉利汽车合作:共同训练 VLA 模型,通过 RoboHarness 把 VLM、VLA、本体与导航系统串成执行框架,让机器人在生产仓储中完成长程任务,并形成可治理的数据闭环。
模型权重、开源部署脚本与运行流程已同步发布在 GitHub 与 HuggingFace,社区可基于 Go2 Edu 等平台自行复现。1.5B 与 0.9B 的参数规模本身不是终点,更像是对「当 AI 长出手脚,除了聪明,还必须跑得动、用得起」这一现实问题的正面回答。
