具身智能 8 个月倒计时:从单步动作到任务级交付
毕马威报告、900 亿元融资与工信部实训要求叠加,逼 WAM 单步优化范式在 8 个月内转向任务级 WTM。
导语
WAM 在基准测试上已经把 LIBERO 刷到 99.25%、RoboTwin 94.3%,但一个 10 步任务每步 95% 连乘下来只剩 60%。作者认为,这一数学事实正与甲方账本上的 KPI 正面碰撞:随着毕马威、IDC 等机构把投资评价维度从「参数与演示」切换到「任务完成率、泛化能力、单位部署成本」,加之 2026 上半年国内具身智能赛道融资突破 900 亿元、同比增长 5 倍,工信部、国资委关于年底前人形机器人产线常态化运行的硬要求,以及头部 3C 厂把「任务完成度」「换型效率」列为招标一票否决项,从 2026 年 8 月算起的 8 个月窗口,将成为 WAM 范式退场、WTM(任务级世界模型)登场的最后期限。
单步神话为何撑不起产线 KPI
WAM 优化的目标函数是 P(aₜ|oₜ,I),即在当前观测和指令下,下一个动作的对错;WTM 优化的是 P(success|τ),整条轨迹的任务完成率。两者的根本差别不在工程细节,而在优化目标。
毕马威在 WAIC 期间发布的报告将「长时序误差累积」列为世界模型商业化三大核心难点之一:模型在虚拟环境中学到的规律一旦在真实执行中出现微小偏差,后续所有预测都会偏离真实轨迹,任务越长偏差越大。WAM 架构上缺少任务级纠偏机制,误差在任务进度空间里只会被一路乘到任务结束。与此同时,主流 VLA/WAM 路线依赖海量预训练数据,一旦换 SKU,沾水、形变后的物料就需要重新采集、重新标注、重新微调,换产成本难以压到分钟级。此外,工业接触操作需要上百 Hz 级的实时反馈,而 WAM 大模型方案的推理时延难以满足这一要求。
三笔账算下来,WAM 的每一个技术指标都漂亮,但没有一个直接对应甲方 KPI:甲方要的是良率提升 5 个点、换型从一周压到分钟、回本周期清晰可见。
资本市场已用订单和回本周期投票
投资端的信号比技术端更直接。8 月 10 日,橡木果机器人完成数亿元天使轮融资,由招商局创投、蔚来资本共同领投,水木清华校友种子基金跟投,距离其 3 月完成的近亿元种子轮仅过去四个月。两家产业资本深耕港口、工业制造与高端制造,他们投资标的不是「世界模型」,而是「能进厂干活的东西」。
橡木果 Natus AGE-0 的商业化数据具有说服力:在全球头部化妆品 ODM 厂商产线,从签约到 POC 验证通过约两个月,换产调试时间从传统方案的数周压缩到 6–40 分钟;并已与多家不同行业的全球头部客户完成抓取、装配、旋拧、插拔的产线 POC 验证。换产 6–40 分钟意味着产线可承接多品种小批量订单、单位时间产值提升、CAPEX 真的能回本。
对比之下,X-Era Lab 在东莞玩具厂做「毛绒熊耳朵对称缝合」,单机日均 187 次抓取、成功率 98.4%、节拍 22.6 秒,但这只是单一 SKU 的极致优化,换一款毛绒玩具就难以复用。WAM 厂商目前的商业化进展集中在单 SKU 极致优化或零售、仓储等相对标准场景,进入换产频繁、物料繁杂的真离散制造后,单步优势会被换产成本吞掉。
8 个月倒计时的四个叠加时间点
文章将这一窗口的紧迫性归因于四个外部约束的同步到期:
- 政策层面:工信部、国资委要求 2026 年底前人形机器人在产线跑出常态化效果;
- 市场层面:头部 3C 厂招标把「任务完成度」「换型效率」列为一票否决项;
- 评价层面:毕马威把商业化奇点判定标准聚焦于长流程任务成功率、生产节拍、设备运转效率;
- 资本层面:2026 上半年融资 900 亿元、同比 5 倍增长,demo 期必须结束。
四个时间点叠加,构成本文定义的 8 个月窗口——即 2027 年 Q1–Q2 的规模落地验收节点。
三条通往 WTM 的技术路径
按「技术储备 + 商业路径」双维度看,行业内可能的演化路线有三条:
- 第一梯队(VLA/WAM 外壳逼近 WTM):PI 的 π0.7 已引入 visual subgoal images,使用基于 BAGEL 14B 的轻量世界模型生成 near-future 目标图像,在 UR5e 双臂叠衣服任务上零样本成功率 80.0%,已接近人类资深远程操作员 80.6%。星源智的 ω-EVA 以 1.2B 参数跑出 LIBERO 98.6%、RoboTwin 90.3% 的成绩,Envision-Verify-Act 闭环是 WTM 的天然骨架。
- 第二梯队(场景限定或异类路径):酷哇的 WAIM 在移动与驾驶场景里事实上已是 WTM,CooWAIM 2.0 在 NAVSIM 拿到 89.1 PDMS,但跨入离散操作存在架构鸿沟。橡木果以触觉感知为核心、不依赖预训练数据,通过本能反射 + 肌肉记忆双层架构实现零样本泛化与毫秒级操作,是 WTM 的另一种等价实现。
- 第三梯队(纯 WAM 工程派):以极佳视界为代表的厂商有最强工程化能力(MoT、AutoResearch、85 毫秒推理),但需回头补上任务级世界建模与任务图,改造成本不小。
从「动作优雅度」到「任务完成度」
文章最后落点并非技术路线之争,而是一句工程常识:能不能让这条线的良率提升 5 个点。8 个月不是技术成熟的周期,而是甲方耐心的极限。从 KPI 对齐、资本投票到政策与招标门槛的全面收紧,WTM 不会在实验室里诞生,只会在甲方的催促声与产线的轰鸣里被迫长大。
