宇树敲钟、市值破 4000 亿元,2026 WRC 现场没有「哇」的时刻,但具身智能正在进入本体分化、通用模型竞争、数据…
8 月 19 日,2026 世界机器人大会在北京亦庄开幕。300 多家企业、2000 多件展品,把大模型、本体、关键零部件和数据几乎全部搬到现场。开幕当天,宇树科技正式敲钟上市,盘中市值一度冲破 4000 亿元,被视为过去十年中国机器人行业最接近「资本狂欢」的一天;云深处科技进入交易所受理或审核环节,智元机器人于 7 月确认启动赴港上市流程。一级市场的热正在向二级市场传导,具身智能不再只是技术想象,而是被要求回答收入、交付、毛利和规模化的问题。
但逛完整个展区后,今年并没有出现让所有人「哇」的时刻,更多是已有产品的 demo 展示。比起追问「什么时候会有奇迹」,更值得追问的是几个更朴素的问题:机器人是不是只能长成人的样子?具身智能的「通用性」走到了哪一步?数据正在从一门算法生意变成一门硬件生意吗?关键零部件又往前走了几步?
过去具身智能的叙事被人形机器人高度占领:跳舞、跑步、打拳、马拉松,所有出圈事件几乎都长着一副人的样子。本届 WRC 上,「像人」不再是唯一标准答案,巨型、仿生、半人马形态同时出现,越来越多公司开始根据真实任务重新设计机器人形态。
宇树科技带来全新格斗动作:G1 打出组合拳、回旋踢、飞踢,靠全身关节实时协调;H2 个头更大、关节输出更强,出拳抬腿更有分量感;两者分别代表「灵活」与「力量」两种风格。乒乓球互动考验的是机器人先「看懂」来球再决定如何回击,比单纯套路更考验感知与决策的协同。最显眼的还有 3 米高、可载人变形的机甲 GD01,把机器人技术与装备形态揉在一起,冲着文旅、特种作业等场景。
维他动力正式发布人形具身智能终端 Vbot ATOM 并开启预订。其前身四足机器狗「大头」于 5 月实现量产交付,累计完成 126 万次大模型交互、23,700 公里用户伴随里程和 131,500 小时陪伴,过去三个月完成 4 次 OTA。基于这套真实场景验证,Vbot ATOM 从家庭、零售、公共空间和办公服务等生活场景反向定义形态:160 cm 身高、180 cm 臂展、31 个自由度,采用织物包覆与静音足底。维他动力同步发布「Vbot Embodied Genome|具身基因组」模型体系,用于支撑交互理解、世界模型决策和真实反馈回流。
未来不远机器人围绕家庭场景设计,已进入 500 多个付费家庭,累计服务超过 5 万小时。本届 WRC 上,其第二代全栈自研本体 F2 搭载自进化 WAM 世界动作模型,端到端完成意面制作全流程,包括双臂同步协同、视觉瞬时用量判断、多厨具切换和火候自学习。
自变量机器人在物流分拣场景中未使用完整人形与五指灵巧手,而是用两条机械臂配合普通夹爪处理随机包裹:小件直接抓取,重箱可以推,异形件则自主判断后续流程。公开直播数据显示,系统连续运行一小时分拣效率达 1816 件/小时,准确率超过 98%。
具身智能的通用性,指机器人能否跨物体、跨环境、跨指令完成复杂任务,并能在新场景中重新规划。当前头部公司路线远未收敛,主要分为四类:端到端 VLA(视觉—语言—动作)/ WAM(世界动作模型)、分层具身智能体操作系统、跨本体具身基础模型,以及世界模型路线。
银河通用在 WRC 发布的双足人形机器人 Galbot ET1「银河·星仔」,可通过视觉实时观察人的动作并模仿舞蹈与高动态动作,集成「LATENT」高动态网球对抗框架,支持真人感网球陪练。其背后是 AstraBrain WBC 全身实时运动控制小脑基座模型。银河通用强调「一颗大脑跨本体、跨任务、跨场景」:Galbot G1、S1 与 ET1 等不同形态机器人在家庭、零售、工业场景各自应用,但共享同一套具身智能基础模型,感知、任务理解、世界建模与行动规划能力可复用。
未来不远基于 AVLA 构建视觉、语言、动作端到端闭环,进一步推出 Self-Evolving WAM,让机器人预测动作结果并用真实家庭执行数据持续迭代。以洗衣场景为例,模型基于几十种洗衣机训练后,已可泛化到数百种不同机型、开门方式与按钮类型。
自变量重点展示其模型 WALL-B 的通用性:家庭服务与物流分拣两个差异极大的场景运行同一套模型,将视觉、语言、触觉、动作与物理预测融合进统一网络,让机器人理解重力、惯性、摩擦并预判动作结果。
逐际动力 COSA 0.5 采用分层架构:System 2 负责场景理解与任务调度,System 1 调用 VLA 等操作技能,System 0 以最高 1000 Hz 进行全身运动控制。星海图 G0.5 则通过统一动作编码,让同一套模型适配不同机器人本体;搭载 G0.5 的 R1 Lite 可在移动中完成环境理解、任务拆解、双臂操作与异常恢复。千寻智能 Moz1 挑战长程任务,例如收到「整理餐厅」指令后,能连续完成环视、取物、移动、开门、放入、关门、送碗入洗碗机,并在目标物被移走或环境被打乱后重新感知与规划。
在应用层面,让机器人像人一样进入家庭与公共空间、完成需要安全考虑的人机交互,成熟度仍相对不足;但在工厂、仓库等相对封闭场景,机器人已能完成较复杂的长程任务。例如星动纪元星动 M7 连续完成随机包裹识别、抓取、翻面单、送入传送链路等动作,已在中国邮政等物流中心落地,最高每小时 1200 件。
无论通用能力还是垂直场景能力,模型都需要大量高质量数据。当前主流采集方式包括遥操作、无本体 UMI 与数据手套、第一视角采集与动捕、真机本体采集,几乎每一种都涉及硬件,数据采集因此被戏称为「一门硬件生意」。
但数据本身的价值在于反哺模型进化。光轮智能构建 Real2Sim2Real 数据闭环,SimFoundry 通过真实物体参数测量与自研物理求解器,提高衣物、线缆等柔性物体的仿真精度;RoboFinals 用于机器人大规模评测,让模型在进入真实场景前先经过系统验证。极佳视界则走世界模型路线,GigaWorld 根据机器人动作推演环境变化、批量生成训练与测试数据,GigaWorld-1 进一步加入动作建模与物理参数估计。
相比单纯采集,为模型提供数据并形成数据飞轮更具价值,而这需要进入具体场景、与机器人协作、用真实产生的数据迭代模型。银河通用构建「银河星数(AstraData)」数据基座,将互联网数据、人类行为数据、仿真合成数据、真机遥操与真实场景回流数据统一用于训练;通用小脑模型 AstraBrain-WBC 0.5 使用约 2 万小时、20 亿帧人类动作数据训练,工程优化后推理延迟低于 1.5 毫秒,整条动捕链路延迟小于 20 毫秒。智元机器人则推出数采 2.0 体系,基于 430 余个真实场景搭建真机、无本体与多源数据金字塔,把模型评测、场景落地、实景适配测试和运行数据回流纳入同一体系。
具身智能仍处于早期,甚至比很多人期待的更早期。本届 WRC 没有「颠覆性突破」,但本体形态正在分化,通用模型路线在多条路径上并行推进,数据闭环从纯算法走向「硬件 + 场景」融合。谁能把模型、本体、零部件与工程能力形成闭环,谁才可能成为下一阶段真正有价值的公司。