桃子桃子快讯
返回首页
行业动态

具身智能行业从拼硬件转向拼大脑

2026 世界机器人大会上,具身智能厂商正从展示运动能力转向比拼大模型与数据,融资重心与竞争逻辑同步发生迁移。

2026.08.24 · 周一5 分钟阅读

2026 世界机器人大会(WRC)期间,展台上的主角正悄然更换:人形机器人不再只是翻跟头、跑步,而是叠衣服、洗碗、做饭、搭积木、搬箱子——越来越多机器人不再依赖遥控或固定程序,而是「自己指挥自己」。无论是论坛圆桌还是厂商宣传语,出现频率最高的三个词是「具身大模型」「让机器人干活」和「自主驱动」。这些信号共同指向一个行业转向:具身智能厂商正从「秀肌肉」走向「拼脑子」。

从硬件到大模型:行业逻辑重写

过去两年,机器人公司最热衷比拼的是「身体能力」:走稳、跑跳、灵巧手抓取,运动控制和硬件本体也是彼时最容易拿到融资的方向。但在本届 WRC 上,情况明显不同。一位创投人士对《豹变》直言:「现在只会做机器人本体已经拿不到融资了,需要同时做机器人大脑;只做本体和运动控制,大概率也做不过宇树、智元这些企业。」

展会上,智平方机器人做咖啡,深朴智能洗衣服,星尘智能做饭,银河通用与蚂蚁灵波的机器人在食品、药品零售区穿梭,加速进化机器人则与人类小孩上演点球大战。这些动作未必更炫,却更贴近商业化要面对的真实场景——环境不标准、任务随时变化,机器人必须理解自身任务并在出错时调整下一步。

资本市场早已嗅到风向。量子位不完全统计显示,2026 年上半年国内具身智能融资总额超 430 亿元,其中 50.8% 的资金投向以「大模型」为主的公司,18.5% 投向「大模型 + 本体」,而纯本体项目的融资占比在 2024 年 5 月后已下降 36.8%。宇树登陆科创板后,本体及运动控制的一级市场融资竞争已接近尾声。

数据:具身大模型的新护城河

「具身大模型竞争现在本质上就是数据的竞争。」具身大模型开发者 Alex 对《豹变》表示。行业期待类似 ChatGPT 的「涌现时刻」:当机器人交互数据积累到足够规模,模型可能突然具备通用性甚至近似人类的物理直觉。谁先积累出足量、高质量的数据,谁就有机会在物理 AI 之争中抢先一步。

数据采集是当前的核心难题。可靠的真实数据不足,是大厂与初创公司共同的瓶颈。展会上某大厂工作人员透露:「自动驾驶实现需要 10 亿条数据,具身智能要想达到 ChatGPT 时刻,保守估计需要 100 亿条,而现在行业里的体量大约是 100 万条。」

采集方式主要包括三类:

  • 真机遥操作:数据可靠,但成本极高;
  • 第一人称数据 / 便携 UMI:成本可控、可靠性与泛化性兼顾,是当前业内主流;
  • 仿真数据:不依赖现实时间流速,训练效率更高,但拟真度仍是瓶颈。

WRC 展台上让观众佩戴采集设备做抓取、摆放,或通过遥操作示范任务流程的互动环节,表面是体验,背后实质是一场数据争夺。谁能更快建立「采集—训练—部署—再采集」的闭环,谁才更有可能把数据真正转化为模型能力。

蚂蚁灵波、字节跳动、京东、小米等大厂正推进各自的基座模型。蚂蚁灵波于 2026 年 1 月开源空间感知模型、LingBot-VLA 与 LingBot-World,并在 7 月推出 2.0 版本;小米于 2 月开源 Xiaomi-Robotics-0,7 月推出 2.0 版本;京东于 4 月发布 JoyAI-RA 具身大模型。这些模型除自用外,也向中小本体厂商输出,对大厂而言既增加变现渠道,也扩大数据来源。

技术路线尚未收敛:「ChatGPT 时刻」仍是未知数

当前的物理 AI 技术路线呈现多元分化,主要分为两类:

  • VLA(视觉-语言-动作)路线:通过端到端方式将视觉感知与语言指令映射为动作,落地快、成本低,但严重依赖训练数据覆盖;目前正向「快慢系统」演进——大参数慢系统负责场景理解与任务规划,小参数快系统负责实时输出关节角度与手指力度。
  • 世界模型(World Model)路线:以李飞飞的 Marble、Google 的 Genie 为代表,先构建可推演的物理世界内部模型再规划动作,具备更强的因果推理和泛化潜力,但算力耗费高、反馈慢。

新趋势是两者融合,但主导模型与融合方式各家判断不同。VLA 落地快但泛化弱,世界模型更聪明但成本高,技术信仰的分歧意味着行业远未形成统一共识。

Alex 认为,目前具身开发中「基座模型管上半身、运动控制管下半身」的状态,本质上是因为 ChatGPT 时刻尚未到来。一旦真正的能力跃迁出现,运动控制与具身大模型的统一将推动市场格局再次重写。但没人能确定,足够多的数据是否必然会带来那一刻。在那一天到来之前,资本市场的乐观与悲观、狂热与恐惧,预计还会反复循环。

信源