蚂蚁、腾讯、阿里等大厂密集开源具身基座模型,自变量、银河通用等独角兽加速搭建数据与场景闭环,行业围绕「通用大脑」展开新一…
具身智能的竞争,正从本体的量产交付迅速上移至「大脑」。2025 年 7 月以来,蚂蚁集团旗下蚂蚁灵波科技宣布全面开源具身基座模型 LingBot-VLA 2.0 并同步开放后训练工具链;此前半年,腾讯开源混元 3D 世界模型 2.0 并迭代具身智能开放平台 Tairos;阿里则更早一步与英伟达在 Physical AI 领域达成合作,将具身智能写进云版图。大厂、垂直独角兽、本体厂商几乎在同一时间窗口集中开源 VLA 模型、数据集与训练工具,折射出「灵魂」定义权之争已然白热化。
具身智能并非一夜之间成为云厂商的新宠。在产业主要矛盾仍集中于本体量产交付的阶段,云厂商的第一动作是向所有参与者出售 GPU 与存储,这是风险最低的选择。但随着客户需求从同质算力延伸至数据处理、仿真与后训练,AI 云的供给形态开始生变,推动资源向开源具身模型倾斜。
这一逻辑与语言模型时代如出一辙:基础模型被嵌入云、代码、数据库等应用,能力经由产品入口转化为 API 请求与 Token 消耗,让技术优势更顺畅地转化为收入。2025 年 7 月以来,月之暗面发布万亿参数模型 Kimi K3,阿里上线 Qwen3.8-Max-preview,DeepSeek V4 正式版呼之欲出——头部大模型仍在快速迭代,能力与价格的双重竞争迫使云厂商寻找尚未完成利益分配的新市场,产业落地方兴未艾的具身智能恰好提供了这一蓝海。
更具吸引力的是「大脑」的反向规定权。模型不仅提供能力,也规定数据如何采集、动作如何表达、本体如何适配。越是具备通用能力的智能「大脑」,越有机会吸引客户在自家基础设施上「长脑子」,并反向扩充云服务的付费点。
不过,复制大语言模型路径并非易事。语言模型背靠多年积累的互联网数据,预训练完成后可通过 API 直接交付;具身模型面对的则是分散在物理世界中的视频、关节状态、力觉、触觉与动作轨迹,受实时性、数据安全与现场网络条件限制,是大厂力有不逮的长尾。更关键的是,具身智能尚未发掘出自己的「Token」——本体工作一小时的轨迹会随构型、任务难度和数据质量变化,在缺乏统一计量方式的情况下,商业模式容易困在项目制里,难以走向标准化。
具身「大脑」的竞速,归根结底是建立数据、模型、部署与回流闭环的竞速。不同产业角色各有侧重,但路径之间边界并不清晰,能力上时有交叉。
以核心支点为依据,玩家大致分化为四类:大厂向所有参与者出售算力、数据与工具;本体起家的智元、松延动力、宇树为打破出货瓶颈,「长脑子」与真机/仿真学习是必选项;以模型起步的自变量、千寻智能、智平方、星海图试图让一套智能跨越不同本体,争取软件与平台价值;更靠近场景的银河通用则利用仿真、合成数据与真实作业反馈训练模型,将能力压进零售、工业等边界相对明确的任务。
其中,自变量与银河通用代表了两条辨识度较高的路径。
自变量走横向开放路线。在旗舰模型侧以 WALL-B 强调世界建模、空间推理与事件演化;在开放生态侧通过 Wall-OSS 系列公开权重、训练、推理与评测代码。两条产品线都指向同一目标:尽可能放大模型的通用性,加速第三方生态扩张。开发者使用模型相当于替「大脑」做了前置市场教育,开源社区由此成为销售漏斗,能够完成初步验证的客户,后续可能购买后训练、数据服务、数采设备或整套机器人方案。半年以来,自变量在 B 端与顺丰、金杯股份达成合作,场景集中于机械臂与灵巧手;C 端则进入 58 同城到家平台,推出由自家机器人与保洁阿姨协同完成的智能保洁服务。
但开放也带来挑战:第三方机器人产生的数据并不会因为使用了开源模型就自动回到模型公司。自变量与 58 同城的合作便投入自家机器人,借平台之手触达家庭这一长尾场景;其自建数据工厂的时间也可追溯到两年前。向外开放模型、算法与训练框架,向内建设数采、训练与验证能力,让自变量的开源呈现出「外开内收」的鲜明特征。
银河通用走纵向一体化路线。以自研合成数据管线与自有本体模型为锚,开发者平台提供 GalbotSDK、仿真资产与分层解决方案;核心场景模型优先服务于 GALBOT G1 本体的零售、工业等商业化落地,对外同步开放遥操系统 OpenWBT、合成数据集与部分训练代码。商业合作上,银河通用深入药房、便利店与工业搬运等共性场景,如美团到家服务中的智慧零售、无人药房,并与博原资本设立合资公司,聚焦复杂装配、智能质检等制造任务。
模型、本体与场景由同一家公司控制,使银河通用的数据回流更短、迭代更快,让模型进步与客户付费形成更清晰对应;另一方面,机器人在同一套「题库」里越做越熟,并不天然证明它换一副身体、进入陌生行业后仍然聪明。药房货架间稳定取货的机器人,并不等于进入家庭或物流仓库后仍然有效。短数据回路换来商业确定性,也丢失了一些扩张的腾挪空间。
如果说自变量是在广场上搭建公共舞台,邀请不同身体测试同一颗大脑;银河通用更像经营直营连锁——统一机器人、统一工具链,再选择可复制的场景开店。无论何种路径,业务交付本身即是数据采集站。
不论闭环如何组织,越来越多具身企业将「大坶」置于更高的发展优先级。形态各异的终端硬件受自由度与制造成本约束,解决方案易被场景锁定;数据平台也受制于来源分散与标准不一。「大脑」则不然——一套模型若能跨越不同本体、任务与环境复用,便可能将一次训练形成的能力复制到更多机器人上。产业角度,「大脑」承载着最强的通用想象;市场角度,这是资本最热衷的边际成本递减故事。
VLA、世界模型、分层控制等路线仍在并行探索,每一种尚未被证伪的路线,都可能被解释为通往通用具身智能的入口。资本市场在定价上为此做了最后一次助推:当技术必要性、技术可能性与资本想象被叠加,通用溢价便已被提前计入今天的竞争。
场景落地是兑现这一切的必由之路。近一年来,不同层级的具身企业频繁与产业链企业合作,为模型找终端,为终端找场景——既有自变量机器人进入家政,也有银河通用与博世在工业领域的合作。值得注意的是,具身智能的场景共创带有明显的政企牵引特征:7 月 24 日宇树科技与成都市达成战略合作,东风柳汽与优必选、上汽北京与逐际动力等的合作也指向电力、汽车制造、工业园区等率先开放的场景。
物流恰好提供了一个观察窗口。顺丰与自变量达成合作,将部分柔性分拣任务交给具身机器人试验;另一家物流企业则沿用成熟的专用自动化,将更多资源投入企业决策大脑。两种选择并非对智能的信仰不同,而是对单位任务成本的判断不同。内部人士透露,灵巧手与通用机器人的寿命、维护成本与停线损失尚未达到大规模替代人工的条件,标准件可基本交给专用自动化设备,需要智能的异形件则不如留给人工分拣。
企业客户都在算两笔账:把环境改造成机器容易理解的样子,需要多少钱;让机器人理解未经改造的环境,又需要多少钱。前者是环境改造成本,后者是机器人智能成本。只有当柔性机器人减少的改造费用、人工投入与设备切换成本,超过其模型与本体成本,具身智能才具备商业优势。
可以预见,不同场景所需的智能将加速分层:高吞吐、固定流程的任务会继续采用专用自动化;环境多变、任务价值更高的场景,才具备购买更通用具身智能的动力。所谓「公共大脑」,也不一定是一个模型包揽所有机器人,更可能是一套被广泛采用的数据格式、硬件接口、评测体系与部署工具。大厂开源模型、独角兽争夺闭环,都是在提前押注这一刻的到来;它的溢价已经写进融资估值与资源投入,却还没有完全落到客户的账本上。