比算力更棘手:具身智能撞上「数据荒漠」
具身智能面临比算力短缺更严峻的数据荒,行业在真机、UMI、仿真三路线间艰难突围,闭环自迭代或成破局关键。
当英伟达 H100 一卡难求、价格炒至官方定价两倍时,AI 行业的焦虑似乎都集中在「算力荒」上。然而在具身智能领域,更让从业者夜不能寐的,是另一道早已降临的深渊——「数据荒」。据行业测算,要训练出具备通用泛化能力的具身模型,需要千万乃至亿小时级别的真实操作数据;而截至 2026 年初,全球可用的高质量物理交互数据总量仅约 50 万小时,缺口超过 99%。这意味着具身智能距离真正的通用泛化能力还差两个数量级以上,不是渐进式差距,而是根本性断档。
「算力荒」是工程问题,「数据荒」是维度灾难
算力层面的瓶颈更像产能问题。H100 的 FP8 算力接近 2 petaFLOPS,相比五年前的 V100 单位算力成本已大幅下降;台积电 CoWoS 月产能从 2023 年的约 1.4 万片晶圆,提升至 2025 年约 7 万片,预计 2026 年底增至 13 万片。产能扩张路径清晰,摩尔定律下的算力成本下降趋势未变。
具身智能面对的却是物理世界的无限复杂性,构成了一场维度灾难。
- 数据无法「爬取」:GPT-3 可吞噬约 45TB 的互联网文本,但机器人没有现成「教科书」。一个「拧瓶盖」动作背后是材质、螺纹摩擦力等无数隐藏变量,互联网从未储存过这些信息。
- 质量门槛极高:大模型训练中错别字、语法瑕疵尚可容忍,但具身智能数据中的摄像头帧率抖动、关节编码器延迟、力控传感器漂移等噪声难以定义与替换。鹿明机器人联席 CTO 丁琰指出,市面大量 UMI 设备因画面与动作无法严格对齐,产出的数据「不具备进入训练管线的条件」。
- 无法迁移复用:GPU 从 A100 到 H100 可无缝升级,而 1.6 米与 1.8 米机器人执行同一「弯腰捡拾」动作时关节角度、重心偏移完全不同,不同机器人间的数据形成天然「数据孤岛」。
算力是可复用、标准化的资源,而数据是与特定硬件、特定场景深度绑定的「非标品」。从本质上看,算力荒是暂时的、可解的,数据荒才是长期结构性的核心瓶颈。
真机、UMI、仿真三路并进,尚未有完美解法
面对数据荒,业界主要探索三条技术路线,分别代表精度、规模与成本的权衡。
- 真机遥操作:通过 VR 设备、动捕服控制真实机器人记录动作,数据真实度高。宇树科技基于 G1-D 的全栈解决方案可直接用于同款机器人训练。但代价惊人:北京人形机器人创新中心投入近 5000 平方米数采场地与 120 台机器人;智元机器人部署约 200 台机器人、数百名采集员轮班运营。固定支出高昂,更适合医疗手术、特种作业等高附加值场景。
- UMI 方案:将采集设备与机器人本体解耦,用人手持夹爪与摄像头在真实场景中操作。大衍科技曾与无人超市、前置仓合作,让员工佩戴设备日常上班即可完成采集。然而上海交大卢策吾团队指出,UMI 在规模化后面临「真实性与质量平衡」难题:摄像头角度、夹爪姿态难一致,海量低质量数据的后处理反而推高综合成本。
- 仿真合成:跨维智能开源的 EmbodiChain 100% 使用合成数据训练 VLA 模型并能直接部署于真实机器人;诺基亚联合英伟达基于 Isaac 平台将智能体训练速度提升近 10 倍。但斯坦福《2026 AI Index Report》显示,仿真环境任务完成率可达 89.4%,真实家庭场景中骤降至约 12.4%,虚实鸿沟仍是硬门槛。
短期内三条路线将在不同场景并行探索,长期看 UMI 兼顾真实性与可低成本扩充规模,或更可能成为突破数据荒的主力。
开源理想 vs. 囚徒困境
从全行业理性出发,最优解似乎是数据共享以摊薄成本、避免重复采集。乐聚牵头联合宇树、阿里云等共建的 OpenLET 已开源超 6 万分钟真机数据集;均普智能于 2026 年 6 月开源了面向真实机器人强化学习的大规模数据集 RW-RL-Dataset。
但更多企业选择了商业变现之路:京东计划两年内发动最多 60 万人采集积累 1000 万小时视频数据,并上线数据交易平台首批开放 2000 小时高精标注数据集;箸境智能在江苏省数据交易所完成全国首笔具身智能数据集交易;鹿明机器人则推出在线「数据超市」。星海图 CEO 高继扬指出,当前行业对数据具有强烈的「私有化属性」。
谁先开源,谁就可能被对手低成本复制。个体保护自身利益的理性选择,最终导致全行业重复采集、效率低下——经典的囚徒困境。除非出现强有力的行业标准与利益分配机制,否则「最优解」或长期停留在愿景中。
从「数据喂养」到「自我迭代」,数据奇点何时到来
大模型的进化已验证另一条路径:让智能体从被动等待人类投喂,转向与环境互动自主生成训练信号。英伟达研究团队开发的 Eureka 系统在 83% 的任务中超越人类专家,使机器人性能平均提升 52%;Kimi K2 则通过工具模拟器让智能体在「沙盒」中持续交互、自我迭代。
上海创智学院与智元具身研究中心联合提出的 LWD 系统,正是这一理念的具身实践:机器人在真实任务中持续积累成功轨迹、试错恢复、人为引导的失败案例并全部回传,持续微调优化模型。LWD 训练的单一通用策略在长程复杂任务中平均成功率达 0.95,远超传统行为克隆的 0.76 和离线强化学习基线的 0.86。
具身智能的「数据奇点」,可能不在于数据量的堆砌,而在于形成「采集 → 训练 → 落地 → 再采集」的闭环。可以设想:机器人学会「拧瓶盖」后,遇到滑丝瓶盖经微调扭矩成功拧开,意外经验被记录并回传,模型更新后部署给所有机器人——每个机器人的特殊状况都将变成整个机器人群的共同经验。
算力可以购买,但物理世界的经验必须亲身积累。谁能率先让机器人在真实世界中跑通「自我迭代」飞轮,谁就更可能定义下一阶段的行业格局。这场漫长的马拉松,比的不是谁拥有更多 GPU,而是谁能让机器人更好地「理解」物理世界。
