具身数采进入有效数据稀缺阶段
具身智能数据行业有效率不足10%,高质量、多模态、多样性成新门槛,数据公司商业模式正被重构。
2024 年上半年,多家具身智能数据采集公司遭遇了同一类问题:批量购入的数据中,真正能进入训练并对模型能力产生增益的有效部分不足 10%。钱是按全量数据付的,实际用上的只有十分之一。这并非孤立的「数据欺诈」事件,而是整个行业低估数据质量代价、高估数据规模价值后集体踩过的坑——具身智能的瓶颈正在从「缺数据」转向「缺有效数据」。
从规模焦虑到有效率焦虑
过去一年,围绕「如何快速拿到百万小时级数据」的竞争迅速升温。业内技术负责人普遍估算,要训练出一个真正可用的具身模型,需要 100 万到 200 万小时的训练数据。以 UMI 为代表的「无本体、野外采集」路线因此走红:通过手持夹爪与视觉等便携设备,把人类在真实环境中的操作转化为机器人可学习的轨迹,从而大幅降低采集门槛。
但当行业把「规模化」理解为第一目标时,第一视角视觉数据的局限性开始凸显。这类数据能告诉模型「看到了什么」,却未必能完整描述「为什么这样动、接触发生在哪里、用了多大的力」。手部遮挡、空间深度、接触状态、力觉和触觉,都是单一视觉输入的天然盲区。当具身模型向更复杂、更精细的物理交互发展时,单一视觉模态已经越来越难覆盖模型真正需要的信息。
三个维度:高保真、多模态、多样性
行业逐渐形成共识:高价值具身数据需要同时满足三个条件——高保真、多模态、多样性,且这三者构成层层收窄的筛选关系。
- 高保真:数据表达形式和精度需要接近真实的人-物交互维度。例如,人类与物体的真实接触面是皮肤而非骨骼,仅记录手部骨骼运动可以描述手在哪里,却未必能精准刻画手与物体发生物理接触的位置。
- 多模态:语言模态提供长时序任务的语义和意图,触觉、力觉等则补充视觉之外的接触反馈。硬件也开始从局部手部采集向「头+手」等更完整的人体操作视角演进,采集路线正从单一视觉轨迹走向视觉、触觉、语言等多模态信息融合。
- 多样性:避免模型在限定的 4-5 个特定任务上表现良好,但切换环境、物体或操作方式就迅速失效。真正有价值的数据要让模型看到足够多的任务、环境、物体、操作方式与失败情况。
规模化为何难?
高质量与规模化的兼得并不容易。数据采集链路涉及设备、传输、存储、清洗、标注、治理到训练等多个环节,每一个环节都必须同步扩容:
- 精度越高,传感器、校准和计算要求越高;
- 模态越多,同步、传输和数据治理复杂度越高;
- 设备越复杂,越容易影响采集者动作的「自然性」,原始数据质量随之下降。
头部具身数采公司透露,跑通无本体采集完整商业链路需上亿元资金投入。简智机器人等行业方认为,「野采」看似轻量,实际是一门重投入生意。从成本结构看,治理仍是占比最高的环节,其次是硬件,最后是场地、运营和人力。供应链成熟后硬件成本有下降空间,众包模式正在替代自建数采场,但治理成本能否下降,取决于数据公司的算法与自动化能力——未来真正决定治理成本的,是能否用更少的人处理更多的数据。
数据公司卖的不再是数据
单纯卖原始数据的市场空间有限。如果一家数据公司能进一步成为模型公司的数据基础设施,价值将完全不同。Scale AI 是典型案例:2024 年 6 月,Meta 以约 143 亿美元取得 Scale AI 约 49% 股权,并让创始人 Alexandr Wang 加入 Meta 负责新的超级智能实验室——这不是一次简单的买数据,而是巨头对数据基础设施价值的重注。
类比语言大模型中的 Token 概念,具身智能真正需要的,是那些能直接对模型能力产生增量的有效训练数据。某种意义上,模型需要的不是数据本身,而是数据中包含的「有效技能信息」。数据会越来越不值钱,但持续产出有效「技能 Token」的能力,会越来越值钱。
与此同时,数据本身具有明显时效性——模型在变、机器人在变、任务与数据格式也在变,几年前采集的数据即使当时有效,今天也未必适用。一次性把数据卖出去的商业价值非常有限,离客户更近、能持续拿到反馈并迭代的数据公司,才能在长期竞争中站稳脚跟。
