桃子桃子快讯
返回首页
行业动态

Figure Index全球上线,众包模式能否被中国复制

Figure Index全球上线,以众包模式采集家务视频训练机器人,引发中国具身企业数据竞赛讨论。

2026.08.27 · 周四6 分钟阅读

Figure 旗下数据采集众包平台 Index 于 8 月 26 日正式在全球上线,四个月测试期已积累 1600 万段家务视频、向创作者支付 1500 万美元,并承诺未来 12 个月投入超 10 亿美元用于数据与算力。这一动作把「数据即壁垒」的逻辑摆到台面,也给中国具身企业的数据采集路线出了一道新题。

Index 的核心:把日常家务变成训练燃料

Index 的前身是 Figure 在四个月前低调上线测试的一款 APP,8 月 26 日正式更名 Index,并在 Google Play 与 App Store 全球同步发布。

  • 玩法:创作者注册后,录制自己叠衣服、洗碗、拖地等家务或工作场景的第一视角视频,上传通过审核即可获得报酬,也可以雇佣零工上门干活并同步录制。
  • 计酬:按数据质量和数量付费,不要求人工打标签——Figure 要的是真实环境中的原生视频,而非标注数据。
  • 规模:测试期内已覆盖 108 个国家和地区,累计上传 1600 万段视频,向创作者支付 1500 万美元,未来 12 个月计划投入超 10 亿美元。
  • 颗粒度:每 1000 小时数据平均包含 373 种独特任务、1146 种被操作对象、116 个独特环境;平台每秒可处理 30 分钟的视频上传,背后是一套 7×24 小时运转的数据基础设施。

Figure 估值已达 390 亿美元。其 Helix 模型是一套端到端的 VLA(视觉-语言-动作)系统:70 亿参数的视觉语言模型负责理解任务,8000 万参数的视觉运动网络负责实时控制。这类模型对数据的需求是「海量、多样、高质量」——供应商给不了,公司决定自己建。

为什么是数据:具身智能的「数据饥渴」

大模型的能力爆发建立在互联网上动辄数万亿 Token 的文本数据之上——仅 GPT-4 的训练数据量就超过 13 万亿 Token。但具身机器人面对的是相反局面:它没有互联网。

光轮智能总裁杨海波此前受访时算过一笔账:具身智能的数据需求,至少是大语言模型的 1000 倍。全球 81 亿人每天清醒时间超过 12 小时,理论上每天产生约 1000 亿小时的物理交互数据,但其中绝大部分从未被记录过。Figure 想做的,就是用「众包 + 经济激励」的方式,把这 1000 亿小时里的一小部分「捕获」回来,变成机器人的训练燃料。

中国企业的五条数据路线

国内具身企业并非没意识到数据的重要性,几乎所有头部玩家都在重金投入采集,但路线各有不同。

  • 智元机器人:自建 2000 平方米真实采集场,覆盖 217 个任务、3000 余种物品,数据规模 850TB;2026 年 4 月开源 AGIBOT WORLD 2026 数据集。英伟达 GR00T N1 模型 80% 以上的真机训练数据来自智元开源数据集。Omdia 数据显示,2025 年智元通用人形机器人出货 5168 台,全球份额约 39%,位列第一(统计口径存在争议)。
  • 宇树科技:2025 年人形机器人出货超 5500 台(按纯双足人形口径自称全球第一);2026 年 3 月开源 UnifoLM-WBT 数据集,包含 340 小时、189 万条动作轨迹。走「硬件 + 数据流水线 + 模型训练 + 开源社区」一体化路线。
  • 优必选:2025 年全年订单近 14 亿元;牵头的国地共建创新中心发布 RoboMIND 数据集,覆盖 279 个任务。路线偏「内部闭环」,数据围绕自身本体和任务统一设计。
  • 自变量机器人:2026 年 4 月发布全球首个世界统一模型 WALL-B(WUM 架构),坚持 100% 真实场景数据采集;2026 年 7 月推出 QUANXTA Zero 无本体数采方案,宣称可将模型完成简单任务的数据成本整体降低约 60%。创始人王潜坦言:「机器人其实硬件到位了,但是大脑没有跟上。」
  • 其他玩家:星海图开放 GOD 真机数据集;银河通用走「合成数据打底、真实数据校准」路线;傅利叶在医疗康复场景中持续积累;千寻智能、穹彻智能与第三方数据服务商 37 度数据合作。

共性很明显:国内具身企业的数据采集,要么自建工厂(重资产),要么依赖开源社区(速度慢),要么外包给第三方(质量难控),每条路都有天花板——没有人像 Figure 那样,用「众包 + 经济激励」让全球数万人同时为自己「生产」数据。

中国版 Index:能不能做、要不要做

Figure 模式的核心不是技术,而是「网络效应」:108 个国家、1600 万段视频、1500 万美元创作者报酬,构成一个数据越多—模型越强—平台越值钱的飞轮。

国内企业若要复制,面临三层现实障碍:

  • 隐私与合规:上门拍摄家庭内部视频涉及隐私权、肖像权、数据安全等多重监管,合规门槛高于欧美。
  • 成本结构:尽管中国人均录制成本更低,但要让普通人觉得「值得做」,平台补贴规模不能小;自变量即便把数采成本降低 60%,依然是重资产投入。
  • 数据多样性:中国家庭环境差异极大,若只做国内市场则多样性受限;若做海外则要面对文化差异和运营成本。

但机会同样明显:14 亿人口、全球最完整的制造业供应链、相对较低的运营成本。如果能解决合规和激励机制,「中国版 Index」的潜力不容小觑。

瑞银证券中国工业行业分析师王斐丽今年 4 月判断:人形机器人行业的「电动车时刻尚未到来」,当前大量出货仍流向科研机构和数据采集中心,真正的商业化拐点尚未出现。今天的数据竞赛,本质上是在为那个拐点积累筹码。

Figure 投入 10 亿美元建 Index,不是为了现在变现,而是为了在机器人真正走进千家万户的那一刻,拥有别人无法复制的数据壁垒。对中国具身企业来说,比「再造一个更大的数据集」更紧迫的,是建立各家数据能对话、能流通、能协同训练的通用规则——这背后是整个行业的「接口定义权」。

信源