「中国版 Index」觅蜂派上线:众包模式要把具身数据采集社会化
觅蜂科技推出「觅蜂派」具身数据众包平台,已部署 2 万套自研采集设备,累计采集百万小时数据,服务腾讯、蚂蚁等客户。
9 月 23 日,觅蜂科技正式推出具身数据众包服务平台「觅蜂派」,以「硬件 + App + 数据引擎」三位一体的形态,对标 Figure 旗下的 Index 平台,自称为「全球首个全品类高质量物理 AI 数据众包服务平台」。这也是继 Index 之后,全球范围内第二个以众包模式大规模采集无本体具身数据的尝试。
平台架构与设备规模
觅蜂派的核心是 MEgo 系列无本体采集终端,包含两款产品:
- MEgo View:面向 Ego(第一人称)数采场景,采用头戴式全景相机加腕部特写相机,头部视角记录环境,腕部视角补充操作细节。
- MEgo Gripper:轻量化 UMI 采集夹爪,标配三维触觉,整机重量不到一斤。
觅蜂方面披露,目前 MEgo 设备已下线 2 万套,产能达到数万套/月,2 万套设备进入真实场景后,累计采集百万小时有效数据,覆盖 22 大类场景,数据模态涵盖彩色图像、深度、惯性测量、触觉与音频。这一规模被觅蜂称为「行业首家百万小时级可对外售卖无本体数据服务商」。
数据引擎与质量分级
面对真实场景中的遮挡、快速运动、多人交互等难题,觅蜂搭建了 MEgo Engine 数据引擎,负责预处理、空间感知、标注与质量评估。其中的 HandPose 高精度手部重建技术,结合五目全景感知、手部追踪与三目深度融合,在奶茶制作、美甲、宠物洗护等典型遮挡与高速场景下,七项核心指标达到 SOTA 水平。即使手部可见率低于 30%,仍能实现亚厘米级三维重建。
在质检环节,觅蜂采用 ManiEval 多维度评估体系,从数据类型、任务类型、传感器质量、语义质量、动作质量五个维度对数据做 S、A、B、C 分级,再匹配不同的训练需求。觅蜂将这一做法概括为「不过滤,只分级」——在合规与基本质量前提下,让不同质量的数据对应不同训练目标。
围绕具身大脑、VLA(视觉-语言-动作模型)与 WAM(世界动作模型),觅蜂对数据的用法做了初步分工:大规模无本体数据主要用于通用预训练,让模型学习物体、动作、空间关系与任务过程;具体机器人本体仍需真机数据进行后训练与优化。
飞轮闭环与众包网络
觅蜂派同时构建了「采集—重建—质检—训练—部署—回流」的完整数据飞轮。训练部署阶段的失败样本,会通过 REMORA 任务进度模型识别,并由 Value Model 筛选后回流入数据体系,形成闭环。
众包端,觅蜂派上线前一月内测期间,平台注册用户达 2 万人,累计提交 1.3 万份采集任务,部分用户单月收益超过 5000 元。觅蜂把参与者称为「机器人训练师」,众包网络包含两类:
- 场景网络:连接酒店、餐饮、商超、物流、工厂、医疗、家庭、养老、非遗等真实作业环境。
- 人群网络:连接不同年龄、行业和地区的参与者。
觅蜂还发起了「场景数据联盟」,首批吸引 50 余家企业和机构加入,覆盖场景方、采集网络、机器人与模型企业。
与 Figure Index 的差异
觅蜂派与 Figure Index 虽同属众包模式,但定位差异明显:Index 数据主要供 Figure 自家模型使用,属于「自产自销」;觅蜂派则面向第三方客户,按需求组织生产、处理后对外交付。觅蜂披露,百万小时级无本体数据已开始服务腾讯 Robotics X 实验室、蚂蚁灵波等客户。
从行业趋势看,无本体数据的优先级正在提升。Figure 的 Helix 2.5 先用 Index 收集的大规模人类行为数据做预训练,机器人在 30 个陌生家庭做家务的任务成功率从 9% 提升到 56%。多家国内具身公司今年喊出百万小时数据目标,明年部分公司的目标已升至千万小时级。要支撑这一规模,社会化采集成为必选项,而觅蜂派正是这一方向上的中国本土落地尝试。
