产品发布 · 神机百见-具身解读

两万人内测「给机器人当老师」:觅蜂派把数采从基地搬进了日常生活

9 月 23 日上海,觅蜂科技发布全品类物理 AI 数据众包平台「觅蜂派」:下载 App 领任务、佩戴 MEgo 设备在真实场景干活、按有效时长结算报酬。一个月内测注册 2 万人、提交 1.3 万份数据,同步启动亿元补贴与场景数据联盟——数采供给侧出现了「中国版 Index」,但商业模式画的是另一张图。

一分钟速览
  1. 发布与内测:9 月 23 日,觅蜂科技在上海发布全球首个全品类物理 AI 数据众包服务平台「觅蜂派」;1 个月内测注册用户 2 万人,提交采集数据 1.3 万份。
  2. 三件套 + 两张网:MEgo 采集设备、觅蜂派 App、MEgoEngine 数据引擎组成基础设施;「场景网络」(酒店、餐饮、工厂、养老等)与「采集员网络」对接供需。
  3. 数据工程是核心环节:长程操作被拆解为120 多种标准原子动作(抓、拿、放、拧、按),再经 ManiEval 多维度质检分级(任务完整性、传感器质量、语义准确性、动作可学习性)。
  4. 行业背景:信通院报告指全球高质量真实数据仅数十万至百万小时级,而具身模型的「ChatGPT 时刻」需要千万小时级;国金证券测算当前积累不足需求的 5%。
  5. 判断:众包解决的是「规模」,不自动解决「质量」——120 种原子动作的拆解规范与质检分级,才是这个平台真正的产品。
数据来源与边界
本篇素材时间窗为当日 09:00 → 19:00。发布会于 9 月 23 日在上海举行,属窗口外一天;本窗口内新增量是 9 月 24 日央广网(记者孙文轩)、腾讯新闻等对发布会的详细报道扩散(含专访与数据工程细节),据此按「近 3 日进展 + 窗口内报道增量」处理。核心事实(内测 2 万用户、1.3 万份提交、22 大类场景、5000 多个任务、50000 多个真实环境、120 多种原子动作、亿元补贴、9 月 23 日至 10 月 22 日推广期减免设备费)经央广网、中国证券网(上证报)、广州日报大洋网、腾讯新闻多源交叉一致,但均出自厂商口径,标注 vendor 属性;「估值有望向百亿元迈进」出自上证报稿件中「业内人士透露」,为单一信源,仅作记录不作为事实引用。信通院《具身智能训练场研究报告(2026 年)》的数据缺口表述与国金证券测算为第三方机构口径。与本站 225 号稿(pi0.5 数据杠杆)差异:彼篇讲「给定数据怎么用」,本篇讲「数据从哪里来」。判断为作者观点。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
「机器人训练师」从新职业变成 App

9 月 23 日,觅蜂科技在上海发布「觅蜂派」,定位全球首个全品类高质量物理 AI 数据众包服务平台。玩法直白:用户下载 App 领取数据采集任务,佩戴 MEgo 设备在零售、仓储、制造、家庭等真实场景完成指定操作,按审核后的有效数据时长获得报酬。觅蜂科技董事长兼 CEO 姚卯青的表述是——「物理 AI 最好的老师,是每一个认真生活的人」。

时间点踩得很准:9 月 9 日人社部等部门发布第八批新职业,「具身智能机器人应用技术员」下设「数据采集员」「机器人训练师」两个工种;央视新闻报道预计未来五年我国将新增相关就业岗位超 100 万个。觅蜂派同步发布机器人训练师职业计划与亿元补贴计划,9 月 23 日至 10 月 22 日推广期间减免设备使用费、提供信用免押。

内测数据:规模刚起步,模式先跑通

一个月内测,注册用户 2 万人、采集提交总量 1.3 万份——人均约 0.65 份。这个密度说明平台尚在冷启动早期,真正值得注意的是流程而非规模:场景网络连接酒店、餐饮、商超、物流、工厂、医疗、家庭、养老、非遗等真实作业环境提供任务来源;人群网络连接不同行业的参与者供给操作数据;中间靠 MEgoEngine 把长程操作拆解为「抓、拿、放、拧、按」等 120 多种标准原子动作,再经 ManiEval 多维度质检分级。

内测注册用户(1 个月)
2 万人
采集提交总量
1.3 万份
覆盖场景大类
22 大类
平台任务数
5000+ 个
条形长度仅作相对示意;数据为厂商披露口径(2026-09-24 抓取)
为什么众包是必选项:千万小时缺口摆在那里

供给侧的账很好算。中国信通院《具身智能训练场研究报告(2026 年)》给出的判断:全球可用的高质量真实数据仅数十万至百万小时级,而具身基础模型要迎来「ChatGPT 时刻」至少需要千万小时级数据;国金证券的测算更激进——行业至少需要 1000 万小时多模态交互数据,当前全球积累不足需求的 5%。

行业此前的主流量产方式是真机遥操:人操纵机器人示范任务,数据与本体高度对齐,但采集速度受机器人数量、人员与场地约束,成本随规模线性增长。今年以来行业形成分工共识:无本体采集拓规模、真机遥操保对齐、真实部署做修正。众包(无本体采集的极致形态)被视为放大产能的杠杆——Figure 的 Helix 2.5 实验已经证明过众包数据的价值:30 套陌生住宅零样本作业成功率从 9% 提升到 56%,背后正是 Index 众包体系的预训练数据(本站 167 号稿曾拆解)。

判断:把百万小时级的缺口交给千万人利用碎片时间填补,是唯一在数学上说得通的扩产路径。但众包数据的死穴是质量方差——业余采集员的动作噪声、传感器佩戴差异、场景理解偏差,都会进数据集。觅蜂派把「拆原子动作 + 多维质检」作为产品核心而非附加项,说明厂商清楚这一点;平台竞争的最后护城河不是用户数,是质检标准被多少模型厂商认可。
与 Index 的同与不同:闭环卖方 vs 开放卖方

觅蜂派被视为「中国版 Index」,但两者的商业模式结构不同。上证报稿件点出了关键差异:Index 围绕 Figure 自身模型训练需求建立闭环,数据自产自用;觅蜂派面向不同模型厂商、机器人企业和数据采购方,按客户需求组织数据生产,处理后数据作为产品与服务对外交付。发布会同步发起的「场景数据联盟」(首批覆盖零售商超、酒店文旅、餐饮服务、养护院、医疗健康等领域的 50 余家企业机构)进一步表明它要做的是数据流通的基础设施,而非单一公司的内部工具。

信通院人工智能研究所具身智能与机器人部副主任张蔚敏对这类平台的定位说得直接:价值不只是汇集大量记录,更在于通过任务组织、数据工程、质量控制和闭环运营,把分散数据转化为可训练、可评测的数据资产。

判断:对模型厂商,众包平台提供了自建数采基地之外的弹性产能;对采集员,它把既有劳动经验变现成第二收入。这条双边市场能否成立,取决于三个还没被验证的变量:有效时长的审核通过率、单小时报酬对采集员的持续吸引力、以及采购方对众包数据与遥操数据的实际配比选择。本月 11 月 1 日实施的具身智能数据集质量标准(本站 139 号稿曾跟进)会是质检环节的公共标尺——达标与否,将直接决定这类平台交付数据的定价权。
事实源:央广网(2026-09-24)、中国证券网·上证报、广州日报大洋网(2026-09-23)、腾讯新闻专访;核心数据为厂商口径(vendor)。判断均为作者观点。