研究解读 · 神机百见-具身解读

一边喊缺 99%,一边数据卖不动:具身数据的供需两头,用的不是同一种计价单位

国内合规真机交互数据约 50 万小时,商业化需要数千万小时,缺口超过 99%;但同一份报道承认,数据「又难卖」。缺口和滞销同时成立,说明病灶不在小时数,在计价单位:客户要「工位验收」,训练场卖「小时数」,两边算的不是同一笔账。

本篇目录4 节 · 9 分钟
一分钟速览
  1. 缺口超 99%:国内真实物理交互场景的合规数据约 50 万小时,机器人商业化落地需要数千万小时(贵州省大数据局 7 月口径,非 9 月新数据)。
  2. 百万小时军备赛:千寻智能已累计超 20 万小时、年内冲 100 万;星海图计划年内完成百万小时;黎曼动力称已过半——均为公司自述。
  3. 算一笔总账:中国信通院测算,「ChatGPT 时刻」需要 1.1 万亿 token 数据,全靠真机采集约需 2.12 万台机器人连续工作一整年。
  4. 成本差 10–50 倍:真机遥操作约 500–1000 元/小时,仿真数据约 20–50 元/小时(国盛证券口径)。
  5. 判断:供需矛盾的核心不是「缺数据」,是「验收口径错配」——客户按工位付费,训练场按小时计价,所以缺口和滞销能同时成立。
数据来源与边界
素材时间窗为当日 09:00 → 19:00。核心素材来自上海证券报 2026-09-19 08:16 报道(经腾讯网当日转引,原文直链未取得,以发布时间 08:16 为锚点,早于窗口起点 44 分钟,按同日相邻事件处理);「50 万小时/数千万小时/缺口超 99%」为贵州省大数据局 2026 年 7 月新闻发布会口径,非 9 月新数据,本文照录并标注;千寻、星海图、黎曼动力小时数均为公司自述,未经第三方核验;1.1 万亿 token、2.12 万台机器人为中国信通院《具身智能训练场研究报告(2026 年)》(2026-08 发布)测算;真机 500–1000 元/小时与仿真 20–50 元/小时为国盛证券研报口径(经新京报 2026-09 引述)。与既有稿件的差异:102 号稿算的是数采中心单价(120 元/小时),139 号稿写的是训练场数量与 11 月 1 日数据标准,170 号稿写的是数据基建融资,本篇聚焦「需求侧验收口径与供给侧计价口径的错配」,为第三层展开。「计价单位错配」的归因属作者判断。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
两个同时成立的事实

缺口 99%,但数据卖不动

上海证券报 9 月 19 日的报道把一对矛盾摆在了同一篇文章里:供给端,国内真实物理交互场景的合规数据存量约 50 万小时,而机器人商业化落地需要数千万小时,缺口超过 99%;需求端,这些数据「又难卖」——企业集体冲刺的百万小时,并没有转化成对应的收入。

如果只是缺数据,价格应该涨、数据应该抢手。缺口和滞销同时成立,只有一种解释:卖的东西和买的东西不是同一种东西。

判断:客户(本体厂与模型厂)真正要买的是「在我的工位上验收通过」的数据包,而训练场和数采中心出售的是「小时数」。一个是结果口径,一个是投入口径,两边算的不是同一笔账。这是具身数据这门生意眼下最根本的结构性问题,比融资额和军备赛都重要。
供给侧在做什么

百万小时军备赛,和它的成本曲线

三家公司在同一条赛道上冲刺:千寻智能称已累计获得超 20 万小时多类型真实交互数据、计划年内突破 100 万小时;星海图计划年内完成百万小时数据建设;昆仑万维孵化的黎曼动力称数据积累已过半、年底前达成。三家口径均为自述,注意这是「小时数」竞赛。

成本曲线决定了这场竞赛的天花板。真机遥操作采集约 500 到 1000 元一小时,仿真数据约 20 到 50 元一小时,差出 10 到 50 倍。中国信通院的测算把总账算得更直白:若机器人迎来「ChatGPT 时刻」需要 1.1 万亿 token 的数据,全部依靠真机采集,约需 2.12 万台机器人连续工作一整年。这意味着纯真机路线在数学上就不成立,最终的供给结构必然是真机打底、仿真放量、两者按任务类型配比。

真机遥操作
500–1000 元/小时
仿真数据
20–50 元/小时
采集成本对比(国盛证券口径,条长按中值比例示意)
需求侧在等什么

一张工位验收单

需求侧的口径在 11 月 1 日之后会变得更硬:数据标准落地后,数据将按任务与工位计价,而不是按小时计价(本站 139 号稿已写过标准本身)。这让「验收口径」成为整个链条的关键节点——数据卖得动的前提,是买方能在合同里写清楚「什么算合格」。

所以判断一节数采中心的价值,该问的是两个数:卖出的数据里,有多少是客户按工位验收后复购的;有多少是本地国资或关联方回购的。前者是真实需求,后者是 146 号稿写过的「注水订单」问题的数据版。两个数的比例,比任何百万小时宣传都更能说明这家数据公司的成色。

判断

谁先换计价单位,谁握住定价权

把三件事串起来:需求缺口是真实的(99%),军备赛是热烈的(三家冲百万小时),滞销也是真实的(卖不动)。链条上缺的不是数据,是把「小时数」翻译成「工位验收」的能力——谁能定义验收标准、谁的数据能被客户按工位复购,谁就握住了这门生意的定价权。

判断:成本曲线同样指向这个结论:真机与仿真的 10–50 倍价差意味着,单纯拼真机小时数的公司会被成本拖死,而能把真机数据成本压下来、同时给出工位级验收口径的公司,才值得客户按结果付费。11 月 1 日的数据标准是这道分水岭的制度版本——标准落地后,「按小时卖数据」的模式会加速贬值。
来源:上海证券报 2026-09-19 08:16(经腾讯网转引);贵州省大数据局 2026-07 新闻发布会;中国信通院《具身智能训练场研究报告(2026 年)》2026-08;国盛证券研报(经新京报 2026-09 引述)。素材时间窗:当日 09:00 → 19:00。