# 一边喊缺 99%，一边数据卖不动：具身数据的供需两头，用的不是同一种计价单位

> 国内合规真机交互数据约 50 万小时，商业化需要数千万小时，缺口超过 99%；但同一份报道承认，数据「又难卖」。缺口和滞销同时成立，说明病灶不在小时数，在计价单位：客户要「工位验收」，训练场卖「小时数」，两边算的不是同一笔账。

### TLDR

- **缺口超 99%**：国内真实物理交互场景的合规数据约 **50 万小时**，机器人商业化落地需要**数千万小时**（贵州省大数据局 7 月口径，非 9 月新数据）。
- **百万小时军备赛**：千寻智能已累计超 **20 万小时**、年内冲 100 万；星海图计划年内完成百万小时；黎曼动力称已过半——均为公司自述。
- **算一笔总账**：中国信通院测算，「ChatGPT 时刻」需要 **1.1 万亿 token** 数据，全靠真机采集约需 **2.12 万台**机器人连续工作一整年。
- **成本差 10–50 倍**：真机遥操作约 **500–1000 元/小时**，仿真数据约 **20–50 元/小时**（国盛证券口径）。
- **判断**：供需矛盾的核心不是「缺数据」，是「验收口径错配」——客户按工位付费，训练场按小时计价，所以缺口和滞销能同时成立。

### SRC

素材时间窗为当日 09:00 → 19:00。核心素材来自上海证券报 2026-09-19 08:16 报道（经腾讯网当日转引，原文直链未取得，以发布时间 08:16 为锚点，早于窗口起点 44 分钟，按同日相邻事件处理）；「50 万小时/数千万小时/缺口超 99%」为贵州省大数据局 2026 年 7 月新闻发布会口径，非 9 月新数据，本文照录并标注；千寻、星海图、黎曼动力小时数均为公司自述，未经第三方核验；1.1 万亿 token、2.12 万台机器人为中国信通院《具身智能训练场研究报告（2026 年）》（2026-08 发布）测算；真机 500–1000 元/小时与仿真 20–50 元/小时为国盛证券研报口径（经新京报 2026-09 引述）。与既有稿件的差异：102 号稿算的是数采中心单价（120 元/小时），139 号稿写的是训练场数量与 11 月 1 日数据标准，170 号稿写的是数据基建融资，本篇聚焦「需求侧验收口径与供给侧计价口径的错配」，为第三层展开。「计价单位错配」的归因属作者判断。

### BODY

<div class="sec"><div class="eyebrow">两个同时成立的事实</div>
<h2>缺口 99%，但数据卖不动</h2>
<p>上海证券报 9 月 19 日的报道把一对矛盾摆在了同一篇文章里：供给端，国内真实物理交互场景的合规数据存量约 50 万小时，而机器人商业化落地需要数千万小时，缺口超过 99%；需求端，这些数据「又难卖」——企业集体冲刺的百万小时，并没有转化成对应的收入。</p>
<p>如果只是缺数据，价格应该涨、数据应该抢手。缺口和滞销同时成立，只有一种解释：卖的东西和买的东西不是同一种东西。</p>
<div class="keypoint">判断：客户（本体厂与模型厂）真正要买的是「在我的工位上验收通过」的数据包，而训练场和数采中心出售的是「小时数」。一个是结果口径，一个是投入口径，两边算的不是同一笔账。这是具身数据这门生意眼下最根本的结构性问题，比融资额和军备赛都重要。</div>
</div>

<div class="sec"><div class="eyebrow">供给侧在做什么</div>
<h2>百万小时军备赛，和它的成本曲线</h2>
<p>三家公司在同一条赛道上冲刺：千寻智能称已累计获得超 20 万小时多类型真实交互数据、计划年内突破 100 万小时；星海图计划年内完成百万小时数据建设；昆仑万维孵化的黎曼动力称数据积累已过半、年底前达成。三家口径均为自述，注意这是「小时数」竞赛。</p>
<p>成本曲线决定了这场竞赛的天花板。真机遥操作采集约 500 到 1000 元一小时，仿真数据约 20 到 50 元一小时，差出 10 到 50 倍。中国信通院的测算把总账算得更直白：若机器人迎来「ChatGPT 时刻」需要 1.1 万亿 token 的数据，全部依靠真机采集，约需 2.12 万台机器人连续工作一整年。这意味着纯真机路线在数学上就不成立，最终的供给结构必然是真机打底、仿真放量、两者按任务类型配比。</p>
<div class="jx-bars">
<div class="jx-bar-row"><div class="jx-bar-lab">真机遥操作</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:100%"></div></div><div class="jx-bar-val">500–1000 元/小时</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">仿真数据</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:5%"></div></div><div class="jx-bar-val">20–50 元/小时</div></div>
<div class="jx-legend"><div class="jx-lg">采集成本对比（国盛证券口径，条长按中值比例示意）</div></div>
</div>
</div>

<div class="sec"><div class="eyebrow">需求侧在等什么</div>
<h2>一张工位验收单</h2>
<p>需求侧的口径在 11 月 1 日之后会变得更硬：数据标准落地后，数据将按任务与工位计价，而不是按小时计价（本站 139 号稿已写过标准本身）。这让「验收口径」成为整个链条的关键节点——数据卖得动的前提，是买方能在合同里写清楚「什么算合格」。</p>
<p>所以判断一节数采中心的价值，该问的是两个数：卖出的数据里，有多少是客户按工位验收后复购的；有多少是本地国资或关联方回购的。前者是真实需求，后者是 146 号稿写过的「注水订单」问题的数据版。两个数的比例，比任何百万小时宣传都更能说明这家数据公司的成色。</p>
</div>

<div class="sec"><div class="eyebrow">判断</div>
<h2>谁先换计价单位，谁握住定价权</h2>
<p>把三件事串起来：需求缺口是真实的（99%），军备赛是热烈的（三家冲百万小时），滞销也是真实的（卖不动）。链条上缺的不是数据，是把「小时数」翻译成「工位验收」的能力——谁能定义验收标准、谁的数据能被客户按工位复购，谁就握住了这门生意的定价权。</p>
<div class="keypoint">判断：成本曲线同样指向这个结论：真机与仿真的 10–50 倍价差意味着，单纯拼真机小时数的公司会被成本拖死，而能把真机数据成本压下来、同时给出工位级验收口径的公司，才值得客户按结果付费。11 月 1 日的数据标准是这道分水岭的制度版本——标准落地后，「按小时卖数据」的模式会加速贬值。</div>
<div class="srcline">来源：上海证券报 2026-09-19 08:16（经腾讯网转引）；贵州省大数据局 2026-07 新闻发布会；中国信通院《具身智能训练场研究报告（2026 年）》2026-08；国盛证券研报（经新京报 2026-09 引述）。素材时间窗：当日 09:00 → 19:00。</div>
</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/data-supply-demand-99-gap/*
