研究解读 · 神机百见-具身解读

王兴兴把行业 KPI 改写成两道题:80% 陌生场景完成 80% 任务,和那几毫米的误差

「机器人的核心瓶颈是几毫米的工作误差」「80% 陌生场景完成 80% 任务就是临界点」——王兴兴这次没讲产品讲判据,把行业流行语换成了可以考试的两道题。

一分钟速览
  1. 核心瓶颈判断:王兴兴认为目前最大的问题是 AI 模型的输入、输出与真实物理世界精准匹配度不足,机器人工作会有几毫米的误差——「未来谁能解决这个问题,机器人的问题就完全解决了」。
  2. 爆发判据:当机器人可在 80% 的陌生场景中,通过语音具身能力完成 80% 的任务时,行业抵达爆发临界点,即具身智能专属的「ChatGPT 时刻」。
  3. 时间预判:这一产业拐点「有望在未来几年落地」,全球企业与各国资源届时将集中涌入赛道。
  4. 起点确认:「让机器人说指令、象征意义执行某个具体工作,在去年已能实现」——底线性能力已被跨过。
  5. 口径提醒:80/80 判据与毫米误差表述均为王兴兴个人演讲口径,无量化验收标准,属愿景式定义而非工程指标。
数据来源与边界
本文事实来自财联社 2026 年 9 月 25 日快讯(转界面新闻记者从杭州数贸会现场发回的报道,URL 见 source_url),演讲本体发生于 9 月 24 日第五届全球数字贸易博览会,属「窗口外不足一天事件 + 窗口内 9 月 25 日财联社报道为新增量」,素材时间窗为当日 09:00 → 19:00。核查方式:财联社原文与多家媒体同日转载比对,关键引语(几毫米误差、80/80 判据)各源一致;数贸会背景(9 月 24 日杭州开幕)与本站 218 号稿(宇树 GD01 机甲)、224 号稿(数贸会订单三口径)交叉印证。边界说明:80/80 是演讲中的愿景式判据,没有给出测试集、评分方式与责任方,「陌生场景」「任务完成」均未定义,不能当作工程指标引用;几毫米误差同样未说明测量任务与工况。与 9 月 24 日已发布稿件(218 号)的差异:那篇讲 GD01 载人机甲的文旅装备定位与 390 万元定价,本篇讲王兴兴演讲中的技术判据与瓶颈定义,属同一展会不同维度,无内容重叠。判断均以「判断:」开头。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
一场没讲新产品的演讲

9 月 24 日,第五届全球数字贸易博览会在杭州举行,宇树科技创始人王兴兴发表《从机械到灵智——具身未来进化论》主题演讲。与展台上那台 390 万元起的载人变形机甲 GD01 抢走大部分镜头不同,这次演讲里更有信息量的是两个不带产品编号的表述:一个是瓶颈定义——「AI 模型的输入、输出与真实物理世界精准匹配度不足,机器人工作会有几毫米的误差」;另一个是临界点判据——「当机器人可在 80% 的陌生场景中,通过语音具身能力完成 80% 的任务时,就意味着行业抵达爆发临界点」。

王兴兴同时给出了一个坐标系:让机器人听懂指令、象征性地执行某个具体工作,在去年已经实现——这意味着行业的底线性问题(能不能动起来、能不能听懂话)已被跨过,现在卡住所有人的是精度与泛化的双重问题。他对拐点的预判是「未来几年」,并判断届时全球企业与各国资源会集中涌入。

「几毫米」到底是几毫米

先说毫米误差。工业机器人早就能做到零点几毫米的重复定位精度,人形机器人的问题不在「能不能精确」,而在「在陌生环境里能不能保持精确」——感知噪声、模型预测偏差、本体柔性、负载变化叠加在一起,构成了一个系统级的误差预算。王兴兴把它归结为「AI 模型输入输出与物理世界的精准匹配」,本质上是把问题从单一环节拉回到了整个链路。

判断:几毫米误差不是单点技术问题,而是感知、控制、本体三层的误差预算分配问题。谁的系统误差预算能压进装配级任务的公差带,谁先拿到产线门票。这条瓶颈一旦被明确表述,行业竞争就从「演示多少个场景」转向「同一场景误差多少毫米」——这是判据式表达对行业的真实价值。

再说 80/80。把两个百分比并排放:80% 的陌生场景、80% 的任务完成率,意味着大约每五个新场景里有一个可以失败,每十个任务里允许两个完不成。这比「通用机器人」这类不可考核的词严格得多,也比实验室里固定任务集上的高分宽松得多。它其实是给行业立了一道可以出考卷的门槛——只是这张考卷谁来出、在哪些场景出、谁监考,演讲里没有答案。

判据之外的信号

值得把演讲放在宇树自己的语境里读。9 月 24 日收盘,宇树科技股价报 488 元,总市值约 1974 亿元(据当日媒体公开报道口径)——资本市场已经按「行业旗舰」给它定价,而创始人自己给出的瓶颈定义是几毫米误差。这两件事放在一起看,等于创始人亲口确认:支撑当前估值的产能、出货与人形叙事,都还建立在尚未解决毫米级精度问题的前提之上,估值与技术现实之间存在一段必须被兑现的距离。

另一个信号是「语音具身能力」被写进了判据。80/80 判据里任务完成的入口是语音指令,这意味着在王兴兴的定义里,具身智能的交互范式默认是「人说、机器人做」,而不是预设程序或遥控。这与本站此前多篇稿件讨论的「手势/语音指令 Agent 化」方向一致——交互层会被当作具身智能的标配能力,而非附加功能。

判断:80/80 判据真正的用处不是预测哪一年爆发,而是提供了一个淘汰机制——凡是只报「任务成功率」不报场景分布、只报实验室固定任务不报陌生场景泛化的宣传,都可以按这道判据先打一个问号。对采购方而言,向厂商索要「陌生场景占比」与「失败任务的工况描述」,比索要参数表更有筛选力。
来源:财联社 2026-09-25 快讯(转界面新闻,https://www.cls.cn/detail/2492940);演讲发生于 9 月 24 日杭州第五届全球数字贸易博览会。素材时间窗:当日 09:00 → 19:00。