深度 · 神机百见-具身解读

2.7 亿英里、伤害事故降 82%,但没人数它堵了几次路:Waymo 这份安全数据最该被抄的是方法论

82% 与 95% 是硬数字,20 倍优势是硬趋势;但一位教授指出公开数据里没有堵车、没有阻塞应急车辆、没有违规转弯——衡量什么,决定了你能宣称什么。

一分钟速览
  1. 数据本体:Waymo 最新安全数据覆盖 2.7 亿+自动驾驶英里、5 个运营区域;相比人类驾驶员,伤害事故下降 82%、严重伤害事故下降 95%,相当于避免了 841 起致伤事故。
  2. 趋势比数值更有信息量:Jeff Dean 指出严重伤害事故率优势从早期的约 10 倍,到 1.7 亿英里时(2026 年 3 月)13 倍,到本次 2.7 亿英里时 20 倍——规模扩大,差距在拉大。
  3. 交叉口径:另有对三座城市警方报案事故率的分析,Waymo 比人类低 80–95%,取决于采用哪个指标。
  4. 反驳同样重要:Thomas Dietterich 指出碰撞只是最严重、也最容易测量的那一种坏结果,公开数据里没有堵在路上的车、被阻塞的应急车辆、违规转弯,并怀疑部分统计收益来自人类司机在机器车周围开得更谨慎。
  5. 对具身智能的迁移价值:这套「拿什么当指标」的争议,可直接翻译成机器人验收口径——只统计最严重的失败,等于只给自己看最好的一面。
数据来源与边界
本文事实来自 Waymo 于近期发布的公开安全数据,经 AGI HUNT 2026 年 9 月 27 日日报收录并二次转述(URL 见 source_url,含 Jeff Dean 对 10×/13×/20× 趋势的对比,以及 Thomas Dietterich 的反驳与另一份三城警方报案事故率分析)。素材时间窗为「前一日 18:00 → 当日 09:00」,该日报为 2026-09-27 期,属窗口内的中文可达转述落点。边界说明:82%/95%/841 起/20 倍等原始数字出自 Waymo 自行发布的安全数据,为单一信源、企业自述口径,本文未找到对应的同行评议复核;三城分析与 Dietterich 的反驳为第三方意见,非官方口径;「人类司机更谨慎」这一解释被提出但未被量化验证。判断均以「判断:」开头。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
先把三张表摆出来:数值、趋势、交叉口径
维度数值来源与限定
累计里程2.7 亿+ 自动驾驶英里Waymo 自述,5 个运营区域
伤害事故下降 82%对比同区域人类驾驶员
严重伤害事故下降 95%同上
避免的致伤事故841 起由上述对比推算得出
严重伤害优势趋势10× → 13×(1.7 亿英里,2026-03)→ 20×Jeff Dean 转述
三城警方报案事故率低于人类 80–95%第三方分析,取决于指标选择
表注:全部数值出自 Waymo 公开安全数据及第三方转述,为单一信源口径;不同行的统计对象与基准不完全一致,不可直接相加或互推。

读这组数字,第一眼会落在 82% 和 95% 上。但真正有信息量的是第三行和第五行:841 起是绝对量,20 倍是趋势。绝对量说明规模已经足够大,不再是小样本故事;趋势说明安全优势不是一次性的静态结果,而是随里程累积在扩大——这一点由 Jeff Dean 点出:早期约 10 倍,1.7 亿英里(2026 年 3 月)13 倍,本次 2.7 亿英里 20 倍。

趋势之所以比数值重要,是因为数值可以被基准选择影响,趋势不能。如果对比基准、里程口径、区域构成在三次发布中保持一致,那么 10 倍到 20 倍的上行只能来自两个方向:系统变好了,或者人类基准变差了。Waymo 的解读是前者,下面会看到有人对后者提出怀疑。

反驳击中的不是数字,是口径

Thomas Dietterich 的反驳值得完整读一遍,因为它没有质疑任何一个数字,而是质疑这些数字覆盖的范围。他的原意是:碰撞是最严重、也最容易测量的那一种坏结果;而公开数据里没有三类东西——堵在路上的车、被阻塞的应急车辆、违规转弯。他还对公司的安全文化提出怀疑,认为问题驾驶行为的修复太慢,并提示部分统计收益可能来自人类司机在机器车周围开得更谨慎——等于把一部分安全外包给了人。

判断:这是一次标准的「指标口径之争」,不是「数字真假之争」。当一个系统只被要求在最严重的结果上达标,它就会把所有工程资源投到那一个指标上,代价是其他失败模式无人统计、无人负责。Robotaxi 如此,机器人也如此:只考核「有没有伤人」,等于默许「卡住不动」和「走错路线」不被计入。

把 Dietterich 的三类未统计项翻译成机器人的语言,它们分别对应:任务超时卡死(堵在路上)、阻碍关键通道(阻塞应急车辆)、违反规则的动作(违规转弯)。这三类的共同特征是——不造成事故,但造成损失。对一台在商场做导览的机器人,堵在通道里不算事故,但直接影响客流;对一台在工厂搬运的机器人,卡死不算事故,但直接停线。

衡量什么,决定了你能宣称什么
易测的(会被公开)

碰撞、伤害、严重伤害
——有法定上报口径,数据齐、可比性强

难测的(常被省略)

卡死时长、阻碍通道、违规动作
——需自定义事件定义,跨公司不可比

三城分析给出的 80–95% 这个区间,本身就是一条重要信息:取决于采用哪个指标。同一批数据,换一个衡量口径,结论可以在 80 和 95 之间移动 15 个百分点。这句话应该被所有做对外披露的团队记住——当你的结论对指标选择这么敏感时,正确做法是把指标定义一起公开,而不是挑一个最好看的数字讲。

「人类司机更谨慎」这个解释也值得认真对待。它描述的是一种外部性:机器车的存在改变了周围人类的行为,从而改善了统计结果。如果这个效应真实存在,那么这部分收益不属于系统本身,且会随机器车渗透率上升而衰减——当道路上大部分都是机器车时,没有人可以「更谨慎」了。这个解释被提出但未被量化,本文不做判断,只标注为一项公开存在的争议。

给具身智能的三条可抄写法

把这场争议迁移到机器人行业,可以整理出三条能直接用在验收文件里的写法。

第一,把失败分等级,不要只报最严重的那一档。参照本站此前沉淀的机器人故障三级分类(现场修 / 拆件修 / 只能返厂),再往前加一档「不影响继续运行但造成损失」——卡死、走错、超时。事故是最后一道线,卡死才是日常损失的主要来源。

第二,任何对外数字都要带上基准定义。82% 这个数字只有在「同区域、同里程口径、同期人类驾驶员」三个限定下才成立。机器人领域的对应写法是:任务成功率必须写明换货、换批次、换工位之后是否仍成立——业内已有共识(本站 245 号稿记录的王兴兴 80/80 判据:80% 陌生场景完成 80% 任务),固定场景里训到接近 100% 并不构成能力证明。

第三,把趋势写出来,而不只是一个点。Waymo 最有说服力的不是 95%,是 10 倍到 20 倍这条线。机器人运营同样:单场的成功率没有意义,连续运行 3000 小时之后的第 2999 小时的成功率才有意义。凡是要给客户看的数字,优先给时间序列。

判断:Waymo 的 82% 与 95% 是行业里少有的、敢把对比基准和绝对量一起公开的样本,这一点值得肯定;Dietterich 的批评也不构成否定,而是一次口径校准。对具身智能从业者,这份材料的正确用法不是把它当安全证明,而是把它当模板:照着它的结构写自己的验收口径(数值 + 趋势 + 基准定义 + 未覆盖范围声明),其中「未覆盖范围声明」这一项,恰恰是绝大多数机器人厂商目前完全空白的地方。
来源:Waymo 公开安全数据(2.7 亿+英里,5 个运营区域);AGI HUNT 2026-09-27 日报收录与转述 https://agihunt.info/en/p/1a0de96686758c2290242af85ee ,含 Jeff Dean 10×/13×/20× 趋势对比、三城警方报案事故率分析、Thomas Dietterich 反驳。单一信源说明:原始数值为 Waymo 自述口径。素材时间窗:前一日 18:00 → 当日 09:00。