运动误差降 90.4%,VLM 打分却反而输了:Hydra-0 把「世界模型该评什么」摆上了桌面
Hydra-0 把机器人动作从关节空间搬到像素空间,夹爪运动误差从 34.28 像素降到 3.29 像素。但同一份表格里,VLM 打分有一栏没跑赢基线——这个反差比 90.4% 更值得读。
- 换的是接口的单位:Hydra-0 不再把动作编码成末端 6D 位姿,而是编码成「动作流」——动作前后画面上哪些像素会动、往哪动,于是人类演示、UMI 数据与不同构型的机器人可以进同一锅训练。
- 误差掉了一个数量级:在同一个数据集配比与骨干家族下对照,夹爪运动平均 EPE 从基线的 34.28 像素降到最佳配置的 3.29 像素,物体运动 EPE 从 13.23 降到 5.27;论文摘要口径为机器人运动误差降低 90.40%、物体运动误差降低 60.16%。
- 有一栏没赢:换成动作流后,基于 Cosmos 2.5 的配置 VLM 打分为 3.83,反而低于基线的 3.88。VLM 评的是「画面对不对」,不是「手有没有按指令动」。
- 训练的料很实在:语料来自 7 个来源、过滤后 178,187 条 episode、2,201.7 小时;骨干冻结,只训 DiT patch embedding 与 rank-64 LoRA。
- 判断:90.4% 这个数字的量级是真的,但它衡量的是「预测得像不像」,不等于「控制得好不好」——论文自己也承认闭环没做。
把「动作」翻译成画面上的一片流
世界模型要回答的问题其实很朴素:我做一个动作之后,画面会变成什么样。难的是「动作」这两个字怎么喂给一个视频生成模型。
主流做法是把动作写成末端执行器的 6D 相对位姿。这套表示在工程上很自然,却有三个硬伤:不同本体的动作向量维度和语义不同,七自由度单臂和双臂人形根本拼不到一起训练;同样的末端轨迹可能对应完全不同的连杆姿态,视频模型还得额外学一遍从控制量到像素运动的映射;更麻烦的是大量人类演示、UMI 手持设备拍的视频根本没有 URDF、关节状态和精确相机标定,转换不成标准机器人动作。
Hydra-0 的解法是把中间层换掉。它不再喂关节量,而是把动作表示成图像平面上的稀疏运动轨迹——也就是动作执行前后,画面上哪些点会往哪个方向动。视频模型本来就擅长预测像素怎么动,这一改等于把「动作」翻译成了模型母语。论文里的说法是,这个统一的视觉接口让跨本体、跨任务、跨环境的世界建模与控制成为可能。
五档配置摆在一起,才看得出 90.4% 是怎么来的
最有价值的部分不是那两个百分比,是论文给出的五档对照表。同一数据集配比、同一骨干家族下,只把动作表示从原生 6D 换成动作流,指标全线变化:
| 配置 | PSNR | SSIM | 物体 EPE | 夹爪 EPE | FVD | VLM |
|---|---|---|---|---|---|---|
| Cosmos 2.5 基线(原生 6D 动作) | 15.62 | 0.668 | 13.23 | 34.28 | 405.8 | 3.88 |
| Hydra-0 + Cosmos 2.5 | 18.41 | 0.725 | 6.27 | 13.80 | 277.4 | 3.83 |
| Hydra-0 + Wan2.2 5B | 19.64 | 0.770 | 6.61 | 3.88 | 248.8 | 3.90 |
| Hydra-0 + Wan2.2 A14B | 20.76 | 0.805 | 6.00 | 3.83 | 193.7 | 3.98 |
| Hydra-0 + A14B,四步蒸馏 | 21.84 | 0.830 | 5.27 | 3.29 | 155.9 | 4.23 |
这张表里最该被反复看的是夹爪 EPE 那一列:34.28 → 13.80 → 3.88 → 3.83 → 3.29。换接口本身(第一行到第二行)就已经把误差砍掉六成,换更强的骨干再砍一个数量级。换句话说,接口的选择和骨干的选择,是两次独立的收益,不能混为一谈。
VLM 那一栏为什么输了
第二行的 VLM 打分是 3.83,低于基线的 3.88。这不是论文的笔误,论文自己解释了这个现象:VLM 评委打的是「画面看起来物理上合不合理、时序上连不连贯、物体有没有穿模、运动真不真实」,而不是「机器人的手有没有精确移动到指令要求的位置」。
于是会出现一个很尴尬但很真实的情形:模型生成了一段流畅、逼真、物理上完全说得通的视频,但机器人手的实际落点跟指令差了十万八千里——VLM 看不出来,EPE 一测就露馅。反过来说,一个在 EPE 上极准的模型,也可能生成出观感一般的画面。
论文在 RoboLab 基准上的开放环评估给了另一组更贴近工程的数字:对重放实验与参考实验成功率的预测,Pearson 相关系数 r = 0.96、Spearman ρ = 0.93、MAE 5.7 个百分点(300 条 episode)。这组数字的意义在于——世界模型可以当成一个「不用上真机的策略打分器」,而 0.96 的相关性意味着排序基本可信,但 5.7 个百分点的绝对误差意味着它不能替代真机验收。
0% 数据时的那一点优势,可能比 90.4% 更值钱
论文还测了一个工程上极其现实的问题:新任务只有很少数据时,这套框架能不能帮上忙。测试用 Interactive World Simulator 数据集的六个 held-out 任务(双臂搬箱子、双臂理绳子、单臂抓取等),训练数据比例从 1% 逐步加到 100%,对比两种起点:从原始 Wan2.2 权重直接训,以及先做多机身动作流中训再微调。
结果是,在零数据(0%)的情况下,经过多机身中训的模型在全部六个任务上,LPIPS、物体流误差和 FVD 三项指标都优于对照组;而主要增益通常在 20% 数据之前就出现了。
这个发现的产业含义比 90.4% 更直接。国内具身团队最普遍的困境不是没有模型,是新场景没有数据。如果「先在跨本体数据上中训一遍动作流,再用少量数据微调」这条路径成立,那么数据稀缺场景的启动成本会被显著压低——而这条路径的前提条件恰恰是不依赖 URDF 和精确标定,也就是 Hydra-0 换接口换来的那个东西。
三处必须写清楚的局限
第一,90.40% 与 60.16% 是相对作者自家 Cosmos 2.5 原生动作基线的比值,不是相对行业最优世界模型。把它读成「Hydra-0 比所有世界模型好一个数量级」,是对这张表的误读。
第二,论文没有做闭环控制实验。目前的证据链停在「预测得准」和「开放环打分与真机结果高度相关」,从这两点到「接上策略就能提升真机成功率」之间,还隔着一层工程验证。
第三,论文中由物体流反推机器人动作、实现「只指定物体怎么动,模型生成机器人怎么动」的部分,作者自述为概念验证,没有系统性验证其对大幅相机运动、移动操作或腕部相机分布的鲁棒性。