73.6% 不是重点:RoboDawn 真机上 9/10 与 5/10 的落差才是
不训练、不微调,只靠一个接口和一条演示,VLM 就能控制机器人。论文的头条是 73.6%,但真机两个任务 9/10 与 5/10 的 40 个百分点落差,才画出了这条路的天花板在哪。
- 论文:arXiv:2609.22966,2026 年 9 月 19 日 11:34 UTC 提交,清华与腾讯混元团队,题为《Transferring the Intelligence of VLMs to Robotic Control》。
- 方法:RoboDawn 把机器人控制暴露给一个 agentic VLM,动作空间只有一组紧凑离散命令——平移 / 旋转 / 夹爪,配上下文学习(ICL)给少量演示,全程不做任务专属训练、不更新参数。
- 仿真成绩:RoboTwin 2.0 C2R 上 zero-shot 53.2% → one-shot 73.6%,超过 π0.5 基线 46.0% 与 LingBot-VLA 50.4%;RoboDojo 上 zero-shot 35.67% → one-shot 47.17%。
- 真机落差(本文重点):Franka 上 zero-shot 完成 block-in-basket 9/10,block stacking 只有 5/10——同一框架、同一机器人、同一设置,差 40 个百分点。
- 精度边界:单条命令平移限幅 20 cm、旋转限幅 90°;研究者观察到放宽推理/交互步数上限后性能持续提升的 test-time scaling 现象。
- 窗口说明:论文提交于 9 月 19 日(窗口外),窗口内新增量为 AGI HUNT 2026-09-23 日报首次收录与 Hugging Face Papers 论文页聚合。
人可以在数字世界和物理世界之间无缝切换——这提示智能本身可能跨具身迁移。那么反过来问:**在数字世界数据上训练出来的视觉语言模型(VLM),它的智能能不能直接迁移到物理世界的机器人控制上?**
RoboDawn 的回答方式很工程化:不改模型,改接口。它定义了一套「人类直觉友好」的接口,把机器人控制暴露给一个 agentic VLM,动作空间压缩成一组离散命令——平移、旋转、夹爪开合。VLM 闭环工作:观察当前视觉状态 → 推理下一步动作 → 执行 → 根据执行后的状态调整后续决策。
叠加的是上下文学习(ICL):用少量演示把 VLM 同时锚定在**接口怎么用**和**任务怎么解**两件事上,全程不做任务专属的机器人训练,不更新任何参数。
接口的核心概念叫 **GIP(Gripper Interaction Point,夹爪交互点)**,定义为夹爪指尖的中点。视觉标注、状态报告、命令下发全部统一以 GIP 为参照——这是一个很聪明的设计,它把「机器人现在在哪」这个问题压缩成了画面上的一个点。
动作语法是一组有限的命令:move、rotate、point、gripper、home、wait、done,分左右臂。平移轴为 x/y/z,旋转轴为 roll/pitch/yaw,均在世界坐标系下。命令描述的是 GIP 位姿的**增量变化**,把底层轨迹控制完全抽象掉了。
| 参数 | 取值 | 工程含义 |
|---|---|---|
| 单条平移命令上限 | 20 cm | 一次决策的最大位移分辨率 |
| 单条旋转命令上限 | 90° | 一次决策的最大姿态分辨率 |
| 参照点 | GIP(指尖中点) | 视觉、状态、命令三者统一 |
| 是否需要训练 | 否(zero-shot / ICL) | 不更新参数 |
论文的头条数字确实漂亮。在 RoboTwin 2.0 C2R 上,成功率从 zero-shot 的 53.2% 提升到 one-shot 的 **73.6%**;同一基准上,π0.5 的基线是 46.0%,LingBot-VLA 是 50.4%。RoboDojo 上则从 35.67% 提升到 **47.17%**。
但本文想让你看的是另一组数字。同一框架迁移到真机 Franka 上,做两个任务:block-in-basket(把积木放进篮子)**9/10**,block stacking(把积木叠起来)**5/10**。同样是 zero-shot,同样一台机器人,差距 **40 个百分点**。
block-in-basket:9/10
本质是把物体放到一个**有容差的目标区域**。篮口比积木大,落点偏几厘米不影响成败。这类任务对末位精度不敏感。
block stacking:5/10
本质是把物体**精确对齐到另一个物体上**,容错在毫米量级,且涉及接触力与稳定性。这类任务对最后几毫米的精度极度敏感。
论文给出的三个主要发现里,有一条与上面的落差直接相关:**当放宽推理或交互步数的上限时,性能持续提升**。这就是 test-time scaling——给机器人更多推理时算力,能力持续变强。
把这条和 20 cm 限幅放在一起看,逻辑就通了:精细任务必须靠多轮小步逼近,步数上限一放宽,能走的轮数变多,成功率就涨。也就是说,RoboDawn 在 block stacking 上表现差,**不是因为模型不知道该怎么叠,而是因为接口允许它调整的粒度太粗、轮数不够**。
边界一:π0.5 的 46.0% 是什么口径。论文原文的表述是「超过了扎实的基线 π0.5(46.0%)」,且语境为 zero-shot 设置。这不等于「未训练的 VLM 全面胜过已训练的 VLA」——π0.5 在微调后的成绩不在本文讨论范围内,两者口径不同,不能直接外推。
边界二:真机各只有 10 次。9/10 与 5/10 的样本量是 10 次试验。10 次里差 4 次,在统计上完全可能来自随机波动。本文把这组数字当作**值得追查的线索**而非已确立的结论——真正的价值在于它提出了一个可验证的假设:命令粒度决定精细操作上限。