# 73.6% 不是重点：RoboDawn 真机上 9/10 与 5/10 的落差才是

> 不训练、不微调，只靠一个接口和一条演示，VLM 就能控制机器人。论文的头条是 73.6%，但真机两个任务 9/10 与 5/10 的 40 个百分点落差，才画出了这条路的天花板在哪。

### TLDR

- **论文**：arXiv:2609.22966，2026 年 9 月 19 日 11:34 UTC 提交，清华与腾讯混元团队，题为《Transferring the Intelligence of VLMs to Robotic Control》。
- **方法**：RoboDawn 把机器人控制暴露给一个 agentic VLM，动作空间只有一组紧凑离散命令——**平移 / 旋转 / 夹爪**，配上下文学习（ICL）给少量演示，全程**不做任务专属训练、不更新参数**。
- **仿真成绩**：RoboTwin 2.0 C2R 上 zero-shot **53.2%** → one-shot **73.6%**，超过 π0.5 基线 **46.0%** 与 LingBot-VLA **50.4%**；RoboDojo 上 zero-shot 35.67% → one-shot **47.17%**。
- **真机落差（本文重点）**：Franka 上 zero-shot 完成 block-in-basket **9/10**，block stacking 只有 **5/10**——同一框架、同一机器人、同一设置，差 **40 个百分点**。
- **精度边界**：单条命令平移限幅 **20 cm**、旋转限幅 **90°**；研究者观察到放宽推理/交互步数上限后性能持续提升的 **test-time scaling** 现象。
- **窗口说明**：论文提交于 9 月 19 日（窗口外），窗口内新增量为 AGI HUNT 2026-09-23 日报首次收录与 Hugging Face Papers 论文页聚合。

### SRC

本文事实以 arXiv:2609.22966v1 论文摘要与正文（含图 1 概览与动作语法定义）为主源，并以 Semantic Scholar API 页面、Hugging Face Papers 论文页、HyperAI 论文页、picx.dev 视觉摘要四源交叉核对，数字（53.2% / 73.6% / 46.0% / 50.4% / 35.67% / 47.17% / 9 与 10）在四源间完全一致；提交时间 2026-09-19 11:34 UTC 取自 Semantic Scholar 的版本记录。素材时间窗为前一日 18:00 → 当日 09:00：论文提交日为 9 月 19 日，**属窗口外**，按扩窗规则第 2 条（近 3 日内行业进展做补充解读）使用，窗口内新增量明确为——AGI HUNT 2026-09-23 英文日报首次收录本条并给出 one-shot 73.6% 的入口摘要，Hugging Face Papers 同期聚合页上线；本文的切入角度（真机两任务落差与命令粒度天花板）为首次提出，与存量任何稿件不重合。边界已明示：π0.5 的 46.0% 是论文自述的 zero-shot 基线，不是 π0.5 微调后的成绩，两者不可直接当作「未训练胜过已训练」的普遍性结论；真机两项仅各 10 次试验，样本量极小，不足以支撑统计显著性。与存量稿件的差异：本站 168 号稿写的是 LIBERO-PRO 上的智能体基础设施、177 号稿写的是世界模型该评什么，本篇针对的是**「不训练只做接口」这条落地路径的能力边界**，主题与角度均不同。判断性内容均以「判断：」开头。

### BODY

<div class="sec">
<div class="eyebrow">这篇论文在问一个很直接的问题</div>
<p>人可以在数字世界和物理世界之间无缝切换——这提示智能本身可能跨具身迁移。那么反过来问：**在数字世界数据上训练出来的视觉语言模型（VLM），它的智能能不能直接迁移到物理世界的机器人控制上？**</p>
<p>RoboDawn 的回答方式很工程化：不改模型，改接口。它定义了一套「人类直觉友好」的接口，把机器人控制暴露给一个 agentic VLM，动作空间压缩成一组离散命令——平移、旋转、夹爪开合。VLM 闭环工作：观察当前视觉状态 → 推理下一步动作 → 执行 → 根据执行后的状态调整后续决策。</p>
<p>叠加的是上下文学习（ICL）：用少量演示把 VLM 同时锚定在**接口怎么用**和**任务怎么解**两件事上，全程不做任务专属的机器人训练，不更新任何参数。</p>
<div class="keypoint">判断：这条路线对做交付的人意义最大。它绕开了具身智能落地里最贵的那一环——攒数据。如果「不训练、只写接口和演示」就能让机器人跑起来，那么一个场景能不能上机器人的判断依据，就从「我们有没有这个场景的数据」变成「我们能不能把这个场景拆成模型看得懂的几步」。<strong>变的是稀缺资源：从数据变成任务拆解能力。</strong></div>
</div>

<div class="sec">
<div class="eyebrow">接口长什么样：GIP 与三个限幅</div>
<p>接口的核心概念叫 **GIP（Gripper Interaction Point，夹爪交互点）**，定义为夹爪指尖的中点。视觉标注、状态报告、命令下发全部统一以 GIP 为参照——这是一个很聪明的设计，它把「机器人现在在哪」这个问题压缩成了画面上的一个点。</p>
<p>动作语法是一组有限的命令：move、rotate、point、gripper、home、wait、done，分左右臂。平移轴为 x/y/z，旋转轴为 roll/pitch/yaw，均在世界坐标系下。命令描述的是 GIP 位姿的**增量变化**，把底层轨迹控制完全抽象掉了。</p>
<div class="tbl-wrap">
<table>
<thead><tr><th>参数</th><th>取值</th><th>工程含义</th></tr></thead>
<tbody>
<tr><td>单条平移命令上限</td><td>20 cm</td><td>一次决策的最大位移分辨率</td></tr>
<tr><td>单条旋转命令上限</td><td>90°</td><td>一次决策的最大姿态分辨率</td></tr>
<tr><td>参照点</td><td>GIP（指尖中点）</td><td>视觉、状态、命令三者统一</td></tr>
<tr><td>是否需要训练</td><td>否（zero-shot / ICL）</td><td>不更新参数</td></tr>
</tbody>
</table>
</div>
<div class="cap">表：RoboDawn 接口的关键参数。20 cm 与 90° 这两个限幅，是后文判断精度天花板的依据。</div>
</div>

<div class="sec">
<div class="eyebrow">先看头条，再看真机</div>
<p>论文的头条数字确实漂亮。在 RoboTwin 2.0 C2R 上，成功率从 zero-shot 的 53.2% 提升到 one-shot 的 **73.6%**；同一基准上，π0.5 的基线是 46.0%，LingBot-VLA 是 50.4%。RoboDojo 上则从 35.67% 提升到 **47.17%**。</p>
<div class="jx-bars">
<div class="jx-bar-row"><div class="jx-bar-lab">RoboDawn zero-shot</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:53%;background:#0a749a"></div></div><div class="jx-bar-val">53.2%</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">π0.5 基线</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:46%;background:#566781"></div></div><div class="jx-bar-val">46.0%</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">LingBot-VLA</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:50%;background:#4b5f8a"></div></div><div class="jx-bar-val">50.4%</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">RoboDawn one-shot</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:74%;background:#0d8a5f"></div></div><div class="jx-bar-val">73.6%</div></div>
<div class="jx-legend"><div class="jx-lg">RoboTwin 2.0 C2R 基准，成功率（%）</div></div>
</div>
<p>但本文想让你看的是另一组数字。同一框架迁移到真机 Franka 上，做两个任务：block-in-basket（把积木放进篮子）**9/10**，block stacking（把积木叠起来）**5/10**。同样是 zero-shot，同样一台机器人，差距 **40 个百分点**。</p>
<div class="jx-split">
<div style="flex:50">
<p><strong>block-in-basket：9/10</strong></p>
<p>本质是把物体放到一个**有容差的目标区域**。篮口比积木大，落点偏几厘米不影响成败。这类任务对末位精度不敏感。</p>
</div>
<div style="flex:50">
<p><strong>block stacking：5/10</strong></p>
<p>本质是把物体**精确对齐到另一个物体上**，容错在毫米量级，且涉及接触力与稳定性。这类任务对最后几毫米的精度极度敏感。</p>
</div>
</div>
<div class="keypoint">判断：这两个任务的落差，把「离散命令接口」的天花板标出来了。接口把动作压成 20 cm / 90° 的增量命令，粗放任务一步到位，精细任务必须靠多轮逼近——而每多一轮，误差累积与失败机会各多一次。<strong>判断：这类接口的精度上限，等于单条命令限幅粒度的数量级；要突破它，得改的是命令粒度而不是模型规模。</strong></div>
</div>

<div class="sec">
<div class="eyebrow">test-time scaling 是这条落差的另一面</div>
<p>论文给出的三个主要发现里，有一条与上面的落差直接相关：**当放宽推理或交互步数的上限时，性能持续提升**。这就是 test-time scaling——给机器人更多推理时算力，能力持续变强。</p>
<p>把这条和 20 cm 限幅放在一起看，逻辑就通了：精细任务必须靠多轮小步逼近，步数上限一放宽，能走的轮数变多，成功率就涨。也就是说，RoboDawn 在 block stacking 上表现差，**不是因为模型不知道该怎么叠，而是因为接口允许它调整的粒度太粗、轮数不够**。</p>
<div class="jx-steps">
<div class="jx-step"><div class="jx-step-l">粗放任务（放篮子）</div><div class="jx-step-bar"><div class="jx-step-v" style="width:90%;background:#0d8a5f"></div></div><div class="jx-step-ax">9/10，容差大，一步到位</div></div>
<div class="jx-step"><div class="jx-step-l">精细任务（叠积木）</div><div class="jx-step-bar"><div class="jx-step-v" style="width:50%;background:#b85c0a"></div></div><div class="jx-step-ax">5/10，需多轮逼近</div></div>
<div class="jx-step"><div class="jx-step-l">放宽步数上限</div><div class="jx-step-bar"><div class="jx-step-v" style="width:70%;background:#00a6d6"></div></div><div class="jx-step-ax">性能持续提升（test-time scaling）</div></div>
<div class="jx-legend"><div class="jx-lg">纵轴非统一量纲，仅示意三者关系</div></div>
</div>
<div class="keypoint">判断：test-time scaling 在机器人上有一个和纯软件场景完全不同的代价函数。多一轮推理意味着多一次真实世界的动作执行、多一段时间、多一次失败机会。在仿真里放宽步数几乎免费，在真机上每一步都花钱。<strong>判断：评估这类方法能不能进产线，要看的是「成功率除以交互轮数」而不是成功率本身</strong>——论文没有给出这个比值，这是复现时最该补的指标。</div>
</div>

<div class="sec">
<div class="eyebrow">两个必须一起读的边界</div>
<div class="jx-split">
<div style="flex:50">
<p><strong>边界一：π0.5 的 46.0% 是什么口径。</strong>论文原文的表述是「超过了扎实的基线 π0.5（46.0%）」，且语境为 zero-shot 设置。这不等于「未训练的 VLM 全面胜过已训练的 VLA」——π0.5 在微调后的成绩不在本文讨论范围内，两者口径不同，不能直接外推。</p>
</div>
<div style="flex:50">
<p><strong>边界二：真机各只有 10 次。</strong>9/10 与 5/10 的样本量是 10 次试验。10 次里差 4 次，在统计上完全可能来自随机波动。本文把这组数字当作**值得追查的线索**而非已确立的结论——真正的价值在于它提出了一个可验证的假设：命令粒度决定精细操作上限。</p>
</div>
</div>
<div class="keypoint">判断：这篇论文对行业的实际贡献，可能不在于证明了「VLM 能控制机器人」——这件事很多人已经在做——而在于它给出了一套**可拆解的接口规范**：GIP 参照点、离散命令集、平移/旋转限幅、ICL 演示结构。这套规范可以直接被工程团队抄去做原型验证。判断：如果你的场景以粗放搬运为主（分拣、上下料、投筐），这条路现在就能试；如果涉及精密装配，**先把命令粒度改小再试，别拿 20 cm 的限幅去撞毫米级的活**。</div>
<div class="srcline">来源：arXiv:2609.22966v1《Transferring the Intelligence of VLMs to Robotic Control》，2026-09-19 11:34 UTC 提交，作者 Meng-Hao Guo、Se June Joo、Jaehyun Kang、Dongyun Kim、Yena Kim、Hanjung Kim、Seon Joo Kim（清华大学 + 腾讯混元）；经 Semantic Scholar、Hugging Face Papers（huggingface.co/papers/2609.22966）、HyperAI 论文页交叉核对，数字一致。窗口内新增量：AGI HUNT 2026-09-23 英文日报首次收录。素材时间窗：2026-09-22 18:00 → 2026-09-23 09:00。</div>
</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/robodawn-vlm-interface-icl-gap/*
