研究解读 · 神机百见-具身解读

一个动作词 2 厘米:NUS 把 VLM 的「想」和机器人的「动」接在了一张接口上

VLM 只输出 11 个无参数动作词,解释器统一按 2 厘米步长落地——同一接口零样本驱动 Franka 与 AgileX;把命名约定拆掉,成功率从 100% 崩到 5%,接口本身就是能力。

一分钟速览
  1. 论文:新加坡国立大学 Show Lab《Show-Harness: Just a VLM Agent Can Play Robots》(9 月上旬发布,代码 Apache 2.0 开源,GitHub 上线数日 232 星,附 LoRA 适配器与演示数据集)。
  2. 接口设计:VLM 只输出无参数语义动作单元——MV_LEFT、GRASP、ROTATE_CW 等 11 个词,解释器统一按 2 厘米步长执行:同一接口无需改动即驱动 7 自由度 Franka、6 自由度 AgileX 与仿真器。
  3. 两条路线:前沿闭源 VLM 零样本直控真机;Qwen3.5(0.8B–9B)与 Gemma 4 E4B 仅需几 GPU 小时 LoRA 微调即可上机,控制频率带 12–33 Hz(对照:π0.5 为 20 Hz、GR00T 为 24 Hz)。
  4. 消融最狠的一条:移除语义命名与方向约定、让模型从交互中自己猜映射,成功率从 100% 崩到 5%,20 次试验 19 次超时;模型自述的方向映射正确率仅 23.3%(随机水平 16.7%),20 次里 11 次左右镜像混淆。
  5. GUMI:把同一动作空间搬到图形界面,人和 Agent 在 GUI 上「玩」机器人即可采集演示数据,无需任何遥操作硬件。
数据来源与边界
本文事实来自三类信源:①新加坡国立大学 Show Lab 论文项目页(https://showlab.github.io/Show-Harness/),含全部消融数字(100%/90%/95%/5% 四组设定、23.3% 方向推断正确率、2 厘米步长约定、π0.5/GR00T 频率对照);②Lab Index 收录页(labindex.ai/outputs/nus/show-harness,收录日期 2026-09-09),提供开源细节:Apache 2.0、rank 64 LoRA(视觉塔冻结)、Qwen3.5 0.8B–9B 与 Gemma 4 E4B 适配器、GitHub 首数日 232 星;③新浪机器人热点小时报 2026-09-27 07:30 收录的中文解读。素材时间窗为当日 09:00 → 19:00,本批于 10:25 执行;论文发布于 9 月上旬(窗口外),窗口内增量为 9/27 中文解读扩散(收录时间 07:30 早于窗口起点,按扩窗规则并入并在上文写明)。与本站 218 号稿(RoboDawn 评测揭示 VLM 真机接口落差)的差异:那篇指问题,本篇是同一问题域的接口工程解,无内容重叠。判断均以「判断:」开头。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
接口为什么放在「技能」和「关节」之间

让通用 VLM 控制机器人,行业里一直有两个极端都不好用。往上走,让模型直接输出「抓住那个物体」这样的完整技能,模型 seen 过的技能有限,场景一变就哑火;往下走,让模型输出连续关节控制量,语义智能被稀释成数值回归,模型既慢又容易飘。Show Lab 的选择是把接口架在中间:VLM 每一步只输出一个语义动作单元——MV_LEFT、MV_DOWN、GRASP、RELEASE、ROTATE_CW、STILL、DONE,一共 11 个词,每个词不带任何参数。

参数去哪了?在解释器里。每个动作词落地为固定 2 厘米的运动步长,执行器端的解释器负责把「向左」翻译成具体机型的关节运动。这一刀切下去,好处立刻显现:同一个模型、同一套词汇,不用改一个参数就能驱动 7 自由度的 Franka、6 自由度的 AgileX 和仿真器——因为「向左 2 厘米」在哪个机体上都是同一个意思。每步执行后,新的图像和状态送回模型,闭环推进直到 DONE。模型始终为细粒度物理决策负责,但它需要「说」的只是一个它本来就认识的词。

消融实验:约定本身就是能力

项目页里最有信息量的不是成功率高低的排名,而是一组命名消融。四组设定下做同一个任务:用语义命名+写明方向约定(谁定义「左」),20/20 全对,25 步完成;换成任意符号 A–F 但把约定写清楚,还能到 95%;只给语义名、不解释约定,掉到 90%;两者都去掉、让模型从自己的交互里推断映射,成功率崩到 5%,20 次试验 19 次超时。让模型把猜到的映射写下来核对:六个方向的正确率 23.3%,勉强高于 16.7% 的随机水平,20 次里 11 次把左右镜像搞反。

这组数字的价值在于把一个常被忽略的事实量化了:大模型对「左」「右」这类词的语义是现成的,但「图像里的左」和「机器人坐标系里的左」之间的约定,必须由系统显式给出。接口不是动作空间外面的装饰——约定本身构成了能力。这也解释了为什么这套零样本方案能直接跑通:它把模型需要「学」的东西压缩到了最少,剩下的全部用工程约定兜住。

判断:无参数语义动作换来的泛化是有代价的——每步 2 厘米的粒度和秒级决策周期,决定了这套方案天生不适合高频精细产线,它适合的是演示验证、跨本体评测和演示数据采集。项目页给出的频率对照也印证了这一点:微调后的小模型控制频率 12–33 Hz,与 π0.5(20 Hz)、GR00T(24 Hz)处在同一频带,但 VLA 走的是端到端回归路线,Show-Harness 走的是「语义推理+确定性执行」,两条路线的误差模式完全不同,不可直接互摘性能标签。
GUMI 才是对数采行业影响最直接的部分

论文配套的 GUMI(GUI Manipulation Interface)把同一套语义动作空间搬进了图形界面:采集员(或 Agent)在界面上点「向左」「抓取」,动作词直接驱动真机,演示数据同步落盘——整个过程不需要机械臂遥操作主从台、不需要 VR 设备、不需要专业操作培训。对一个数据采集员日产出 4–5 小时有效数据(本站 9 月 26 日人民网稿口径)的行业来说,把遥操作硬件门槛换成一套网页界面,意味着数采产能的扩张瓶颈从「设备和场地」松动为「界面和任务设计」。

开源策略也值得记录:Apache 2.0 协议,代码、Qwen3.5 与 Gemma 4 E4B 的 LoRA 适配器(rank 64、视觉塔冻结)、演示数据集全部公开,GitHub 上线数日 232 星。小模型几 GPU 小时的微调成本,把「让自家机器人跑一套 VLM 控制」的门槛压到了高校实验室级别。

判断:Show-Harness 与本站 218 号稿报道的 RoboDawn 评测是同一问题域的两半——RoboDawn 揭示通用 VLM 在真机接口上存在大幅能力落差,Show-Harness 给出的答案是:落差不在模型智能里,而在接口约定里。它无意取代 VLA,而是划出了一条清晰的分工线:语义推理交给 VLM,度量与执行交给确定性解释器。对做机器人二次开发与数采服务的团队,真正值得消化的是那句被消融实验反复验证的话——接口约定的质量,决定上层智能能兑现几成。
来源:NUS Show Lab 项目页(https://showlab.github.io/Show-Harness/);Lab Index 收录 2026-09-09(labindex.ai/outputs/nus/show-harness);新浪机器人热点小时报 2026-09-27 07:30 收录。素材时间窗:当日 09:00 → 19:00。