一个动作词 2 厘米:NUS 把 VLM 的「想」和机器人的「动」接在了一张接口上
VLM 只输出 11 个无参数动作词,解释器统一按 2 厘米步长落地——同一接口零样本驱动 Franka 与 AgileX;把命名约定拆掉,成功率从 100% 崩到 5%,接口本身就是能力。
- 论文:新加坡国立大学 Show Lab《Show-Harness: Just a VLM Agent Can Play Robots》(9 月上旬发布,代码 Apache 2.0 开源,GitHub 上线数日 232 星,附 LoRA 适配器与演示数据集)。
- 接口设计:VLM 只输出无参数语义动作单元——MV_LEFT、GRASP、ROTATE_CW 等 11 个词,解释器统一按 2 厘米步长执行:同一接口无需改动即驱动 7 自由度 Franka、6 自由度 AgileX 与仿真器。
- 两条路线:前沿闭源 VLM 零样本直控真机;Qwen3.5(0.8B–9B)与 Gemma 4 E4B 仅需几 GPU 小时 LoRA 微调即可上机,控制频率带 12–33 Hz(对照:π0.5 为 20 Hz、GR00T 为 24 Hz)。
- 消融最狠的一条:移除语义命名与方向约定、让模型从交互中自己猜映射,成功率从 100% 崩到 5%,20 次试验 19 次超时;模型自述的方向映射正确率仅 23.3%(随机水平 16.7%),20 次里 11 次左右镜像混淆。
- GUMI:把同一动作空间搬到图形界面,人和 Agent 在 GUI 上「玩」机器人即可采集演示数据,无需任何遥操作硬件。
让通用 VLM 控制机器人,行业里一直有两个极端都不好用。往上走,让模型直接输出「抓住那个物体」这样的完整技能,模型 seen 过的技能有限,场景一变就哑火;往下走,让模型输出连续关节控制量,语义智能被稀释成数值回归,模型既慢又容易飘。Show Lab 的选择是把接口架在中间:VLM 每一步只输出一个语义动作单元——MV_LEFT、MV_DOWN、GRASP、RELEASE、ROTATE_CW、STILL、DONE,一共 11 个词,每个词不带任何参数。
参数去哪了?在解释器里。每个动作词落地为固定 2 厘米的运动步长,执行器端的解释器负责把「向左」翻译成具体机型的关节运动。这一刀切下去,好处立刻显现:同一个模型、同一套词汇,不用改一个参数就能驱动 7 自由度的 Franka、6 自由度的 AgileX 和仿真器——因为「向左 2 厘米」在哪个机体上都是同一个意思。每步执行后,新的图像和状态送回模型,闭环推进直到 DONE。模型始终为细粒度物理决策负责,但它需要「说」的只是一个它本来就认识的词。
项目页里最有信息量的不是成功率高低的排名,而是一组命名消融。四组设定下做同一个任务:用语义命名+写明方向约定(谁定义「左」),20/20 全对,25 步完成;换成任意符号 A–F 但把约定写清楚,还能到 95%;只给语义名、不解释约定,掉到 90%;两者都去掉、让模型从自己的交互里推断映射,成功率崩到 5%,20 次试验 19 次超时。让模型把猜到的映射写下来核对:六个方向的正确率 23.3%,勉强高于 16.7% 的随机水平,20 次里 11 次把左右镜像搞反。
这组数字的价值在于把一个常被忽略的事实量化了:大模型对「左」「右」这类词的语义是现成的,但「图像里的左」和「机器人坐标系里的左」之间的约定,必须由系统显式给出。接口不是动作空间外面的装饰——约定本身构成了能力。这也解释了为什么这套零样本方案能直接跑通:它把模型需要「学」的东西压缩到了最少,剩下的全部用工程约定兜住。
论文配套的 GUMI(GUI Manipulation Interface)把同一套语义动作空间搬进了图形界面:采集员(或 Agent)在界面上点「向左」「抓取」,动作词直接驱动真机,演示数据同步落盘——整个过程不需要机械臂遥操作主从台、不需要 VR 设备、不需要专业操作培训。对一个数据采集员日产出 4–5 小时有效数据(本站 9 月 26 日人民网稿口径)的行业来说,把遥操作硬件门槛换成一套网页界面,意味着数采产能的扩张瓶颈从「设备和场地」松动为「界面和任务设计」。
开源策略也值得记录:Apache 2.0 协议,代码、Qwen3.5 与 Gemma 4 E4B 的 LoRA 适配器(rank 64、视觉塔冻结)、演示数据集全部公开,GitHub 上线数日 232 星。小模型几 GPU 小时的微调成本,把「让自家机器人跑一套 VLM 控制」的门槛压到了高校实验室级别。