74.7 掉到 26.6:Berkeley 这份触觉世界模型,最值钱的不是 70.6 分,是那次替换
六项富接触任务平均 70.6 分、压过最强基线 38.0 分——但真正说明问题的是那次消融:把世界模型的触觉潜变量换成原始触觉特征,四任务均值从 74.7 掉到 26.6。
- 做了什么:加州大学伯克利分校 Humanoid Intelligence Center 提出 DexTacWAM,一个用于灵巧操作的视觉—触觉世界—动作模型。
- 怎么做的:通过持续视觉到触觉学习,把一个预训练的视频世界模型改造成视觉—触觉模型,用于多指接触的预测建模与动作生成。
- 分数:在 6 项富接触(contact-rich)灵巧操作任务上全部取得最高分,平均 70.6,最强基线为 38.0。
- 关键消融:保持编码器、策略与训练配方不变,只把世界模型的触觉潜变量替换成直接输入的原始触觉特征,四任务平均从 74.7 掉到 26.6。
- 结论:世界模型式的触觉潜表示,优于把触觉特征直接注入策略。
- 动机:多指触觉数据稀缺且昂贵,从视觉迁移提供了一条可扩展的替代路径。
先看结论:UC Berkeley Humanoid Intelligence Center 的 DexTacWAM,在 6 项富接触灵巧操作任务上全部拿到最高分,平均 70.6 分,最强基线 38.0 分。绝对提升 32.6 点,接近翻倍。
但这份工作真正值钱的不是这个数字,是那次消融。研究者保持编码器、策略、训练配方全部不变,只把世界模型内部的触觉潜变量,换成了直接喂给策略的原始触觉特征。结果是:四任务平均从 74.7 掉到 26.6。
把两个数字摆在一起看,结构就很清楚了:
70.6 对 38.0,绝对提升 **32.6 点**。
这是「整套方法 vs 别家方法」的比较,变量不唯一——模型结构、数据、训练配方都不同。
74.7 对 26.6,落差 **48.1 点**。
这是「同方法换一个中间表示」的比较,其他全部固定,变量唯一。
注意:74.7 和 70.6 不是同一个统计对象。70.6 是**六项任务**的平均,74.7 是消融中**四项任务**的平均。摘要没有说明这四项是哪四项,也没有给出六项任务的逐项分数分布。
这个差别不能忽略。如果用于消融的四项恰好是模型表现较好的那几项,那么 74.7 会高于 70.6,这符合观察;反之若四项偏难,则这个差值就需要别的解释。在拿到论文原文之前,只能把这个 3—4 分的差值标注为「统计对象不同所致,具体原因未披露」。
这次消融的结论可以翻译成一句工程语言:触觉信息不是「给不给策略」的问题,是「放在哪一层」的问题。直接把原始触觉特征拼进策略输入,效果只有 26.6;先让世界模型把触觉学成可预测的潜表示,效果到 74.7。
为什么差这么多?一个合理的解释是:世界模型的预训练目标本身就是「预测未来」,它逼着潜变量去编码那些**对未来接触状态有预测力的信息**;而原始触觉特征是「当下的读数」,其中包含大量对决策无用的噪声维度,策略得自己学会筛。
摘要给出的动机很实在:多指触觉数据稀缺且昂贵,而视觉数据便宜且海量。所以路线是——先有一个在视频上预训练好的世界模型,再通过「持续视觉到触觉学习」把它改造成视觉—触觉模型。
这条路径的经济性才是重点。多指触觉传感器的标定、维护、同步采集成本都很高,一条产线配齐触觉手套做数采,门槛远高于架几个摄像头。
| 路径 | 数据来源 | 成本特征 | 已知限制 |
|---|---|---|---|
| 纯触觉采集 | 多指触觉传感器实测 | 稀缺且昂贵 | 规模受限、跨本体复用难 |
| 视觉预训练 + 触觉迁移 | 海量视频 + 少量触觉 | 边际成本低 | 迁移损失大小未见披露 |
由于本次只取得了 AI 摘要源,以下几项尚未确认,建议在引用前补齐:
一是任务清单与评判标准——「富接触灵巧操作任务」具体是哪六项、评分是成功率还是归一化分数,摘要未说明;二是基线方法——38.0 分对应的是哪个方法,决定了这个提升的含金量;三是硬件配置——用的是什么触觉传感器、多少通道、是否跨本体验证;四是泛化边界——是否在新物体、新光照条件下测试过。