# 74.7 掉到 26.6：Berkeley 这份触觉世界模型，最值钱的不是 70.6 分，是那次替换

> 六项富接触任务平均 70.6 分、压过最强基线 38.0 分——但真正说明问题的是那次消融：把世界模型的触觉潜变量换成原始触觉特征，四任务均值从 74.7 掉到 26.6。

### TLDR

- **做了什么**：加州大学伯克利分校 Humanoid Intelligence Center 提出 **DexTacWAM**，一个用于灵巧操作的视觉—触觉世界—动作模型。
- **怎么做的**：通过**持续视觉到触觉学习**，把一个预训练的视频世界模型改造成视觉—触觉模型，用于多指接触的预测建模与动作生成。
- **分数**：在 **6 项富接触（contact-rich）**灵巧操作任务上全部取得最高分，平均 **70.6**，最强基线为 **38.0**。
- **关键消融**：保持编码器、策略与训练配方不变，只把世界模型的触觉潜变量替换成**直接输入的原始触觉特征**，四任务平均从 **74.7** 掉到 **26.6**。
- **结论**：世界模型式的触觉潜表示，优于把触觉特征直接注入策略。
- **动机**：多指触觉数据稀缺且昂贵，从视觉迁移提供了一条可扩展的替代路径。

### SRC

本篇素材来自 AGI HUNT（AI News Daily）**2026 年 9 月 30 日期**的条目及其详情页子页，该期于北京时间 2026 年 9 月 30 日早晨可访问，落在素材时间窗「2026-09-29 18:00 → 2026-09-30 09:00」内。70.6 / 38.0、六项任务、74.7 → 26.6 消融、四任务统计口径以及「多指触觉数据稀缺且昂贵」的动机说明均出自该条目正文。**重要限定**：该来源为 AI 生成的摘要型日报，本次未取得论文原文、arXiv 编号或项目主页，因此所有数字按「单一信源 + AI 摘要 + 未见论文原文」处理，未在第三方渠道交叉核实；任务名称、实验设置、基线方法均未披露。文中「绝对提升 32.6 点」「消融落差 48.1 点」「74.7 与 70.6 统计对象不同」为作者对已披露数字的算术与口径辨析，非论文结论。与既有稿件的差异：本站 278 号稿写 Sharpa 同日发布的触觉硬件（产品与数采视角），本篇只谈算法侧「触觉信息该放在哪一层」的消融证据，不涉硬件参数。事实与判断分开，判断以「判断：」开头。

### BODY

<div class="sec">
<div class="eyebrow">两个数字，哪个更能说明问题</div>
<p>先看结论：UC Berkeley Humanoid Intelligence Center 的 DexTacWAM，在 6 项富接触灵巧操作任务上全部拿到最高分，平均 70.6 分，最强基线 38.0 分。绝对提升 32.6 点，接近翻倍。</p>
<p>但这份工作真正值钱的不是这个数字，是那次消融。研究者保持编码器、策略、训练配方全部不变，只把世界模型内部的触觉潜变量，换成了直接喂给策略的原始触觉特征。结果是：四任务平均从 74.7 掉到 26.6。</p>

<div class="jx-bars">
<div class="jx-bar-row"><div class="jx-bar-lab">世界模型潜变量</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:75%;background:#0d8a5f"></div></div><div class="jx-bar-val">74.7（四任务平均）</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">直接注入触觉特征</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:27%;background:#b85c0a"></div></div><div class="jx-bar-val">26.6（四任务平均）</div></div>
<div class="jx-legend"><div class="jx-lg">同一编码器、同一策略、同一配方，只替换中间表示；落差 48.1 点为作者算术</div></div>
</div>
</div>

<div class="sec">
<div class="eyebrow">48.1 点 > 32.6 点</div>
<p>把两个数字摆在一起看，结构就很清楚了：</p>

<div class="jx-split">
<div style="flex:50">
<div class="eyebrow">对外分数</div>
<p>70.6 对 38.0，绝对提升 **32.6 点**。<br>这是「整套方法 vs 别家方法」的比较，变量不唯一——模型结构、数据、训练配方都不同。</p>
</div>
<div style="flex:50">
<div class="eyebrow">内部消融</div>
<p>74.7 对 26.6，落差 **48.1 点**。<br>这是「同方法换一个中间表示」的比较，其他全部固定，变量唯一。</p>
</div>
</div>

<div class="keypoint">判断：消融的落差大于对外的绝对提升，这件事本身就说明——这套方法里真正起作用的那一环，比整套方法相对基线的优势还要大。读论文时先找消融、再看总分，是本站反复验证过的一条判据：总分回答「好不好」，消融回答「好在哪」，而只有后者能指导自己的工程决策。</div>
</div>

<div class="sec">
<div class="eyebrow">一个必须先说清的口径问题</div>
<p>注意：74.7 和 70.6 不是同一个统计对象。70.6 是**六项任务**的平均，74.7 是消融中**四项任务**的平均。摘要没有说明这四项是哪四项，也没有给出六项任务的逐项分数分布。</p>
<p>这个差别不能忽略。如果用于消融的四项恰好是模型表现较好的那几项，那么 74.7 会高于 70.6，这符合观察；反之若四项偏难，则这个差值就需要别的解释。在拿到论文原文之前，只能把这个 3—4 分的差值标注为「统计对象不同所致，具体原因未披露」。</p>
<div class="keypoint">判断：凡是摘要里同时出现「总分」和「子任务分数」却没给分布的，都要先默认它们不可直接比较。这条跟本站处理 RoboDawn（真机 9/10 vs 5/10）、紫东太初（分数梯度）时的做法一致——真正有信息量的往往不是那个平均值，是各任务之间的离散度。</div>
</div>

<div class="sec">
<div class="eyebrow">「放在哪一层」比「用不用」重要得多</div>
<p>这次消融的结论可以翻译成一句工程语言：触觉信息不是「给不给策略」的问题，是「放在哪一层」的问题。直接把原始触觉特征拼进策略输入，效果只有 26.6；先让世界模型把触觉学成可预测的潜表示，效果到 74.7。</p>
<p>为什么差这么多？一个合理的解释是：世界模型的预训练目标本身就是「预测未来」，它逼着潜变量去编码那些**对未来接触状态有预测力的信息**；而原始触觉特征是「当下的读数」，其中包含大量对决策无用的噪声维度，策略得自己学会筛。</p>
<div class="keypoint">判断：如果这条结论成立，它对做触觉硬件的团队有一个直接含义——传感器的竞争焦点不该只在采样率和通道数，还要看输出能不能被上层模型学成稳定的潜表示。换句话说，触觉模组未来可能要开始比「表示友好度」，而不只是比硬件指标。这个判断基于单一来源的消融结果，样本有限，建议等论文原文与后续复现再下结论。</div>
</div>

<div class="sec">
<div class="eyebrow">为什么非要从视觉迁移</div>
<p>摘要给出的动机很实在：多指触觉数据稀缺且昂贵，而视觉数据便宜且海量。所以路线是——先有一个在视频上预训练好的世界模型，再通过「持续视觉到触觉学习」把它改造成视觉—触觉模型。</p>
<p>这条路径的经济性才是重点。多指触觉传感器的标定、维护、同步采集成本都很高，一条产线配齐触觉手套做数采，门槛远高于架几个摄像头。</p>

<div class="tbl-wrap">
<table>
<tr><th>路径</th><th>数据来源</th><th>成本特征</th><th>已知限制</th></tr>
<tr><td>纯触觉采集</td><td>多指触觉传感器实测</td><td>稀缺且昂贵</td><td>规模受限、跨本体复用难</td></tr>
<tr><td>视觉预训练 + 触觉迁移</td><td>海量视频 + 少量触觉</td><td>边际成本低</td><td>迁移损失大小未见披露</td></tr>
</table>
</div>
<div class="cap">表注：左两列来自摘要披露的动机说明；右列「已知限制」为作者归纳，摘要未给出迁移效率的量化结果。</div>
</div>

<div class="sec">
<div class="eyebrow">在拿到论文之前，还缺哪些信息</div>
<p>由于本次只取得了 AI 摘要源，以下几项尚未确认，建议在引用前补齐：</p>
<p>一是任务清单与评判标准——「富接触灵巧操作任务」具体是哪六项、评分是成功率还是归一化分数，摘要未说明；二是基线方法——38.0 分对应的是哪个方法，决定了这个提升的含金量；三是硬件配置——用的是什么触觉传感器、多少通道、是否跨本体验证；四是泛化边界——是否在新物体、新光照条件下测试过。</p>
<div class="keypoint">判断：四项里第三项对国内团队最实际。如果这项工作需要高密度触觉阵列才能跑出 70.6，那么它对用低成本触觉方案的团队参考价值就有限；反之若在中低通道配置下依然成立，那它的工程可复制性会高一个量级。建议把「传感器通道数与性能的关系」作为读原文时的第一目标。</div>
</div>

<div class="srcline">来源：AGI HUNT（AI News Daily）2026-09-30 期条目及详情页；单一信源、AI 生成摘要、未见论文原文。素材时间窗 2026-09-29 18:00 → 2026-09-30 09:00。</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/dextacwam-tactile-world-model-ablation-gap/*
