# 20 到 30 条力觉轨迹，把汉诺塔从 26.7 提到 56.7：LIFT 给预训练 VLA 补的是「手感」

> 只要 20–30 条在线力觉轨迹就能让预训练 VLA 学会反应式力控制，控制频率从 1Hz 抬到 10Hz——但 56.7 分这个绝对值，才是真正该盯的地方。

### TLDR

- **做了什么**：LIFT（Late Reactive Injection of Force for VLA Post-Training）在不做力觉数据预训练的前提下，通过后训练把力觉模态注入已经预训练好的 VLA 模型，CoRL 2026 接收并已开源。
- **最反常识的数字**：只需要 **20–30 条在线力觉轨迹**。叠毛巾、插书、汉诺塔三个任务上，表现显著超过纯视觉后训练，汉诺塔任务从 **26.7 提升到 56.7**。
- **怎么做到的**：克隆 action expert 的权重，并偏移因果注意力掩码（shifted causal attention mask），以此保留预训练知识；同时混入无力觉数据防止过拟合。
- **第二个关键数字**：控制回路频率从 **1Hz 提升到 10Hz**——这才是「反应式」这三个字的技术含义。
- **作者主张的适用范围**：该范式适用于任何基于 MoT（Mixture-of-Transformers）架构的预训练模型。
- **本文的读法**：56.7 分的绝对水平、10Hz 与工业力控的量级差、三个任务的共同特征，这三点比「翻了一倍」这个说法更值得看。

### SRC

本文事实来自 AGI HUNT 英文日报 2026-09-28 期收录的条目及子页（URL 见 source_url），原始工作为 LIFT: Late Reactive Injection of Force for VLA Post-Training，作者为上海交通大学 Lu Cewu、Wen Chuan 团队与 QunChu，CoRL 2026 接收（报道称高分接收）并已开源。素材时间窗为「前一日 18:00 → 当日 09:00」：该条目出现在 2026-09-28 期的英文日报中，为窗口内的英文侧首次收录；论文自身的公开时间未在日报中标注，本文不作推断。边界说明：本文未直接访问论文原文或 arXiv 页面，所有数字与结论均转述自该日报子页，**属单一信源 + 二手转述**；26.7→56.7 的具体评测口径（是成功率百分比还是评分、是否同一任务子集）日报未说明，本文按原文表述引用并标注口径不明；20–30 条、1Hz→10Hz、三个任务名称来自同一来源。判断一律以「判断：」开头，事实与判断分开。

### BODY

<div class="sec">
<div class="eyebrow">先别看「翻倍」，先看绝对值</div>
<p>26.7 到 56.7，这个涨幅很容易被读成「翻了一倍多」。但把这两个数放在任务语境里看，得出的结论会完全不同。</p>
<div class="jx-bars">
<div class="jx-bar-row"><div class="jx-bar-lab">纯视觉后训练（汉诺塔）</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:27%"></div></div><div class="jx-bar-val">26.7</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">LIFT 后训练（汉诺塔）</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:57%"></div></div><div class="jx-bar-val">56.7</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">距满分的剩余空间</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:43%"></div></div><div class="jx-bar-val">43.3</div></div>
<div class="jx-legend"><div class="jx-lg">示意图：以 100 为满标度。第三行为示意对比，非论文原始指标。数据口径：AGI HUNT 2026-09-28 期子页，评测口径（百分比成功率或评分）未说明。</div></div>
</div>
<p>56.7 意味着这台机器人在汉诺塔任务上，仍然有超过四成的次数做不成。这是一个「显著改进」的结果，不是一个「可用」的结果。这两件事必须分开讲——论文的价值在于证明了力觉注入这条路能走通且极其便宜，不在于它已经把任务做到了能交付的程度。</p>
<div class="keypoint">判断：读这类论文的第一条纪律是<b>先看绝对水平，再看提升幅度</b>。从 26.7 到 56.7 的相对提升是 112%，听起来比从 90 到 95 的 5.6% 壮观得多，但后者更接近可部署。这条判据在本站多篇研究解读里反复用到，这次再次成立：分布与绝对值，比涨幅更值钱。</div>
</div>

<div class="sec">
<div class="eyebrow">三个任务的共同点，才是这篇论文的真正结论</div>
<p>报道点名的三个任务是叠毛巾（towel folding）、插书（book insertion）、汉诺塔（Hananoi）。这三个任务放在一起，指向性非常明确。</p>
<div class="jx-split">
<div style="flex:50">
<div class="eyebrow">三个任务的共同特征</div>
<p>都是<b>接触密集型</b>操作<br>都要求<b>持续力反馈</b>而非一次性抓取<br>都存在<b>视觉不可见</b>的状态量（布料层叠、书页摩擦、塔块贴合）<br>失败模式多为「位置对了但力不对」</p>
</div>
<div style="flex:50">
<div class="eyebrow">反过来说，不适用的任务</div>
<p>纯位姿搬运：视觉足够，力觉边际收益低<br>大间隙装配：接触少，力信号稀疏<br>高速抓取放置：节拍优先，反应式力控反而拖慢<br>视觉完全可判定的任务：白增一条模态</p>
</div>
</div>
<p>这三个任务的共同点，就是力觉传感器的价值区间：<b>当任务的关键状态量在视觉上不可见、只能通过接触力推断时，力觉才是必需的。</b>叠毛巾时布料叠了几层、插书时书页之间是滑还是卡、汉诺塔时块与块是否真的贴合——这些信息纯视觉模型只能猜。</p>
<div class="keypoint">判断：这篇论文给出的其实是一张<b>力觉传感器的适用任务地图</b>，而不是一个通用提升方案。对做产线选型的团队来说，可以直接照着这份地图问自己：我这个任务的关键状态，视觉能不能看见？看不见就该上力觉，看得见则力觉是成本不是收益。这条判断比「VLA 应该加力觉」这种泛泛结论有用得多。</div>
</div>

<div class="sec">
<div class="eyebrow">1Hz 到 10Hz，才是「反应式」的技术含义</div>
<p>报道里最容易被跳过的数字，是控制回路频率从 1Hz 提升到 10Hz。这个数字比分数更能说明这项工作的性质。</p>
<p>1Hz 是什么概念？机器人每秒只根据力反馈调整一次动作。在这个频率下，系统能做的顶多是「发现太紧了就松一点」这种粗粒度修正，谈不上反应式控制。10Hz 意味着每秒十次修正，这才勉强进入「反应式」的门槛。</p>
<div class="jx-tl">
<div class="jx-tl-row"><div class="jx-tl-t">1 Hz</div><div class="jx-tl-b">原有水平：每秒一次力反馈修正，只能做粗粒度调整</div></div>
<div class="jx-tl-row"><div class="jx-tl-t">10 Hz</div><div class="jx-tl-b">LIFT 后训练后：每秒十次修正，进入反应式力控制的门槛</div></div>
<div class="jx-tl-row"><div class="jx-tl-t">数百至数千 Hz</div><div class="jx-tl-b">传统工业力控的常规区间（本文按公开常识补充，非论文数据）</div></div>
<div class="jx-tl-row"><div class="jx-tl-t">未说明</div><div class="jx-tl-b">10Hz 频控下的稳定性表现、延迟构成、是否受限于推理耗时</div></div>
</div>
<p>把这三个数量级放在一起，事情的边界就清楚了。10Hz 是一个从「几乎没有反应」到「有反应」的跃迁，但它距离传统工业机器人几百到上千赫兹的力控频率，还差一到两个数量级。这意味着 LIFT 目前能覆盖的，是那些<b>对力控带宽要求不高、但对力的存在与否很敏感</b>的任务——恰好就是叠毛巾、插书、汉诺塔这一类。</p>
<div class="keypoint">判断：1Hz→10Hz 这个进步的性质，是「从无到有」而不是「从有到强」。它打开的是一类此前做不了的任务，而不是把已有的任务做得更好。判断一项模态注入技术的价值，应该看它<b>新打开了什么</b>，而不是看它在原任务上提了多少分——这是「分布 > 总分」这条判据的另一个侧面。</div>
</div>

<div class="sec">
<div class="eyebrow">方法上的两个设计，值得工程团队抄</div>
<p>LIFT 的做法里有两个细节，比分数更有迁移价值。</p>
<div class="jx-steps">
<div class="jx-step">
<div class="jx-step-l">设计一</div>
<div class="jx-step-bar"><div class="jx-step-v" style="width:100%"></div></div>
<div class="jx-step-ax"><b>克隆 action expert 权重</b>——不是从头加一个力觉分支，而是复制一份已有的动作专家，让它专门处理带力觉的输入。好处是预训练的能力被完整保留，新分支只学增量。</div>
</div>
<div class="jx-step">
<div class="jx-step-l">设计二</div>
<div class="jx-step-bar"><div class="jx-step-v" style="width:100%"></div></div>
<div class="jx-step-ax"><b>偏移因果注意力掩码</b>——通过调整 causal mask，让新分支能看到力觉信息，同时不破坏原有 token 之间的依赖关系。</div>
</div>
<div class="jx-step">
<div class="jx-step-l">配套一</div>
<div class="jx-step-bar"><div class="jx-step-v" style="width:100%"></div></div>
<div class="jx-step-ax"><b>混入无力觉数据</b>——训练时掺入没有力觉标注的样本，防止模型在只有 20–30 条力觉轨迹的情况下过拟合。</div>
</div>
<div class="jx-step">
<div class="jx-step-l">配套二</div>
<div class="jx-step-bar"><div class="jx-step-v" style="width:100%"></div></div>
<div class="jx-step-ax"><b>无需力觉预训练</b>——这是成本的关键。如果需要从头做一遍带力觉的预训练，采集成本会高到无法承受；后训练注入把这个成本压到了几十条轨迹。</div>
</div>
</div>
<p>这四个设计合起来，构成了一个可复用的范式：<b>不动预训练权重、只加一条模态分支、用极少量新模态数据后训练、用旧数据稀释过拟合风险。</b>作者自己也主张，这套范式适用于任何 MoT 架构的预训练模型。</p>
<div class="keypoint">判断：这套范式对工业界的意义，大于这篇论文本身的分数。因为它把「给机器人增加一种感知模态」的成本，从「重做一遍预训练」降到了「几十条演示」。对做二次开发的团队来说，这意味着客户现场那条产线如果要加一种新传感器，不需要推倒重来——这条路径一旦被更多工作验证，会直接改变具身智能项目的改造成本结构。</div>
</div>

<div class="sec">
<div class="eyebrow">三个还没回答的问题</div>
<p>在把这套方法搬进项目之前，有三个问题是报道没有回答、但必须回答的。</p>
<div class="jx-split">
<div style="flex:50">
<div class="eyebrow">关于数据</div>
<p>20–30 条轨迹是谁采集的？遥操作还是动捕？<br>采集一条要多久？<br>换一个任务，是否还要再来 20–30 条？<br>力觉传感器的型号与安装位置是否影响结果？</p>
</div>
<div style="flex:50">
<div class="eyebrow">关于泛化</div>
<p>56.7 是在同一套硬件上测的吗？<br>换本体之后还成立吗？<br>物体换成不同材质（毛巾厚薄、书本软硬）会掉多少？<br>20–30 条这个数量对任务复杂度的敏感度如何？</p>
</div>
</div>
<p>这三个问题之所以重要，是因为它们决定了「20–30 条」这个诱人的数字能不能被复制到别的场景。如果每条轨迹都要工程师遥操作半小时采集，那么 30 条就是 15 小时人工，这个成本对单点任务是划算的，对多任务铺开未必。</p>
<div class="keypoint">判断：评价一项数据高效方法的真实成本，公式不是「条数 × 采集时长」这么简单，还要加上「换任务是否要重采」。LIFT 报道里只给了条数，没给采集方式与换任务成本，因此「极其便宜」这个结论目前只在论文设定的三个任务内成立。在它开源之后，最值得做的第三方验证是：换一个本体、换一类任务，重跑一遍，看 20–30 条这个数字是否稳定。</div>
</div>

<div class="srcline">来源：AGI HUNT 2026-09-28 期收录条目及子页，https://agihunt.info/en/p/1a0e2796956c6a8cc3d8d5584d4 。素材时间窗：前一日 18:00 → 当日 09:00。</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/lift-force-injection-vla-post-training/*
