一小时干净数据抵十七小时:pi0.5 那份两个月消融,把真机微调的杠杆序排出来了
两个月、一个真实制造任务、最终 98%。这份消融最有用的不是那个 98%,是它把四个杠杆按性价比排了序——加数据量排在最后一位,学习率和 batch size 被明确列为「意外地不重要」。
- 实验设定:π0.5 在一个真实制造任务上的微调消融,历时两个月,数据与全部 run 均已公开,最终策略成功率 98%。
- 最弱杠杆是加数据量:单纯把数据增加 5 倍,成功率只从 63% 走到 76%,涨 13 个百分点。
- 同样四小时,换采法差 30 个点:4 小时数据分散到 5 个场景采集,比全部采在评测场景高出约 30 个百分点——数据量没变,只是重新分配。
- 一小时抵十七小时:在已有 21 小时数据基础上,只加 1 小时「更慢、更干净」的数据,成功率 76% → 90%,这一小时的贡献超过此前 17 小时的总和。
- 十二分之一的数据反超 12 个点:1 小时干净数据 + 240 次人工介入 rollout(合计 1.7 小时),从 28% 走到 88%,数据量约为 21 小时模型的十二分之一。
- 不用重训还能再涨一档:调整推理设置,21 小时模型 76% → 93%,21 小时+1 小时模型 90% → 98%。学习率、batch size、相对/绝对关节表示、图像增强四项被明确列为「意外地不重要」。
这份消融的价值不在最终那个 98%,在于它把真机微调时能动的几个旋钮,按「投入产出比」排出了一个明确的顺序。下面这张表按每档提升所需代价重排。
| 杠杆 | 变动 | 成功率变化 | 代价 |
|---|---|---|---|
| 推理设置 | 不重训,调推理参数 | 76%→93%;90%→98% | 最低(无训练成本) |
| 数据质量 | 21h 基础上 +1h 慢而干净 | 76%→90% | 1 小时采集 |
| 场景分布 | 4h 从 1 个场景改采 5 个场景 | 提升约 30 个百分点 | 零(总量不变) |
| 数据规模 | 数据量 ×5 | 63%→76% | 最高(5 倍采集) |
把数据量翻 5 倍,成功率从 63% 到 76%。13 个百分点,方向是对的,但这是四个杠杆里投入最大、产出最小的一个。
这条结论对做真机落地的团队意义很直接:当一条产线上的策略卡在七成上下,第一反应通常是「再多采点数据」。这份消融给出的反证是——同样的时间预算,拿去采一小时高质量数据,或者拿去重新规划采集场景,回报都可能高于闷头加量。
这是整份消融里性价比最高的一条。同样是 4 小时数据,分散到 5 个场景采集,比全部采在评测场景高出约 30 个百分点。
关键在于:采集成本没有增加。总时长还是 4 小时,变的只是这 4 小时花在哪里。这意味着「多场景」不是预算问题,是采集计划问题。
对现场团队的可操作含义是:不要把采集集中在一个工位、一种光照、一种来料状态上。评测场景内采集看起来最「对口」,实际效果最差——因为它把模型训练成了一个只在特定条件下有效的策略。
在 21 小时数据之上加 1 小时,成功率从 76% 抬到 90%,涨 14 个百分点——超过此前 17 小时的总贡献。原文对这一小时的描述是两个词:clean(干净)与slower(更慢)。
还有一条更强的对照:1 小时干净数据加 240 次人工介入 rollout,合计 1.7 小时,成功率从 28% 走到 88%,以约十二分之一的数据量反超 21 小时模型 12 个百分点。这两条合起来指向同一个机制——示范动作的可执行性比示范的数量更关键。
判断:「慢」这个字最容易被忽略,但工程含义最明确。人类操作员按正常工作节奏示范时,动作里包含大量为了效率而做的加速、插行与微操,这些段落在模仿学习里是噪声——策略学不到「为什么快」,只能学到「这段轨迹长这样」。把示范放慢,等于把任务的可执行区间显式暴露给模型。所以「慢」不是采集风格,是一种标注方式。
纯调推理设置,21 小时模型从 76% 到 93%,21 小时+1 小时模型从 90% 到 98%。这一档的成本几乎为零——不需要重新训练,不需要新数据。
更值得注意的是摘要里那句「意外地不重要」(surprisingly unimportant),列了四项:学习率、batch size、相对关节与绝对关节的表示选择、图像增强。
这四项恰好是很多团队调参时最先花时间的地方。把它们往后放,是这份消融最直接的省时价值。