研究解读 · 神机百见-具身解读

140 年模拟踢球:Skild S1 自博弈配方里,三个限定词比那个数字更值钱

Skild 让 S1 在仿真里和「近期的自己」踢了 140 年球。这个数字很抓人,但公告里真正有信息量的是三个限定词——累计、自博弈阶段、未量化。读懂这三个词,才知道这份成果处在什么位置。

一分钟速览
  1. 140 年的口径:Skild 称 S1 在 NVIDIA Isaac Sim 中累计了超过 140 年的模拟自博弈,对手是「近期版本的自己」。这是累计模拟经验,公告未说明实际训练耗时、算力预算与并行比赛场数。
  2. 每秒 50 次:模型以 50 Hz 输出人形各关节角度;虚拟足球训练场由 NVIDIA Omniverse 库构建。
  3. 「无示范」有前置条件:自博弈阶段以进球为目标、不再提供额外演示;但此前的 drill 阶段(不同速度与方向的带球、踢球)每个动作各有独立奖励,并使用人类参考。
  4. 真机能打:Skild 报告所得策略可在现实中与人类或其他机器人对战,四个 agent 的比赛中出现了早期传球与配合。
  5. 本月初的账本:Skild 报告年度经常性收入(ARR)突破 1 亿美元,距首个商业部署 10 个月。
  6. 公告自设的边界:完整训练与仿真到硬件的迁移方法要等后续发布;公告未建立在商业任务上的改进;传球配合与社会导航的主张未给出量化评测。
数据来源与边界
本文事实来自两源交叉:Humanoids Daily 2026 年 9 月 23 日的一手报道《Skild AI's S1 Learns Soccer Through More Than 140 Years of Simulated Self-Play》(明确标注信息来自 Skild 发布的研究公告与 NVIDIA 的说明),以及 AGI HUNT 2026-09-24 期的同题转述。素材时间窗为前一日 18:00 → 当日 09:00:Humanoids Daily 报道为美东 2026-09-23 发布,AGI HUNT 为 2026-09-24 期,均落在隔夜窗口内。需要明示的边界:① 全部数字来自 Skild 公司自述与 NVIDIA 的补充说明,无第三方独立复现;② 报道明确指出,材料未说明实际训练耗时(elapsed training time)、算力预算与并行比赛数量,「140 年」是累计模拟经验而非墙钟时间;③ 训练与 sim-to-real 迁移的完整方法要等后续发布(still due in a later installment),当前公告不构成完整方法学披露;④ 四个 agent 的传球配合与社会导航的初步结果未提供量化评测;⑤ 公告未建立在商业任务上的改进(does not establish improvements on commercial tasks)。与存量稿件的差异:本站过往研究解读多聚焦世界模型的评测口径与安全基准分布,本篇讲的是后训练阶段的技能获取配方,属不同问题。判断性内容均以「判断:」开头。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
第一个限定词:「累计」

「140 年」是这个消息里最抓人的数字,也是最容易读错的一个。Skild 的表述是:S1 在 NVIDIA Isaac Sim 中累计了超过 140 年的模拟自博弈(accumulated simulated experience),与近期版本的自己对抗。

关键在于,报道明确指出材料没有说明三件事:实际训练耗时、算力预算、并行比赛场数。这三件事恰好是把「140 年」换算成成本所必需的三个参数。

140 年是什么

累计的模拟经验总量。如果并行跑一万场比赛,一年墙钟时间就能堆出一万「年」的经验。它衡量的是样本量,不是训练难度或花费。

140 年不是什么

不是训练跑了 140 年,也不能据此推算电费、卡时或项目周期。缺少并行度与算力口径时,这个数字不可横向比较——不同团队报出的「X 年模拟经验」之间没有共同标尺。

判断:凡遇到「X 年模拟经验」这类表述,第一步都该问并行度。这不是吹毛求疵——自博弈方案的经济性恰恰取决于并行能力:同样堆到 140 年,用一千个并行环境和用一万个,成本差一个数量级,而这直接决定这套方法能不能被预算有限的团队复制。Skild 没有披露这一项,所以这份成果目前证明的是「方法可行」,不是「方法可负担」。
第二个限定词:「自博弈阶段」

不少转述把这条成果概括成「机器人无师自通学会了踢球」,但完整序列不是这样。公告描述的是一个两阶段流程。

阶段一 · Drill
S1 先学带球(不同速度、不同方向)与踢球等基础动作;每个 drill 各有独立奖励函数,并使用人类参考
阶段二 · 自博弈
以进球为唯一目标,与近期版本的自己对战;不再提供额外演示

模型以 50 Hz 的频率输出人形各关节角度,虚拟训练场由 NVIDIA Omniverse 库构建。随着模型变强,对手(也就是它自己的近期版本)也在变强,成功策略会持续遇到更难的考验。

Skild 报告自博弈阶段产出了愈发复杂的行为,而这些涌现出的战术并没有单独的奖励函数——进球这一个信号就够。这个说法成立的范围是自博弈阶段;前置的 drill 训练用的是技能专属奖励加人类参考。

报道对此给了一句很干脆的限定:完整训练序列同时包含 S1 的预训练能力与带人类参考的足球 drill,因此不应被描述为「在没有任何人类指导下学会踢球」。这句话值得所有转述者照抄。

另有一处容易混淆的地方:Skild 于 8 月首次发布 S1 时,演示的是模型根据单段视频提示执行陌生操作任务——那是在推理时给定任务、不更新模型权重。本次则是强化学习提供的额外训练阶段,S1 通过经验打磨与组合已有技能。两者不是同一件事。
为什么是足球:一个会自己变难的考场

Skild 列出的自博弈产出技能包括:过掉防守队员、护球、抢断、以及摔倒后起身。真机方面,报告称所得策略可以与人或另一台机器人在现实中对战,四个 agent 的比赛中出现了早期的传球与配合。

足球被选中不是因为它热门,而是因为它天然构成一个随模型一起变难的考场:站稳、移动到位、控球、应对对手必须同时成立;而对手的存在让训练条件持续变化。这与固定任务的评测集有本质区别——后者的难度是静态的,刷分到一定程度就不再产生新压力。

这个思路有先例。报道提到,Google DeepMind 2024 年发表的研究用强化学习训练小型人形机器人进行一对一足球对抗,包含摔倒恢复与对对手的战术响应,并把策略迁移到了实体机器人上。Skild 这次的差异在于,它把自博弈作为基础模型的后训练策略,而不是从零训练一个足球策略。

过掉防守队员
自博弈产出
护球
自博弈产出
抢断
自博弈产出
摔倒后起身
自博弈产出
四 agent 传球配合
早期现象 · 未量化
条形为本文对「已报告产出」与「未量化主张」的示意区分,非评分;原文未对任何一项给出数值指标。
第三个限定词:「未建立」——1 亿美元 ARR 与这场球赛是两件事

把这条研究放回公司账本上看,会得到一个更有意思的对照。报道提到,本月初 Skild 报告 ARR 突破 1 亿美元,距离其首个商业部署 10 个月。那次发布的侧重点,是从「令人印象深刻的演示」走到「能可靠跟上客户运营节奏的机器人」有多难。

而这一次,Humanoids Daily 给了一句很硬的限定:这份公告并未建立在商业任务上的改进(does not establish improvements on commercial tasks)。

判断:这两句话必须放在一起读,否则很容易得出错误结论。1 亿美元 ARR 说明 Skild 的商业化在跑,足球自博弈说明它的技术路线在推进,但公告自己承认后者尚未转化为商业任务的改进。这不是缺点,是诚实的边界声明——研究预览的价值在于指明路径,不在于交付指标。真正该盯的后续节点有两个:一是「后续发布」里会不会给出训练与迁移的完整方法;二是四 agent 配合与社会导航这类主张,会不会在下一轮拿到量化评测。在这两件事落地之前,这份成果的正确定位是「方法验证」,不是「能力升级」。
对做赛事与表演类机器人的三点含义

第一,自博弈的核心价值是绕开「每个行为都要收一次人类示范」这个瓶颈。对需要大量动作库的场景(赛事对抗、群控表演、复杂地形通过),这条路径的边际成本远低于逐个动作采集。

第二,摔倒后起身、身体对抗后恢复平衡这类能力,恰好是对抗性表演场景最需要的。它们很难靠脚本覆盖,因为摔倒的姿态组合是开放集;自博弈因为训练中必然包含大量失败样本,反而天然擅长这一类。

第三,50 Hz 的关节角度输出频率是一个可对照的工程基准。做同类本体时,这个数字可以直接拿来校验自己的控制回路是否能支撑同等强度的动态对抗。

待核验项:并行环境数量与算力预算;sim-to-real 迁移的完整方法(公告称将在后续发布中给出);四 agent 配合与社会导航的量化评测;真机对战的样本量与成功率定义;S1 在商业任务上是否已有对照数据。以上当前公告均未披露。
来源:Humanoids Daily 2026-09-23;AGI HUNT 2026-09-24 期。全部数字为 Skild 与 NVIDIA 自述,无第三方复现;方法学完整披露待后续发布,抓取日期 2026-09-24。