研究解读 · 神机百见-具身解读

一个模型覆盖 64 项任务,但开放是分层的:宇树 WLA-1.0 把「模型与本体解耦」摆上了台面

6B 参数、约 2500 小时真机数据、一个模型覆盖 64 项任务,具身推理底座拿下 7 项开源第一——这份成绩单真正的看点不在分数,而在开放清单分了四层:什么已经给了,什么还在计划里。

本篇目录4 节 · 10 分钟
一分钟速览
  1. 模型概要:宇树新一代通用人形机器人基础模型 UnifoLM-WLA-1.0 为 6B 参数,用约 2500 小时真机采集数据训练,单个模型覆盖 64 项任务(54 项桌面操作 + 10 项全身操作),兼容二指夹爪与 Shadow Dexterous Hand、Allegro Hand 等五指灵巧手。
  2. 推理底座:具身推理模型 UnifoLM-ER-1-4B 基于 Qwen3-VL-4B 构建,使用超 500 万条具身推理样本,在 16 项多模态感知与理解基准中有 7 项取得参评开源模型最佳(RefSpatial-Bench、Where2Place、PixMo-Point、BLINK、EmbSpatial、RoboSpatial、VSR)。
  3. 开放是分层的:目前已上线项目主页并开放部分模型权重与数据;后训练代码、UnifoLM-WLA-Base 权重、全身遥操作数据集、操作数据集仍列在后续开放计划中——「开源」的颗粒度,比「开源了」这三个字重要。
  4. 时间线提示:模型发布日为 9 月 10 日,首批权重 9 月 11 日上线,9 月 20 日前后出现的是中文媒体的集中报道与解读,属旧事件的传播扩散,本文据此按「发布+核查」而非「首发」处理。
  5. 判断:宇树这一周的三次动作(9/7 格斗演示、9/10 开源模型、9/14 发布 G1+)拼出的是一条明确的分工线——本体是硬件生意,模型是生态生意。谁定义模型接口,谁就掌握了下一轮本体厂商的兼容成本。
数据来源与边界
素材时间窗为当日 09:00 → 11:40。需要特别说明时点:UnifoLM-WLA-1.0 的发布日为 2026 年 9 月 10 日,首批权重 9 月 11 日上线,本文所依据的中文报道(京报网、每日经济新闻、千龙网、艾瑞网、网易转载、中电网)均集中在 9 月 20 日凌晨至上午,属发布十天后的集中解读;因此本文不将其作为「当日发布」处理,而是在第二小节明确标注时间线。参数与评测数据(6B/2500 小时/64 项任务/7 项开源第一/Where2Place 82.0、EmbSpatial 88.9)均为宇树科技自报口径,来自公司项目主页说明与媒体转述,未经第三方复现。反面对照数据「GPT-6 Astra 与 Claude Fable 5.1 在把积木放进碗里任务中 20 次成功 19 次与 8 次、拼图插槽任务降至 10%」出自独立第三方机器人基准测试平台 Robocurve,经每日经济新闻 2026-09-20 转述,为单方公布的实测结果,样本量(20 次)较小,本文照录并标注。开放清单的分层信息来自京报网与网易稿件中「已上线项目主页、开放部分模型权重和数据,后训练代码等仍列在后续开放计划」的表述,可在项目主页核验。「一具身体挂价签,一颗脑子挂许可证」为媒体评论语,本文引用其意。判断部分为作者观点。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
先把时间线摆正

这不是一条「今天发布」的新闻

9 月 20 日凌晨到上午,中文媒体密集出现宇树通用人形机器人基础模型的报道:京报网、每日经济新闻、千龙网、艾瑞网、网易先后跟进,标题大多是「7 项评测领先开源模型」「让机器人理解世界」。如果只看标题,会以为这是一次当日发布。

把时间线摊开,实际顺序是:9 月 10 日,宇树发布 UnifoLM-WLA-1.0,同时宣布将开放模型、代码和数据集;9 月 11 日,首批权重上线;9 月 14 日,发布升级后的本体 G1+(颈部增加 2 个自由度,视觉系统升级为双目相机、广角单目相机与 3D 激光雷达,肩部与腰部电机峰值扭矩提升一倍以上、发热量降低约 70%,远场拾音升级为前 4 后 2 六麦克风阵列,含税售价 9.5 万元);再到 9 月 20 日,才出现这轮集中解读。

再往前推,9 月 7 日晚上,宇树放出一段 38 秒演示:一台 G1 站在场地中间,人类拳手出拳时它双拳收到胸前格挡,鞭腿扫来时退后半步稳住并回击,画面标注「全程实拍,无加速」——官方称之为全球首次由世界模型实时驱动的全自主人形机器人格斗,背后是另一套模型 UnifoLM-X2-1.0。

宇树 9 月的一周三发据公开报道整理
9.7
世界模型实时驱动的全自主格斗演示(UnifoLM-X2-1.0)
9.10
发布 UnifoLM-WLA-1.0,宣布开放模型、代码与数据集
9.11
首批模型权重上线
9.14
发布升级本体 G1+,含税售价 9.5 万元(六项升级全部在硬件)
图注:三次动作间隔七天,先证明「脑子能实时决策」,再开源「脑子」,最后更新「身体」。顺序本身是信息。

这个顺序值得留意:先用一场格斗证明模型能实时决策,再把模型开源出去,最后发布硬件本体。模型在前、本体在后,和多数厂商「先卖机器、后补软件」的做法正好相反。

成绩单

7 项开源第一,和那个 82.0 分

按公司口径,WLA-1.0 是 6B 参数,用约 2500 小时高质量真机采集数据训练,覆盖多种机器人本体与作业场景,包含宇树自开源数据与第三方机器人数据。一个模型即可完成 64 项差异化任务:54 项桌面操作(收纳餐盘、电池充电等需要精细操作的场景)与 10 项全身移动操作(垃圾处理、鞋子整理、沙发整理、大空间取放物品)。模型兼容二指夹爪与两类五指灵巧手,支持不同末端执行器切换。

WLA 三个字母对应 World、Language、Action——环境感知、语义理解、空间推理、动态预测与动作生成被放进同一个框架。在技术细节上,两处设计值得记下来:一是用光流提取未来场景变化区域作为监督信号,训练出 UnifoLM-ER-Flow 模型,让机器人先预测环境将如何变化再生成动作;二是把统一动作空间划分为末端执行器位姿、末端执行器关节量、下肢运动关节量三部分,再通过残差矢量量化(RVQ)把连续动作转成离散 token,各部分 token 按共享时间步对齐后送入模型,学习三者的协同关系。

具身推理底座 UnifoLM-ER-1-4B 与 GPT-6 Astra 的空间理解对照宇树自报口径
Where2Place · 宇树
82.0
Where2Place · Astra
69.0
EmbSpatial · 宇树
88.9
EmbSpatial · Astra
83.3
条形长度按分数等比绘制;两组对比均为宇树在官方口径中引用的成绩,未经第三方复现
图注:空间理解对机器人比对话能力更关键——物体在哪、怎么摆、下一步会发生什么,决定了动作是否做得对。

但同一批材料里还有一组反面对照。每日经济新闻报道引用独立第三方机器人基准测试平台 Robocurve 的实测:把「把积木放进碗里」分别下达给部署在真实机械臂上的 GPT-6 Astra 与 Claude Fable 5.1,20 次测试中成功 19 次与 8 次,对应成功率 95% 与 40%;任务细化为「把拼图块插入对应的凹槽」后,Astra 的成功率滑落至 10%。

这组数字的意义在于划出一条界线:顶尖大模型已经能操控物理设备,但在精细操作层面仍有明显短板,而且任务越精细,衰减越陡。它同时提醒所有看榜单的人——「理解能力」的分数和「动作成功率」之间存在真实的落差,而后者才是采购方验收的东西。当然,20 次的样本量本身也偏小,这个数字应作为信号而非结论。

真正的信息量在开放清单

「开源了」这三个字,要看它分了几层

比参数更值得逐个核对的是开放状态。按公开表述:目前宇树已上线 UnifoLM-WLA-1.0 项目主页,并开放**部分**模型权重和数据;**后训练代码、UnifoLM-WLA-Base 权重、全身遥操作数据集、操作数据集**仍列在后续开放计划中。

这意味着「宇树开源了人形基础模型」这个说法需要加限定词。已经拿到手的是部分权重和部分数据,后训练代码和两个关键数据集还在路上。对真正想复现或二次开发的研究团队来说,后训练代码往往比推理权重更重要——权重决定你能跑什么,后训练代码决定你能改什么。

开放颗粒度分层据项目主页与媒体报道
层级内容当前状态
已开放部分模型权重、部分数据、项目主页可下载/可查看
计划中后训练代码待开放
计划中UnifoLM-WLA-Base 权重待开放
计划中全身遥操作数据集待开放
计划中操作数据集待开放
表注:开放状态截至 2026-09-20 的公开表述,实际进度以官方项目主页为准。

把这一条和「本体售价 9.5 万元」放在一起看,宇树的分工线就清楚了:身体是硬件生意,一次性卖出;模型是生态生意,越多人用它的接口、越多硬件适配它的输出,它在本体之外的话语权就越重。这不是宇树独有的算盘——NVIDIA 用 GR00T、Google 用 Gemini Robotics、Figure 用 Helix,走的都是同一条路。差别在于国内厂商里,宇树是少数同时握着本体产线和基础模型的一方。

判断:这类开源的真实价值不在「免费」,而在于它定义了接口。当越来越多团队在 WLA 的输出格式上做二次开发、越来越多本体的末端执行器按它的动作空间对齐时,切换模型的成本会上升,而模型厂商获得的是行业事实标准的位置。所以评价这份开源,不该问「省了多少钱」,该问「后训练代码什么时候到」——那才是能否真正站上同一地基的分水岭。
该追问的三件事

榜单之外,三处口径需要补上

第一,2500 小时真机数据的本体分布。64 项任务的训练数据「覆盖多种机器人本体」,但各家本体的观测空间、动作空间和末端执行器都不一样,跨本体迁移的效果取决于数据如何配比。目前公开信息没有给出按本体的数据分布表。第二,64 项任务的评测条件。任务成功率是在固定初始位姿、固定光照、固定物体集下测的,还是随机化之后测的,这两个数字的含义完全不同——YCB 式的标准物体和「任意家庭杂物」之间的距离,正是行业里最难补的一段。

第三,也是最容易被忽略的:64 项任务里,54 项桌面操作与 10 项全身操作的难度不在一个量级。桌面操作考的是精细控制,全身操作考的是移动与操作并行时的平衡协调。把它们合并成「64 项」这类汇总数字,读的时候要分开看,否则容易系统性高估全身移动操作的能力成熟度。

顺便说一句判断口径:凡厂商同时给了「现状表」和「任务表」的,优先看任务表。WLA 这类基础模型的出现,把「一个模型干多件事」从演示变成了工程目标,但从演示到验收,中间隔着的是长尾任务的成功率和故障恢复时间,这两项从来不上榜。

来源:京报网 2026-09-20(news.bjd.com.cn/2026/09/20/11965915.shtml);每日经济新闻 2026-09-20(cn.dailyeconomic.com/2026/09/20/156880.html);千龙网 2026-09-20(china.qianlong.com/2026/0920/8729826.shtml);中电网 2026-09-20 09:29(news.eccn.com/news_2026092009295344.htm);艾瑞网 2026-09-20(news.iresearch.cn/yx/2026/09/566806.shtml);网易转载 IT 时代网 2026-09-20 03:22。素材时间窗:当日 09:00 → 11:40(模型发布日为 9 月 10 日,已在正文说明)。