研究解读 · 神机百见-具身解读

LIBERO-PRO 92.6%、任务提速 7 倍:RPent 把「通用大模型当大脑」从 demo 变成了基础设施

清华、无问芯穹、正行创新联合开源具身智能体基础设施 RPent:通用大模型做规划、VLA 做执行、记忆沉淀任务卡——一条与端到端 VLA 正面对撞的路线,今天给出了第一份可复现的开源答卷。

一分钟速览
  1. 今日开源:9 月 21 日,清华大学、无问芯穹、正行创新联合开源具身智能体基础设施 RPent,代码在 github.com/RLinf/RPent,由大规模具身强化学习框架 RLinf 的核心团队打造。
  2. 两项指标:LIBERO-PRO 基准测试任务成功率 92.6%,端到端任务完成速度优化 7 倍以上。
  3. 架构核心:通用大模型负责任务理解与规划,VLA 等专家模型负责精细操作,记忆系统把验证过的经验沉淀为可复用的任务卡,框架负责连接模型、工具与真实环境。
  4. 真机行为变化:任务从「放餐具入箱」变成「放干净餐具入纸箱」时,智能体会重新选择放置位置;视觉定位出错会自查重定位;勺子被碗挡住会先移开碗——不是写死的动作序列。
  5. 与 GPT-6 Astra 同框:数字世界的智能体范式正在走进物理世界,RPent 补的是「大模型当大脑」缺少的执行与记忆那一层。
数据来源与边界
本篇素材时间窗为 2026-09-21 当日 09:00 → 19:00,RPent 开源发布于当日。核心事实来自科技日报 9 月 21 日报道(https://www.stdaily.com/web/gdxw/2026-09/21/content_585282.html )、量子位当日报道(腾讯新闻 https://news.qq.com/rain/a/20260921A06P6U00 )与网易转载快讯,三源交叉核实了开源方(清华、无问芯穹、正行创新)、LIBERO-PRO 92.6% 与提速 7 倍两项指标、任务卡机制与真机任务细节;开源地址为 github.com/RLinf/RPent,本站未独立运行代码验证指标,两项数字均为发布方口径。与 Helix 2.5(8%→56%)、宇树 WLA-1.0(64 项操作)、Hydra-0(动作流评测)的对照来自本站 167、182、194 号稿的既有拆解。路线之争的定性分析(判断:标注段落)为作者判断,与发布方事实陈述已切开,92.6% 为仿真基准成绩、不代表真实场景成功率的边界已在正文写明。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
它解决的问题是「大模型能不能直接指挥机器人」

数字世界的智能体已经有成熟配方:大模型理解目标、拆解任务、调用工具、根据执行结果调整计划。把这套配方搬到物理世界会遇到四个新问题——看得见、做得到、反应快、记得住。环境持续变化、状态无法完全观测、动作发生就难撤销,抓取装配插拔等精细操作还需要专门的控制能力。只靠一个端到端 VLA 把感知到动作一次映射完,目前仍难以覆盖长链条任务;只靠大模型规划,又缺能落地的执行层。

RPent 的答案是分层编排:通用大模型负责「想」,VLA、WAM 等专家模型负责「做」,记忆系统负责「记」,框架负责把四者连成「感知—决策—执行—反馈纠错」的闭环。关键设计是任务卡:探索成功的任务逻辑会被沉淀为任务卡供下次复用,直接降低后续执行的延时。这就是「记得住」落到工程上的形态——不是把经验蒸进权重,而是把经验存成可调用的结构。

真机 demo 里最有信息量的三个细节

同步释出的真机演示里,真正值得看的不是任务完成,而是失败恢复与技能重组。其一,任务指令从「将餐具放入纸箱」变化为「将干净餐具放入纸箱」时,冻结的 VLA 会沿用训练时学到的动作把盘子错放进金属篮,而 RPent 会先观察环境、按新目标选择放置位置,发现视觉定位偏差还会检查结果、排除错误目标、重新定位——这是闭环对单次映射的胜利。其二,抓瓶子先小幅试抬确认夹稳,原路径不可行就调整腕部姿态继续;勺子被碗遮挡时不直接抓,先移开碗。其三,把「拿起并放置容器」的技能重组用于倾倒钢珠,把抓取与双臂协同、持续接触组合完成持盘、擦拭和收纳。

三个细节指向同一个判断:具身智能体从「执行学过的动作」走向「理解任务、调用能力、按环境调整行动」,靠的不是更大的模型,而是模型之间的分工与记忆的外置。这也解释了为什么两项数字里「提速 7 倍」比 92.6% 更值得注意——任务卡复用直接砍掉的是每次探索的重复计算。

分层编排路线(RPent)
通用大模型规划 + VLA 执行 + 记忆任务卡复用。新任务靠重组已有技能与在线纠错,经验存为可调用结构,改任务不用重训模型。
端到端 VLA 路线(Helix / WLA 等)
感知到动作一次映射,靠大规模预训练换泛化。Figure Helix 2.5 在 30 个陌生家庭的零样本成功率 8%→56%(本站 167 号稿),宇树 WLA-1.0 用 60 亿参数覆盖 64 项操作(本站 182 号稿)。
两条路线不是二选一

把 RPent 放进近两周的坐标系里看会更清楚:9 月 17 日 Figure 发布 Helix 2.5,赌的是「大规模人类视频预训练 + 端到端」能随数据量单调变强;9 月 20 日 NVIDIA 参与的 Hydra-0 论文(本站 194 号稿)提醒世界模型的评测应该看动作流误差而不是 VLM 打分;9 月 21 日 RPent 开源,给出的是第三条路的工程底座——承认 VLA 是专家执行器,在上面再架一层规划与记忆。三条路线分别押注数据规模、评测标准和系统编排。

对系统集成商和二次开发团队来说,RPent 这类开源基础设施的实际意义可能大于榜单数字:它把「换大脑」变成可组装的工程问题——大模型可以换成国产模型,VLA 可以换成自研策略,记忆层决定机器人是否越用越顺手。LIBERO-PRO 是仿真基准,92.6% 不等于真实家庭或产线的成功率,这一点发布方也没有回避:真机 demo 展示的是开放式任务的行为质量,而非统计意义上的成功率。

判断:RPent 的位置更接近「具身智能体的 LangGraph」——它本身不造更聪明的模型,而是让现有模型各干擅长的事。分层路线的上限取决于记忆系统能否沉淀出真正可迁移的任务卡;如果任务卡只在固定场景复现,它就只是缓存。值得跟踪的验证点:外部团队基于 RPent 复现真机任务的结果,以及任务卡在跨本体场景的复用率。