研究解读 · 神机百见-具身解读

理想交出具身智能第一份全家桶:记忆、认知、行动三件套,外加一条第三方泼的冷水

理想 Foundation Model 团队连发四份技术报告,把具身智能系统 ME-Brain-1.0、统一世界动作模型 ME-U0、认知模型 ME-VLM 和触觉方案 ME-Dex-1.0 一次性交齐。指标全面领先的同时,第三方复看视频发现夹爪停顿与偶发抓取失误——这份「全家桶」的成色,要看两拨人的账怎么对。

一分钟速览
  1. 一次交四份作业:理想 Foundation Model 团队发布 ME-Brain-1.0 具身智能系统、ME-U0 统一理解与生成世界动作模型、ME-VLM 认知模型(35B-A3B MoE + 4B 边缘版)与触觉方案 ME-Dex-1.0。
  2. 端侧落地有实数:ME-VLM 4B 在自研马赫 M100 芯片上完成部署优化,预填充时延从约 400ms 降到 188ms(token 压缩 + W4A8 量化)。
  3. 模型指标(厂商口径):ME-U0 从约 4200 小时过滤数据预训练,标准 LIBERO 平均成功率 99.1%、LIBERO-Plus 81.8%、RoboDojo-Sim 过程分 17.66。
  4. 第三方冷水:Robot Forward 等第三方复看演示视频指出,脚本场景成功之外仍存在夹爪停顿、偶发抓取失误、开放任务未完成——指标与观感之间有落差。
  5. 判断:这批发布的真正信号不是跑分,是车企把「车端芯片 + 具身系统」打包成了一条可复用路线。
数据来源与边界
本篇素材时间窗为当日 09:00 → 19:00。理想 ME-Brain-1.0 系列技术报告于 9 月 22 日由理想 Foundation Model 团队发布(机器人前瞻 9 月 22 日 21:14 报道、量子位次日跟进),属窗口外事件;本窗口内的新增量是 9 月 23–24 日海外英文报道扩散(Pandaily 技术拆解)及聚合日报收录,据此按「旧事件 + 窗口内扩散增量」处理。所有模型指标(LIBERO 99.1%、LIBERO-Plus 81.8%、RoboDojo 17.66、4200 小时预训练数据、188ms 时延等)均为理想官方技术博客自报口径,未经第三方实验室复现,文中已逐一标注;第三方观察(夹爪停顿、偶发失误)出自 Robot Forward 相关报道并被 Pandaily 引用,列为独立 caveat。与本站既有稿件的关系:228 号稿(Skild S1 自博弈)讲的是单一技能的强化学习配方,本篇讲的是「系统级大脑栈」,主题相邻但对象与层不同。判断部分为作者观点,与厂商指标严格分开。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
四份报告的分工:先把「大脑」这个词拆干净

理想的具身智能研发在 9 月 22 日集中交卷:ME-Brain-1.0 搭建记忆、认知与行动协作的系统框架;ME-VLM 提供认知核心;ME-U0 把任务理解、未来预测与动作生成放进一个统一模型;ME-Dex-1.0 把触觉纳入预测范围。四份工作不是四个产品,而是同一个系统的四层解剖。

先看最容易被忽视的记忆部分。理想把机器人经历存进独立于模型上下文窗口的外部记忆结构:近期图像、动作与状态进短期记忆;抓取、放置、失败等关键事件进中期记忆;反复出现的成功条件与失败模式沉淀为可跨任务复用的长期经验,且各层记录之间保留关联。演示里那句「把桌面恢复成之前的样子」,靠的就是从记忆中找回物品原位——这类任务没有记忆结构就做不成。

端侧 188ms:车企路线的护城河在芯片

ME-Brain 的记忆、认知、行动三大模块都完成了向理想自研马赫 M100 边缘 SoC 的迁移。官方部署笔记给出实数:ME-VLM 4B 经 token 压缩与 W4A8 量化,M100 上预填充时延从约 400ms 降至 188ms。认知核心提供 35B-A3B MoE 大核与 4B 边缘版两档,官方自测中大核在具身套件平均约 70.9 分、智能体套件 72.5 分。

判断:互联网公司做具身大脑,最终都要回答「跑在谁的芯片上」;理想的优势恰恰是自带车规级边缘芯片与量产产线。长期记忆生成、检索、认知决策全部在本地闭环,意味着不依赖云端算力也能跑——这是把造车的「自研芯片 + 规模量产」方法论直接平移到机器人上,别的玩家短期内补不上这一课。
模型指标与数据配方:4200 小时筛出来的成绩单

ME-U0 从约 5700 小时机器人数据与 3920 小时第一视角数据的原始池中,筛出约 4200 小时用于预训练,架构上采用理解与生成双专家加多速率旋转位置编码,让视觉隐变量与动作 token 在时间轴上对齐。官方指标:标准 LIBERO 平均成功率 99.1%,未经专门适配的 LIBERO-Plus 为 81.8%,RoboDojo-Sim 过程分 17.66(参与对比的世界动作模型中)。

演示侧,理想给出「无剪辑一小时连续抓万物真机测试」:覆盖上百种形状、尺寸、材质,期间切换 23 次灯光与 15 次桌布背景,宣称成功率 100%;另有一个 15 步、约 4 分钟的手冲咖啡长程任务,系统边做边语音与界面同步汇报进度。

LIBERO 标准基准
99.1%
LIBERO-Plus(无适配)
81.8%
抓万物 1 小时(厂商宣称)
100%
全部为理想官方自报口径,截至 2026-09-24 抓取,未经第三方复现
第三方泼的冷水:看视频的人和看跑分的人要坐下来对账

Pandaily 在技术拆解中专门引用了第三方观察:包括 Robot Forward 报道(凤凰科技转载)在内的复看指出,即便在脚本化场景成功的前提下,演示视频中仍可见夹爪明显停顿、偶发抓取失误、部分开放式任务未完成。理想自己的表述也承认「抓起和放下时夹爪停顿明显,流畅性还有提升空间」。

判断:99.1% 的 LIBERO 成功率与「夹爪会停顿」可以同时为真——前者是基准环境里的任务成功率,后者是真实环境里的运动流畅度,两个维度目前还没有统一的评测口径。这正呼应了本站 219 号稿 RoboDawn 的结论:真机与基准之间的落差才是行业的真实水位。理想把 caveat 主动写进技术报告,这一点本身值得肯定。
车企做具身大脑,第二家交出全家桶

在小鹏(212 号稿的供应链大会、IRON 量产推进)之后,理想成为第二家把「系统 + 模型 + 芯片 + 触觉」打包发布的车企。两家路径的共同点是:不单独卖机器人本体,而是把自动驾驶时代攒下的数据管线、模型工程与车规芯片,重组为机器人的基础设施层。

判断:这份全家桶最值得盯的后续指标有两个:一是第三方实验室对 ME-U0 各基准分数的复现结果,二是 M100 之外的硬件适配进度。若两者兑现,机器人「大脑」供应商名单里将多一个自带芯片的车企玩家;具身智能的竞争格局,会从「本体之争」加速转向「大脑栈之争」。
事实源:机器人前瞻(2026-09-22)、量子位、Pandaily 技术拆解(2026-09-23/24 窗口内扩散);全部模型指标为厂商自报口径。判断均为作者观点。