成立三个月拿下 RoboDojo 榜首 33.95 分:Simate 把「调参」外包给了 Agent
Simate-beta 以 33.95 分登顶 RoboDojo,超过 Liber-0 Preview(30.74)与 GPT-6-Astra(28.97)——但分维度看,它的开放任务得分不到 GPT-6-Astra 的三分之一,总分第一不等于全面领先。
- 榜单一手核实:RoboDojo-Sim 共 48 个模型上榜(更新至 9 月 23 日),Simate-beta 以 33.95 分(成功率 27.96%) 排名第一,Liber-0 Preview 30.74 第二,Liber-0 Lite 29.24 第三,GPT-6-Astra 28.97 第四。
- 分维度看短板:Simate-beta 长程任务 57.84 居首、记忆 33.33 第一,但开放任务仅 9.12——不到 GPT-6-Astra(34.36)的三分之一;总分第一不等于全面领先。
- 公司口径:Simate(硅基伙伴)成立三个月,创始人张颖出自一线自动驾驶公司(一段式端到端路线核心负责人);累计完成数亿元人民币融资(厂商口径,轮次与投资方未披露)。
- 范式主张:Physical RSI 三阶段路线——当前处于「人机共驾弱 RSI」:人类定目标与约束,AutoResearch 系统跑「假设—实验—验证—迭代」循环,已向清华、北大、MIT 等高校开放内测。
- 与本站 159 号稿差异:9 月 17 日那篇写的是 LiberAI 以 30.74 登顶;本篇是榜首易主后的分维度拆解与 RSI 范式解读,榜单数字全部经本站当日直接核对。
RoboDojo 是一个综合考察泛化、精细操作、长程执行、记忆与开放任务的机器人操作能力评测基准。本站 9 月 17 日报道过 LiberAI 以 30.74 分登顶(159 号稿),当时榜单第二名前后是 GPT-6-Astra。9 月 23 日榜单更新后,格局变成:Simate-beta 33.95 第一,Liber-0 Preview 30.74 第二,Liber-0 Lite 29.24 第三,GPT-6-Astra 28.97 被挤到第四。三个月前还不存在的公司,如今排在 48 个模型的最上面。
把榜首的五个分项摊开,故事比总分复杂。Simate-beta 的长程任务 57.84(成功率 43.42%)、记忆 33.33(33.00%)、泛化 35.09,三项都排榜首;但开放任务只有 9.12(8.50%),而 GPT-6-Astra 这一项是 34.36(31.00%)——几乎是三倍半的差距。反过来,GPT-6-Astra 的精细操作只有 12.65(成功率 4.00%),Simate-beta 是 34.35。两个模型在榜单两端互为镜像。
这说明 RoboDojo 的总分结构偏向「看得见的任务族」:堆叠、装箱、倒水这类有明确成功判定的仿真任务权重占绝对多数,真正开放的指令跟随只占一小格。Simate-beta 在「给 X 个盖子盖上」(100 分)这类任务上拿了满分,在开放任务上几乎不得分——它的第一名,是长程执行与精细操作两项优势叠加出来的,不是全面碾压。
Simate 的核心主张不是某个模型,而是一条研发范式:Physical RSI(物理智能的递归自我改进),对标 Anthropic 披露的「Claude 已主导约 26% 的 AI 研发工作」(截至 2026 年 8 月)。目前处于第一阶段「弱 RSI」:人类研究员提出假设、设定目标与安全约束,AutoResearch 系统的 Agent 自主完成方案改进、代码修改、分布式实验下发、评测调用与多轮迭代;高风险节点交回人类裁决。底座是可插拔的 SiPAI 框架,统一支持世界模型、世界动作模型、VLA 与 VLM 四类架构,数据侧采用基于同构 UMI 的采集体系,按「时序对齐、轨迹质量、任务覆盖、训练配比」四个维度做治理而非单纯堆小时数。
团队构成解释了这套打法的来源:创始人张颖曾任头部自动驾驶公司核心技术负责人(一段式端到端路线),港科大助理教授占方能补世界模型与三维感知,00 后季马泽宇曾是硅谷物理智能公司 ARI(后被 Meta 收购)创始成员,负责人形全身控制的真机验证。公司已完成累计数亿元人民币融资,AutoResearch 平台已向清华、北大、MIT、加州理工等高校师生开放内测——把研发基础设施当产品卖,是比卖模型更早一步的生意。