银河通用替全行业测了一遍 GPT-6 Astra:98% 的零样本成功率,和只准修 5 厘米的纠偏器
GPT-6 Astra 发布不到两周,最先系统测出它具身能力边界的,是一支中国团队。报告里最值钱的不是 98%,而是那条被写死的纠偏边界:单臂修正不超过 5 厘米。
- 评测主体:银河通用团队发布《GPT-6 Astra as an Embodied Policy》报告,第一作者为王鹤教授博士生,是 GPT-6 Astra(9 月 3 日发布)发布后首个系统性具身能力评测。
- 零样本成绩:RoboLab 十个任务、每任务 5 次,Astra 直接控制成功率 98%(49/50),π0.5+Astra 混合 92%,π0.5 单独只有 36%。
- 长程任务反转:RoboDojo 十个双臂任务上,混合架构拿到 62.60 分、48% 成功率,Astra 直接控制反而跌到 26%——语义越复杂、越需要分工。
- 纠偏边界:混合系统里 Astra 只修正 14.4% 的控制步,单臂位置修正不超过 5 厘米、旋转不超过 0.35 rad,修正被刻意限制在短窗口内。
- 硬边界:报告明确承认延迟未解决——仿真里世界会等模型思考,真机上不会。
GPT-6 Astra 发布后,海外开发者陆续放出零散演示:有人给它看人类视频让它复现动作,有人让它规划机械臂任务。但「演示」和「评测」是两回事——演示回答「能不能」,评测回答「边界在哪」。银河通用团队这次做的事,是把一个发布不到两周的通用大模型,放进两套成熟基准里,用严格对齐的闭环控制实验把它的能力边界画了出来。
报告的核心问题是具身圈争了几个月的那道选择题:大模型应该直接当策略(direct),还是站在现有策略旁边做纠偏器(hybrid)?报告用两组数字给出了不对称的答案。
Astra 直接控制:98%(49/50)
π0.5+Astra 混合:92%(46/50)
π0.5 单独:36%
Cosmos3-Nano-Policy:36%
DreamZero:34%
——任务以语义抓放为主,学生策略零样本迁移。
π0.5+Astra 混合:62.60 分 / 48%(24/50)
Galaxea G0.5(公开榜):38.26
Astra 直接控制:37.81 分 / 26%(13/50)
π0.5 单独:约 24/50 中的低位
——混合较直接控制成功率高出 22 个百分点。
分任务看,结论更锋利。语义类任务(按语言分类、模仿排序、排出最大数字)上,π0.5 几乎零分——0.60、1.60、2.29——而混合架构直接拉到 38 到 53 分。这类题难在「想」:要读懂指令里哪个类别进哪个篮子,要记住刚才示范的顺序。一个靠模仿轨迹长大的 VLA 最难学的,恰是 GPT 最擅长的。反过来,接触类任务(搭塔、麻将杠牌)上,GPT 直接上手只有 12 分和 0 分,混合架构 64 和 40 分;柔性物体叠衣服,π0.5 只有 29.12 分,混合架构拿到 100 分。
最能说明工程思路的是一个比例:全部 50 条混合轨迹共执行 42,750 个控制步,其中 Astra 只修正了 14.4%。其余 85.6% 的动作,π0.5 自己做就够了。Astra 的介入方式也被刻意写死:可以继续执行 π0.5 的动作段,可以做 1–5 步的小幅偏移,可以给出短步长末端执行器目标——单臂位置修正不超过 5 厘米、旋转不超过 0.35 rad,每次执行后重新观察再进下一轮。
报告有一处自白容易被热捧淹没:仿真环境里,Astra 可以慢慢想,世界会等它;报告给出的物理时长不包含模型响应延迟,作者自己把延迟列为实时部署未解决的障碍。Humanoids Daily 的核查也提醒,RoboDojo 子集按低 π0.5 成功率任务挑选,结果不能外推为「通用推理已让专用策略过时」。
另外两条边界同样要记录:公开榜单对比是从已发表数据重算的,不是同种子复跑;9 月 9 日的人类视频复现演示、9 月 14–15 日的厨房实验(三次迭代才接近成功,中途橘子汁掉了、托盘穿过夹爪)都仍是「演示」而非可重复试验。