9B 参数、9 项基准 8 项第一:紫东太初把「空间理解」做成了具身智能的开源底座
约 90 亿参数的 ZDTaichu5.0-9B 在九大空间理解基准里拿了 8 项同参数组第一。但真正值得看的是分数分布:三维推演 78.27,跨视角 62.5,具身交互只有 48 和 56——从「看懂空间」到「在空间里行动」,差距被这几个数字量化了。
本篇目录
- 开源了什么:2026 年 9 月 15 日,紫东太初(武汉人工智能研究院体系)开源面向物理世界的通用多模态大模型 ZDTaichu5.0-9B,参数量约 9B(约 90 亿),支持单图、多图、长序列视频与任意分辨率视觉输入。
- 基准成绩:九大国际空间理解基准中拿下 8 项同参数组第一,官方定位为「10B 参数内空间具身能力最强的通用多模态大模型」。
- 分数分布不均:MindCube-tiny 78.27(较 Qwen3.5-9B 高 20.67 个百分点)、ViewSpatial 62.5(Qwen3.5-9B 48.20)、MMSI-Bench 47.2(Qwen3.5-9B 38.7)、ERQA 48、RoboSpatial 56。
- 不止权重:开放整套数据生产管线,覆盖预训练、监督微调、高质量退火、GRPO 可验证奖励强化学习,含哈希—URL 双重去重、画质过滤、Recaption、三维能力标签体系等工艺。
- 判断:「10B 参数内最强」是个精心选择的限定词;真正的价值不是跑分,而是 9B 能装进端侧与机器人计算单元——这是部署约束下的最优解,不是能力上限的突破。
一个 9B 的模型,为什么值得单独看
2026 年 9 月 15 日,紫东太初开源了 ZDTaichu5.0-9B。参数量约 9B(约 90 亿),支持单图、多图、长序列视频与任意分辨率视觉输入,聚焦真实物理场景下的空间感知、跨视角变换与具身任务规划。
先看参数量这个选择。9B 在多模态模型里属于小个子,但这个尺寸有一个明确对应的部署场景:它可以在端侧设备上跑,可以放进工业设备或机器人的计算单元,而不必挂在云端。对做机器人的团队来说,这不是一个「性能差点但便宜」的妥协选项,而是三个硬约束共同决定的结果——延迟、成本、数据隐私。产线上的图像不能上公网,实时控制不能容忍云端往返,这两条直接把大模型方案挡在门外。
推理往返延迟不可控,产线图像出网涉及合规,按调用量计费在高频场景下成本难预测。适合低频、非实时的高层规划,不适合闭环控制。
可装进机器人计算单元或工控机,延迟可控、数据不出厂、成本为一次性硬件投入。代价是能力上限低于大参数模型,需要靠专项训练补。
「任意分辨率视觉输入」这一条也值得单独拎出来。工业现场的相机、无人机、监控视频分辨率千差万别,模型如果只接受固定尺寸输入,落地时就要额外做一整套预处理。支持任意分辨率,等于把这段适配工作从工程侧挪进了模型侧。
8 项第一,但分数分布比「第一」更有信息量
九大国际空间理解基准中,ZDTaichu5.0-9B 拿下 8 项同参数组第一。但把这九个分数排在一起看,分布本身透露的信息比「8 项第一」这个结论多得多。
分布呈现出一个清晰的梯度:三维几何推演类最高(78.27),空间感知类居中(60.96、51.82),跨视角与多图推理偏低(62.5、47.2),而直接面向机器人交互的两项最低(RoboSpatial 56、ERQA 48)。
这个梯度不是随机的。三维几何推演本质上是「看一张或几张图,回答一个几何问题」,输入输出都是静态的;而具身交互类基准要求模型判断「哪里可以放东西、这个操作的前置条件是什么」,输出要能直接用于机器人动作——后者离真实执行更近,难度也更高。
跨视角 62.5 分,意味着什么
ViewSpatial 这个基准测的是跨视角空间一致性——机器人移动位置、或者摄像头机位变化之后,还能不能正确判断物体之间的相对方位。这一项 ZDTaichu5.0-9B 得 62.5,对比 Qwen3.5-9B 的 48.20 和 STEP3-VL-10B 的 46.14,提升幅度约 14 到 16 个百分点,是同参数组里的明显领先。
但 62.5 分绝对水位仍然不高,意味着在跨视角方位判断上,约有接近四成的题目会判错。而这个能力恰恰是移动机器人的核心痛点:机器人走两步之后,如果丢失了空间拓扑,之前建立的任务状态就全部失效。
| 基准 | ZDTaichu5.0-9B | Qwen3.5-9B | STEP3-VL-10B | 差值(对最强基线) |
|---|---|---|---|---|
| MindCube-tiny | 78.27 | 57.60 | 62.81 | +15.46 |
| ViewSpatial | 62.5 | 48.20 | 46.14 | +14.30 |
| MMSI-Bench | 47.2 | 38.70 | 32.18 | +8.50 |
| 3DSRBench | 60.96 | 56.78 | 未披露 | +4.18 |
| SparBench | 51.82 | 50.79 | 45.68 | +1.03 |
再看 SparBench:51.82 对 50.79,只差 1.03 个百分点。这说明在部分空间感知子项上,同参数量级模型之间的差距已经很小——8 项第一里有几项是「险胜」,而不是断层领先。发布方自己也做了区分,明确用「断层领先」描述的只有 MindCube-tiny。
比权重更值钱的,是那套数据生产管线
这次发布里,工程价值最高的一项可能不是模型权重,而是开放的数据生产管线。按发布方描述,这套管线覆盖预训练、监督微调、高质量退火、GRPO 可验证奖励强化学习四个环节,并开放数据接入、哈希—URL 双重去重、画质过滤、Recaption 重描述、样本打包、三维能力标签体系、定向筛选、思维链合成、一致性校验等全部工艺。
为什么这条比权重重要?因为行业当前的真实痛点不是「没有开源模型」,而是「拿到权重不知道怎么用自己的数据继续训」。绝大多数开源模型只释放权重,不释放数据处理工艺,导致企业和研究机构要么从头摸索数据配方,要么直接用公开数据集——后者的结果就是各家模型能力趋同。
设计上有一处值得注意:GRPO 阶段设置了「空间框选坐标命中奖励」,把空间点位输出这类难以用语言描述的任务,转成了可自动校验的奖励信号。这是把空间能力变成可优化目标的工程化做法——对比之下,很多多模态模型在空间任务上只能用「答案对不对」这种粗粒度奖励,学习信号稀疏。
自适应循环推理:一个需要打折看的对标
ZDTaichu5.0-9B 内置了自适应循环推理机制:标准前向得到 Token 输出分布与隐层状态后,通过熵门控计算预测不确定性;确定性 Token 直接输出,遇到空间变换、物体关系判别、操作条件校验等高不确定性节点时,模型在内部循环执行层块计算,迭代优化隐层表征,不调用外部工具。配套三重稳定化设计:阻尼更新、双重停止判据(同时监测 KL 散度与隐状态残差)、轨迹读出与状态回滚。
发布方指出,这一架构与「业界猜测」OpenAI GPT-6 Astra 所采用的 Loop Transformer 具备高度一致的技术前瞻性,均选择将复杂推理过程收敛至模型潜空间内部完成迭代优化。同时发布方也明确说明二者在具体技术实现细节上存在差异。
还有一个边界要说清楚:自适应循环推理解决的是长程任务链条中「单步内部感知推理质量」的提升,完整复杂长程具身任务依然依靠外部任务循环——接收环境新观测、更新全局任务状态。内部循环与外部任务循环是两层架构,后者不在模型能力范围内,需要上层系统实现。
两类已验证场景,和一个未验证的问题
按湖北日报报道,该模型已在北京、佛山、青岛等多地具身智能训练场落地;发布方披露已完成两类端到端场景验证。科研方向:打通仿真数值计算与湿实验实体操作闭环,完成试管按序入架、滴管液体转移等任务。智能制造方向:可根据工单规划跨工位配送、机台上料等任务,也能直接输出设备控制指令。
一个具体的例子能说明模型在工程上的价值:试管按序入架任务要求先放初始画面右侧试管、再放左侧,而抓取和交接会改变物体在画面中的坐标。模型需要持续维护两支试管的实例身份记忆,并在观测到「一支在架内、一支在桌面」时判断任务尚未完成。这类「多样品操作下物体身份不丢失」的能力,是传统视觉方案最容易出错的地方。
未披露的部分恰恰是最关键的。所有已验证场景都是「演示级闭环」——展示了模型能完成任务的完整链路,但没有给出成功率、节拍、连续运行时长这类工程指标。ERQA 48 和 RoboSpatial 56 这两个分数也从侧面说明,具身交互层仍有明显提升空间。