# 9B 参数、9 项基准 8 项第一：紫东太初把「空间理解」做成了具身智能的开源底座

> 约 90 亿参数的 ZDTaichu5.0-9B 在九大空间理解基准里拿了 8 项同参数组第一。但真正值得看的是分数分布：三维推演 78.27，跨视角 62.5，具身交互只有 48 和 56——从「看懂空间」到「在空间里行动」，差距被这几个数字量化了。

### TLDR

- **开源了什么**：2026 年 9 月 15 日，紫东太初（武汉人工智能研究院体系）开源面向物理世界的通用多模态大模型 **ZDTaichu5.0-9B**，参数量约 **9B**（约 90 亿），支持单图、多图、长序列视频与任意分辨率视觉输入。
- **基准成绩**：九大国际空间理解基准中拿下 **8 项**同参数组第一，官方定位为「**10B 参数内**空间具身能力最强的通用多模态大模型」。
- **分数分布不均**：MindCube-tiny **78.27**（较 Qwen3.5-9B 高 20.67 个百分点）、ViewSpatial **62.5**（Qwen3.5-9B 48.20）、MMSI-Bench **47.2**（Qwen3.5-9B 38.7）、ERQA **48**、RoboSpatial **56**。
- **不止权重**：开放整套数据生产管线，覆盖预训练、监督微调、高质量退火、GRPO 可验证奖励强化学习，含哈希—URL 双重去重、画质过滤、Recaption、三维能力标签体系等工艺。
- **判断：「10B 参数内最强」是个精心选择的限定词**；真正的价值不是跑分，而是 9B 能装进端侧与机器人计算单元——这是**部署约束下的最优解**，不是能力上限的突破。

### SRC

本文事实以紫东太初 / 武汉人工智能研究院 2026 年 9 月 15 日开源发布为主源，经湖北日报 2026-09-15 报道（<strong>https://news.hubeidaily.net/pc/c_5977379.html</strong>）、第一财经报道（东方财富网 2026-09-15 转载，finance.eastmoney.com/a/202609153874673433.html）与自媒体解读（今日头条 2026-09-16 06:53）转述。核心数字（9B 参数、8/9 项同参数组第一、MindCube-tiny 78.27、ViewSpatial 62.5、MMSI-Bench 47.2、3DSRBench 60.96、SparBench 51.82、ERQA 48、RoboSpatial 56，以及 AI2D 91.48、WeMath 75.9、MathVista Mini 84.5、OCRBench 85.5、IFEval 93.7、AIME2026 89.2、LiveCodeBench v6 73.4）**均出自发布方口径**，各转述源数字一致，但本文未独立复现评测，属**单一信源（官方口径）**。对比基线 Qwen3.5-9B、STEP3-VL-10B、gemma4-8B-E4B 的分数亦为发布方提供的横向评测结果。关于自适应循环推理与 GPT-6 Astra 的 Loop Transformer 路线对齐，发布方原文使用的措辞是「业界猜测」，本文据此不作技术路线确证。模型已在北京、佛山、青岛等地具身智能训练场落地（湖北日报口径），具体落地形式与合作深度未披露。**素材时间窗为 2026-09-15 18:00 → 2026-09-16 09:00**：模型开源与首批报道发生于 9 月 15 日（部分在窗口内、具体时刻未标注），窗口内新增量为 9 月 16 日 06:53 起的自媒体深度解读与二次传播，本稿按扩窗规则第 1 条收录。本站 09-15 曾写具脑磐石 Cog-WM 1.0（世界模型 SR 与 SPL 背离），本稿对象为多模态空间理解基座，非世界模型，无同事件重复。所有判断均已用「判断：」标注。

### BODY

<div class="sec">
<div class="eyebrow">定位</div>
<h2>一个 9B 的模型，为什么值得单独看</h2>
<p>2026 年 9 月 15 日，紫东太初开源了 ZDTaichu5.0-9B。参数量约 9B（约 90 亿），支持单图、多图、长序列视频与任意分辨率视觉输入，聚焦真实物理场景下的空间感知、跨视角变换与具身任务规划。</p>
<p>先看参数量这个选择。9B 在多模态模型里属于小个子，但这个尺寸有一个明确对应的部署场景：它可以在端侧设备上跑，可以放进工业设备或机器人的计算单元，而不必挂在云端。对做机器人的团队来说，这不是一个「性能差点但便宜」的妥协选项，而是三个硬约束共同决定的结果——延迟、成本、数据隐私。产线上的图像不能上公网，实时控制不能容忍云端往返，这两条直接把大模型方案挡在门外。</p>
<div class="jx-cols">
<div style="flex:44">
<div class="eyebrow">云端大模型的约束</div>
<p>推理往返延迟不可控，产线图像出网涉及合规，按调用量计费在高频场景下成本难预测。适合低频、非实时的高层规划，不适合闭环控制。</p>
</div>
<div style="flex:44">
<div class="eyebrow">9B 端侧部署的可能</div>
<p>可装进机器人计算单元或工控机，延迟可控、数据不出厂、成本为一次性硬件投入。代价是能力上限低于大参数模型，需要靠专项训练补。</p>
</div>
</div>
<p>「任意分辨率视觉输入」这一条也值得单独拎出来。工业现场的相机、无人机、监控视频分辨率千差万别，模型如果只接受固定尺寸输入，落地时就要额外做一整套预处理。支持任意分辨率，等于把这段适配工作从工程侧挪进了模型侧。</p>
<div class="keypoint"><strong>判断：</strong>官方口径里的「10B 参数内空间具身能力最强」是一个精心选择的限定词——它同时承认了「放到更大参数量级就不成立」。判断：这类限定的价值在于诚实，也在于提醒读者：这个模型的定位不是能力竞赛的冠军，而是**部署约束下的最优解**。评价它该用的尺子是「在这个算力预算下能不能用」，不是「有没有超过最强的闭源模型」。</div>
</div>

<div class="sec">
<div class="eyebrow">分数</div>
<h2>8 项第一，但分数分布比「第一」更有信息量</h2>
<p>九大国际空间理解基准中，ZDTaichu5.0-9B 拿下 8 项同参数组第一。但把这九个分数排在一起看，分布本身透露的信息比「8 项第一」这个结论多得多。</p>
<div class="jx-bars">
<div class="jx-bar-row"><div class="jx-bar-lab">MindCube-tiny（复杂三维推演）</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:78%;background:#0a749a"></div></div><div class="jx-bar-val">78.27</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">3DSRBench（空间感知）</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:61%;background:#00a6d6"></div></div><div class="jx-bar-val">60.96</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">ViewSpatial（跨视角）</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:63%;background:#0d8a5f"></div></div><div class="jx-bar-val">62.5</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">RoboSpatial（具身交互）</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:56%;background:#2563eb"></div></div><div class="jx-bar-val">56</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">SparBench（空间感知）</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:52%;background:#6d3fd4"></div></div><div class="jx-bar-val">51.82</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">MMSI-Bench</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:47%;background:#b85c0a"></div></div><div class="jx-bar-val">47.2</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">ERQA（具身推理）</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:48%;background:#4b5f8a"></div></div><div class="jx-bar-val">48</div></div>
</div>
<div class="jx-legend"><div class="jx-lg">九大空间理解基准得分（发布方口径，未独立复现）。蓝色系为空间感知/推理类，红橙为具身交互类。</div></div>
<p>分布呈现出一个清晰的梯度：三维几何推演类最高（78.27），空间感知类居中（60.96、51.82），跨视角与多图推理偏低（62.5、47.2），而直接面向机器人交互的两项最低（RoboSpatial 56、ERQA 48）。</p>
<p>这个梯度不是随机的。三维几何推演本质上是「看一张或几张图，回答一个几何问题」，输入输出都是静态的；而具身交互类基准要求模型判断「哪里可以放东西、这个操作的前置条件是什么」，输出要能直接用于机器人动作——后者离真实执行更近，难度也更高。</p>
<div class="keypoint"><strong>判断：</strong>从 78.27 到 48，这条下降曲线就是「看懂空间」到「能在空间里行动」之间那道 gap 的量化形态。判断：机器人需要的恰恰是分数最低的那两项能力——判断可放置区域、识别操作前置条件。这说明当前空间理解模型的提升主要发生在感知与推理层，尚未充分传导到行动层。判断：对做机器人应用的团队，看 ERQA 和 RoboSpatial 这两项比看总分更能预测实际表现。</div>
</div>

<div class="sec">
<div class="eyebrow">对照</div>
<h2>跨视角 62.5 分，意味着什么</h2>
<p>ViewSpatial 这个基准测的是跨视角空间一致性——机器人移动位置、或者摄像头机位变化之后，还能不能正确判断物体之间的相对方位。这一项 ZDTaichu5.0-9B 得 62.5，对比 Qwen3.5-9B 的 48.20 和 STEP3-VL-10B 的 46.14，提升幅度约 14 到 16 个百分点，是同参数组里的明显领先。</p>
<p>但 62.5 分绝对水位仍然不高，意味着在跨视角方位判断上，约有接近四成的题目会判错。而这个能力恰恰是移动机器人的核心痛点：机器人走两步之后，如果丢失了空间拓扑，之前建立的任务状态就全部失效。</p>
<div class="tbl-wrap">
<table>
<thead><tr><th>基准</th><th>ZDTaichu5.0-9B</th><th>Qwen3.5-9B</th><th>STEP3-VL-10B</th><th>差值（对最强基线）</th></tr></thead>
<tbody>
<tr><td>MindCube-tiny</td><td>78.27</td><td>57.60</td><td>62.81</td><td>+15.46</td></tr>
<tr><td>ViewSpatial</td><td>62.5</td><td>48.20</td><td>46.14</td><td>+14.30</td></tr>
<tr><td>MMSI-Bench</td><td>47.2</td><td>38.70</td><td>32.18</td><td>+8.50</td></tr>
<tr><td>3DSRBench</td><td>60.96</td><td>56.78</td><td>未披露</td><td>+4.18</td></tr>
<tr><td>SparBench</td><td>51.82</td><td>50.79</td><td>45.68</td><td>+1.03</td></tr>
</tbody>
</table>
</div>
<div class="cap">表：与同参数量级开源模型的横向对比（发布方提供的评测结果，本文未独立复现）。Qwen3.5-9B 在 MindCube-tiny 与 3DSRBench 的数值为按发布方给出的差值反推，原文未直接列出绝对值。</div>
<p>再看 SparBench：51.82 对 50.79，只差 1.03 个百分点。这说明在部分空间感知子项上，同参数量级模型之间的差距已经很小——8 项第一里有几项是「险胜」，而不是断层领先。发布方自己也做了区分，明确用「断层领先」描述的只有 MindCube-tiny。</p>
<div class="keypoint"><strong>判断：</strong>「9 项 8 项第一」和「断层领先」是两个不同的说法，读的时候要分开。判断：从差值看，MindCube-tiny（+15.46）和 ViewSpatial（+14.30）是真正的领先项，SparBench（+1.03）和 3DSRBench（+4.18）更接近并列。判断：把八项第一平铺成一句宣传语，会掩盖「哪些能力真的领先、哪些只是打平」这个关键区分。</div>
</div>

<div class="sec">
<div class="eyebrow">工艺</div>
<h2>比权重更值钱的，是那套数据生产管线</h2>
<p>这次发布里，工程价值最高的一项可能不是模型权重，而是开放的数据生产管线。按发布方描述，这套管线覆盖预训练、监督微调、高质量退火、GRPO 可验证奖励强化学习四个环节，并开放数据接入、哈希—URL 双重去重、画质过滤、Recaption 重描述、样本打包、三维能力标签体系、定向筛选、思维链合成、一致性校验等全部工艺。</p>
<p>为什么这条比权重重要？因为行业当前的真实痛点不是「没有开源模型」，而是「拿到权重不知道怎么用自己的数据继续训」。绝大多数开源模型只释放权重，不释放数据处理工艺，导致企业和研究机构要么从头摸索数据配方，要么直接用公开数据集——后者的结果就是各家模型能力趋同。</p>
<div class="jx-steps">
<div class="jx-step">
<div class="jx-step-l">预训练</div>
<div class="jx-step-bar"><div class="jx-step-v" style="width:90%;background:#0a749a"></div></div>
<div class="jx-step-ax">开源图文 / 结构化文档 / 多视角视频 / 仿真三维场景</div>
</div>
<div class="jx-step">
<div class="jx-step-l">监督微调</div>
<div class="jx-step-bar"><div class="jx-step-v" style="width:75%;background:#00a6d6"></div></div>
<div class="jx-step-ax">任务轨迹样本 · 具身样本强制一致性校验</div>
</div>
<div class="jx-step">
<div class="jx-step-l">高质量退火</div>
<div class="jx-step-bar"><div class="jx-step-v" style="width:60%;background:#0d8a5f"></div></div>
<div class="jx-step-ax">能力域—难度—质量三维标签 · 长推理样本</div>
</div>
<div class="jx-step">
<div class="jx-step-l">GRPO 强化学习</div>
<div class="jx-step-bar"><div class="jx-step-v" style="width:45%;background:#6d3fd4"></div></div>
<div class="jx-step-ax">答案正确性 / 空间框选命中 / 格式合规三类可校验奖励</div>
</div>
</div>
<p>设计上有一处值得注意：GRPO 阶段设置了「空间框选坐标命中奖励」，把空间点位输出这类难以用语言描述的任务，转成了可自动校验的奖励信号。这是把空间能力变成可优化目标的工程化做法——对比之下，很多多模态模型在空间任务上只能用「答案对不对」这种粗粒度奖励，学习信号稀疏。</p>
<div class="keypoint"><strong>判断：</strong>开放数据工艺这件事的商业含义是：发布方让出的是方法论，留住的是工程经验。判断：外部团队即便拿到完整管线，也要用自有数据跑一遍才能复现效果，而这一遍的成本（算力、时间、试错）正是发布方已经支付过的。判断：对做垂直场景的团队，务实的用法不是照抄配方，而是借用「三维能力标签体系 + 可校验奖励」这套框架，把自有数据标定成可训练的目标。</div>
</div>

<div class="sec">
<div class="eyebrow">架构</div>
<h2>自适应循环推理：一个需要打折看的对标</h2>
<p>ZDTaichu5.0-9B 内置了自适应循环推理机制：标准前向得到 Token 输出分布与隐层状态后，通过熵门控计算预测不确定性；确定性 Token 直接输出，遇到空间变换、物体关系判别、操作条件校验等高不确定性节点时，模型在内部循环执行层块计算，迭代优化隐层表征，不调用外部工具。配套三重稳定化设计：阻尼更新、双重停止判据（同时监测 KL 散度与隐状态残差）、轨迹读出与状态回滚。</p>
<p>发布方指出，这一架构与「业界猜测」OpenAI GPT-6 Astra 所采用的 Loop Transformer 具备高度一致的技术前瞻性，均选择将复杂推理过程收敛至模型潜空间内部完成迭代优化。同时发布方也明确说明二者在具体技术实现细节上存在差异。</p>
<div class="keypoint"><strong>判断：</strong>这个对标必须打折看——发布方自己用的措辞是「业界猜测」，也就是说 GPT-6 Astra 的架构并未公开确认。判断：把未公开的竞品架构当作自己技术路线的背书，是常见的叙事手法，但不应作为技术判断的依据。判断：真正可以评价的是这套机制的设计本身——「不确定性高的地方多算几轮」这个思路在推理成本可控的前提下是合理的，代价是推理时延变得不均匀，对实时控制场景需要额外设计超时兜底。</div>
<p>还有一个边界要说清楚：自适应循环推理解决的是长程任务链条中「单步内部感知推理质量」的提升，完整复杂长程具身任务依然依靠外部任务循环——接收环境新观测、更新全局任务状态。内部循环与外部任务循环是两层架构，后者不在模型能力范围内，需要上层系统实现。</p>
<div class="keypoint"><strong>判断：</strong>把「内部循环」讲成能解决长程任务是一种常见的误解。判断：模型维护的是当前步的表征质量，任务状态的跨步维护（刀具身份延续、抽屉是否已打开、物体是否已放入）需要外部系统显式管理。判断：对工程落地来说，这意味着即便模型能力再强，上层任务管理框架仍是必选项——这一层不会因为换了个更强的模型而消失。</div>
</div>

<div class="sec">
<div class="eyebrow">落地</div>
<h2>两类已验证场景，和一个未验证的问题</h2>
<p>按湖北日报报道，该模型已在北京、佛山、青岛等多地具身智能训练场落地；发布方披露已完成两类端到端场景验证。科研方向：打通仿真数值计算与湿实验实体操作闭环，完成试管按序入架、滴管液体转移等任务。智能制造方向：可根据工单规划跨工位配送、机台上料等任务，也能直接输出设备控制指令。</p>
<p>一个具体的例子能说明模型在工程上的价值：试管按序入架任务要求先放初始画面右侧试管、再放左侧，而抓取和交接会改变物体在画面中的坐标。模型需要持续维护两支试管的实例身份记忆，并在观测到「一支在架内、一支在桌面」时判断任务尚未完成。这类「多样品操作下物体身份不丢失」的能力，是传统视觉方案最容易出错的地方。</p>
<div class="jx-tl">
<div class="jx-tl-row"><div class="jx-tl-t">科研自动化</div><div class="jx-tl-b">仿真计算到湿实验闭环：试管按序入架、滴管液体转移，核心是实例身份持久跟踪</div></div>
<div class="jx-tl-row"><div class="jx-tl-t">智能制造</div><div class="jx-tl-b">工单文本到车间现场：跨工位配送、机台上料，核心是遮挡与相似件判别</div></div>
<div class="jx-tl-row"><div class="jx-tl-t">未披露</div><div class="jx-tl-b">长程任务的端到端成功率、连续运行时长、真实产线节拍下的表现</div></div>
</div>
<p>未披露的部分恰恰是最关键的。所有已验证场景都是「演示级闭环」——展示了模型能完成任务的完整链路，但没有给出成功率、节拍、连续运行时长这类工程指标。ERQA 48 和 RoboSpatial 56 这两个分数也从侧面说明，具身交互层仍有明显提升空间。</p>
<div class="keypoint"><strong>判断：</strong>对观望的团队，最务实的做法是把它当「高层规划大脑」而不是「端到端控制器」——发布方自己的定位也是如此：模型负责理解语义、识别环境、维护对象身份、拆解操作步骤，底层运动控制与设备安全逻辑由机器人或自动化硬件控制系统负责。判断：这个分工是对的，也说明当前阶段的空间理解模型离「接管机器人」还很远；把它放在规划层，是当前能力边界内的正确用法。</div>
</div>

<div class="srcline">信源：紫东太初 / 武汉人工智能研究院 2026-09-15 开源发布，湖北日报 2026-09-15（news.hubeidaily.net/pc/c_5977379.html）、第一财经（东方财富网 2026-09-15 转载，finance.eastmoney.com/a/202609153874673433.html）、自媒体解读 2026-09-16 06:53。全部基准分数出自发布方口径，本文未独立复现评测，属单一信源。GPT-6 Astra 架构对标为发布方所称「业界猜测」，未获确认。长程任务成功率、连续运行时长等工程指标未披露。素材时间窗 2026-09-15 18:00 → 2026-09-16 09:00，按扩窗规则第 1 条收录，窗口内新增量为 9 月 16 日 06:53 起的深度解读与二次传播。核查时间 2026-09-16。</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/zdtaichu-9b-spatial-embodied-open-weights/*
