昇腾 960 超节点:华为把 4096 张卡变成一台机器,具身大脑的算力瓶颈跟着换了位置
9 月 17 日华为发布昇腾 960 超节点:单节点 4096 卡、8 EFLOPS FP8、1PB HBM,用 5500 个光引擎替掉 4.8 万颗 800G 光模块。对具身智能真正有影响的不是这些峰值数字,是内存统一编址、PB 级 KV 缓存和 Agent 沙箱启动提速 30 倍这三件事。
- 发布内容:9 月 17 日华为全联接大会 2026 在上海开幕,轮值董事长汪涛发布全球首个采用 NPO(近封装光学)技术的超节点——昇腾 960 超节点。
- 单节点规格:基于「灵衢+Hi-ONE」架构,正交架构与全液冷设计,可扩展至 4096 卡,提供 8 EFLOPS FP8、16 EFLOPS FP4 算力与 1PB HBM 容量。
- 光互联替代:5500 个 Hi-ONE 光引擎替代原本所需的 4.8 万颗 800G 光模块,功耗降低超 550 千瓦,系统无故障运行时间提升一倍,可用度达 99.8%。
- 配套两件:鲲鹏超节点最大 4096 节点互联、形成 256TB 统一内存池,十万级 Agent 沙箱启动较传统服务器提升 30 倍;OceanStor M900 提供 L3.5 层 PB 级 KV 缓存。
- 芯片节奏:昇腾 960DT 提前三个季度、2027 年 Q1 就绪,960PR 2027 年 Q3 就绪,2028、2029 年陆续推出 970、980。
理解昇腾 960 超节点,先要理解它要解决的不是「算力不够」,而是卡多了以后通信吃掉算力。
大模型训练规模上去之后,瓶颈从单卡浮点能力转移到了卡与卡之间的数据搬运。传统的做法是用光模块把服务器连起来,卡数越多、光模块越多、功耗与故障点越多。华为给出的替代方案是 NPO(近封装光学):把光引擎做到靠近芯片封装的位置,缩短电信号的走线距离,用更少的器件完成同样的互联带宽。
具体账是这么算的:一个昇腾 960 超节点用 5500 个 Hi-ONE 光引擎,替代传统方案所需的 4.8 万颗 800G 光模块;结果是功耗降低超 550 千瓦,系统无故障运行时间提升一倍,可用度达 99.8%。这三个数字里,最值得记的不是功耗——是器件数量降到约九分之一。器件数量直接决定故障率和运维复杂度,这是把 4096 张卡当一台机器用的前提条件。
单节点的规格是:基于「灵衢+Hi-ONE」架构,正交架构与全液冷设计,通过灵衢实现内存统一编址,可扩展至 4096 卡规模,提供 8 EFLOPS FP8、16 EFLOPS FP4 算力,1PB HBM 容量。集群层面,多个超节点可通过灵衢网络或 RoCE 连接,采用二层 CLOS 四平面组网,最大集群规模达 51.2 万卡;结合多轨道拓扑技术,最大可支持 100 万卡昇腾超节点集群。
把这套参数翻译成具身智能团队能用的东西,真正相关的有三项,没有一项是浮点峰值。
第一项是内存统一编址。具身大脑的训练数据形态和文本完全不同——一条机器人 episode 是视频、深度、力/位序列、动作标签的多模态长序列,单条数据的体积比一段文本大几个数量级,且经常需要跨卡存放同一条轨迹的不同片段。统一编址意味着跨服务器的内存访问不用走协议转换,这对长序列多模态训练是实打实的效率提升。同一套思路被用到了通用计算侧:鲲鹏超节点最大支持 4096 节点互联,形成 256TB 统一内存池。
第二项是 Agent 沙箱启动提速 30 倍。华为给出的场景是:十万级别沙箱启动相比传统服务器方案提升 30 倍,且沙箱密度还可再提升 25%;在百亿千维的复杂向量检索场景下,检索效率比传统服务器性能实现倍增。这一项直接对应具身智能的仿真训练。仿真是具身智能最主要的数据来源,而大规模并行仿真本质就是海量沙箱的启动、运行与回收——启动开销降一个数量级,等于同样的时间能跑更多轮次的策略迭代。
第三项是 PB 级 KV 缓存。OceanStor M900 基于灵衢 UnifiedBus 总线,定位 L3.5 层,支持「一跳直连」。长上下文推理的显存压力主要来自 KV 缓存,把它外置成 PB 级存储池,影响的是单机能承载的上下文长度与并发数——对需要把整段任务历史、环境记忆塞进上下文的机器人 agent,这是成本项而非性能项。
| 组件 | 发布参数 | 对应的具身场景 |
|---|---|---|
| 昇腾 960 超节点 | 4096 卡、统一编址、1PB HBM | 多模态长序列策略训练 |
| 鲲鹏超节点 | 4096 节点、256TB 内存池、沙箱启动 +30 倍 | 大规模并行仿真与强化学习rollout |
| OceanStor M900 | L3.5 层 PB 级 KV 缓存、一跳直连 | 长上下文机器人 agent 的推理成本 |
汪涛在演讲中披露了昇腾芯片的进度表,这组数字比超节点本身更值得关注。
昇腾 960 芯片研发进度超预期,性能实现倍增。具体到两个版本:960DT 的推出时间比原目标提前三个季度,将在 2027 年第一季度就绪;960PR 提前一个季度,2027 年第三季度就绪。后续节奏是一年一代:2028 年推出昇腾 970,2029 年推出昇腾 980,依托「τ 定律」的创新方向实现算力规格继续翻倍,访存带宽、访存容量、互联带宽大幅提升。存量侧的数字是:昇腾 910C 超节点已部署超 1000 套,昇腾 950 超节点已规模商用。
提前三个季度这件事,在工程上的含义是关键路径上的不确定性被消掉了。芯片流片到量产之间有太多可变因素,能把时间点提前三个季度公布,说明样片阶段的主要验证已经完成。对采购方,这意味着 2027 年的算力采购计划可以按这个时间表排;对竞争对手,这是一条明确的节拍信号。
另一条容易被忽略的是一年一代的承诺。固定的演进节奏比单次的性能突破更重要——它让下游敢做三年期的架构规划。这也是 CANN 计算框架全面开源、进入常态化社区运营的背景:硬件节奏确定之后,软件生态才有积累的意义。
把这次发布和具身智能的实际工程流程放在一起,能看到一个正在发生的位置转移。
两年前,具身智能团队算的账是「训练一个大模型需要多少卡」。现在这道题的答案越来越标准化——模型架构收敛、训练框架成熟、算力供给多元化,训练算力正在变成可采购的商品。真正卡住团队的是另外两件事:一是仿真数据的规模与真实性,二是真机数据的回流与再训练。前者受限于沙箱启动开销和并行度,后者受限于数据管道的吞吐与存储成本。
华为这次发布里,恰好是这两项拿到了明确数字:沙箱启动提升 30 倍、密度提升 25%,以及 PB 级 KV 缓存与全光互联。这不是巧合——超节点这种形态本来就是为「数据与内存密集型」负载设计的,而不是为纯浮点峰值设计的。
对国内具身团队,一条务实建议是:做算力预算时把仿真集群和数据管道单独列项。过去把它们混在「训练算力」一起报,会导致预算被峰值算力吃掉,而真正影响迭代速度的仿真吞吐反而拿不到资源。这次发布的数字提供了一个参照系:如果沙箱启动开销能降一个数量级,同样的卡时预算能跑的策略迭代轮次会显著不同。