一个模型做到十万亿参数,麻烦就不只在模型本身了。
卡的数量是一回事,卡与卡之间怎么说话是另一回事。传统服务器堆到几千张,性能曲线就会往下拐。
业内给这个拐点起了两个名字。一个叫存储墙,一个叫通信墙。两个都硬。
从能聊到能干,AI 开始钻进各行各业的流程里。跑得最快的是 AI编程,写代码这件事的生产力被直接抬了一档。
需求随之而来。既要撑住更大的模型训练,又要在推理端接住更长的上下文。时延和成本还得一起压下去。
如今跑在机房里的大批 AI工具,早就不是几年前那批只会聊天的框了。
超节点就是冲着前面那两堵墙来的。思路说穿了不复杂,把大量加速卡紧耦合,让它们像一台机器一样协同。
方向定了好几年,真正量产落地的没几家。难点在落地。
2026 年 9 月,华为在全联接大会上把昇腾 950 超节点推上市。官方说法是,这是目前业界规模最大的商用超节点。

▲华为全联接大会 2026 昇腾展区
这台机器不是第一次露面。今年 WAIC 上它就亮过真机,当时围了一圈人。
华为昇腾计算产品线总裁张迪煊在演讲里给了一个说法。大模型每一波迭代都会带来新需求,超节点要做的,是用确定的架构去接住这些不确定。
按他的描述,确定的那部分是三样东西:大带宽,低时延,还有统一编址的内存。

▲华为昇腾计算产品线总裁张迪煊
一台机器,一千零二十四颗芯片
上市的昇腾 950 超节点有两个形态。液冷的叫 Atlas 950 SuperPoD,风冷的叫 Atlas 850E。
先把液冷那台拆开看。
1024 颗高性能 NPU。1300 多个灵衢互联套片。4000 多个光模块。还有 19 万根线缆托盘。量级很吓人。
这些数字堆在一起,指向同一个目标。让一千张卡像一台超级计算机那样干活。

▲昇腾 950 超节点 Atlas 950 SuperPoD
难点在协同。芯片一多,通信开销就会吃掉大量算力。
昇腾在芯片和互联两个层面各做了一件事。先说芯片这一侧。
重点是让算子好写。过去开发者得手动管数据搬运,还有格式转换,通信同步和缓存策略。现在这些活都下沉到硬件里。
代码好写了,效率自然上来。
互联这一侧靠的是灵衢。统一的互联协议把 1024 张卡的内存编址统起来。跨卡的远程内存访问,操作起来跟访问本地内存差不多。芯片互联带宽比上一代提升 2.1 倍。
带宽上去了,超大模型那种高频通信才撑得住。这是地基。
工程化这一段还有几个不显眼但费劲的细节。一个一个看。
电源上,昇腾自研的 TPSU 电源模块自带储能能力。它用来扛训练推理业务的供电波峰。
散热上,单颗昇腾 950 NPU 模组功耗 950 瓦。昇腾用高密铲齿加冰川铠甲冷板,再叠多水路串联。一块冷板能带走 2000 瓦的热量。
结构上用了正交架构,柜内做到零线缆全电互联。单柜少掉 6000 多根线缆,一个 1024 超节点能省下 50 千米铜线。线缆少了,老化与故障的风险也跟着降。
柜间光互联用了液冷光模块。一个超节点有 4000 多个光模块。它们省下来的电,相当于数千户家庭一年的用电量。
光模块还有一个行业老毛病,容易闪断。昇腾用链路级重传加 2+2 光模块保护来兜底。毛病治住了。
落到实际的训推场景,训练侧效率提升 1.5 到 1.7 倍。万卡集群能做到月级稳定训练。
推理侧性能提升 2 到 3 倍,时延低于 10 毫秒。账很直观。
风冷机房不用改造,直接上架
液冷那台面向的是液冷数据中心。风冷这台瞄的是另一批客户。
大量企业的通用机房还是风冷。要改成液冷,周期长,成本高。这道门槛把很多想上超节点的公司挡在了门外。
Atlas 850E 的办法是相变散热。标准风冷机柜直接上架,不用动基建,规模从 32 卡一直支持到 768 卡。

▲Atlas 850E 风冷超节点
推理场景里,它原生覆盖全量低精格式。FP8、mxFP8 都在支持清单里。HiF8 和 INT8 同样在列。mxFP4 也没落下。
10 毫秒级的时延能稳定跑出来。
多轮 AI对话 里的往返,还有高频 KV 缓存读写,都是这类负载。它靠多卡并行推理和内存资源池化来扛。
异构 PD 分离方案会按业务负载动态调配比。再叠上大规模专家并行。最终在万亿参数 MoE 模型上,时延做到 5 到 10 毫秒。
单卡吞吐比业界风冷集群高 2.5 倍。
对中小企业来说,这一台解决的是迁移成本和迁移效率。门槛降了一截。
软件把硬件用起来
硬件负责把算力拧成一股绳,软件负责调度。
昇腾超节点的系统软件包括灵衢总线管理、灵衢系统服务以及超节点管理这几个组件。灵衢系统的高阶服务支持跨物理节点统一内存编址。编程模式和执行模型,跟单系统语义一致。
实际效果是,1024 卡超节点域内的集合通信性能提升 1.6 倍。在大 EP 跨卡通信场景里,1K 小包通信耗时从 70 微秒降到 8.6 微秒。
这个数字不小。
生态这一侧动手更早。去年昇腾把 CANN 和 Mind 系列全面开源开放,同时兼容主流生态。
眼下 CANN 社区的月活开发者超过 5200 名。官方说这个数字在中国开源项目里排第一。生态在长。

▲昇腾超节点技术路线与开源开放生态
从入门部署到算子开发,从训练推理到性能调优,昇腾想覆盖的是全流程。这是软实力。
落地才是分水岭
超节点这条赛道,发布会不少,交付不多。缺的是交付。
行业里已经能看到一些用例。蚂蚁阿福在昇腾超节点上做模型训练,实现了离线持续优化、在线实时纠偏。健康 AI 服务的响应和吞吐都有提升。
德赛西威基于昇腾超节点搭算力底座,官方称训推性能超过业界 GPU 平台。
落地行业已经覆盖互联网和运营商,金融也在其中,教育和医疗、交通与制造同样有案例。
往后看,超节点之间的竞争不太可能只比单卡参数。比的是整套。
硬件架构、系统工程 加上软件生态,三样捏在一起才是完整的答题。先落地的那一方,优势会顺着技术与生态的飞轮滚下去。

▲昇腾超节点系统架构创新路线
