2.8 万亿参数的模型怎么跑快:两条路线撞到了同一个答案

2.8 万亿参数的模型怎么跑快,眼下是全球算力圈最硬的一道题。

这个数字有多大。

一款国产开源模型的总参数量到了 2.8 万亿,激活参数 1040 亿。

它把开源模型的性能上限又往上推了一截。

代价是装不下。

官方推荐 64 卡起步,甚至更大的集群才让它站得住。

有业内人士估算,未做优化的超节点跑这套模型。

初始速度只有每秒 10 个词元上下。

这基本等于没法用。

于是海内外团队在同一周交出了各自的答案。

各家旗舰模型参数规模变化图

9 月 21 日,浪潮信息在一场算力大会上发布了新的超节点服务器。

它用紧耦合的方式把 128 颗本土芯片连成一体。

单机就能承载这套 2.8 万亿参数的模型。

词元生成时延第一次压进 5.85 毫秒。

这条线走的是硬件。

元脑 SD200 Ultra 超节点服务器

两天后,海外的加速芯片推理优化团队开源了一套方案。

他们只用 16 颗谷歌自研的加速芯片,就把整个模型的内核合成一个。

再配上投机解码,低并发下的解码吞吐做到每秒 709 个词元。

这条线走的是软件。

不同芯片上的解码吞吐对比

一个用本土芯片做商业化超节点,一个用谷歌芯片做开源项目。

做法不同,指向的技术思路是同一个。

那就是打破算子边界,把推理的计算过程融合到极致。

这场竞争已经不在模型算法层了。

它下沉到了系统软件、芯片互联和内存管理。

方向变了。

一、万亿模型难跑,卡住的是数据搬运

万亿参数的模型为什么慢。

问题出在哪。

多数人的第一反应是算力不够。

实际情况更接近数据搬运和内存带宽跟不上。

据一家半导体行研机构测算,这套模型一次前向计算要吃掉的显存带宽接近 1.5TB。

它内部的 896 个专家要分布到多张芯片上。

每一次前向还会触发超过 120 次全交换通信。

芯片算力再强,数据传不过去,算力也只能闲着。

瓶颈很具体。

解码阶段的问题更明显。

模型每生成一个词元,都要重新读一遍大量权重。

传统的推理框架往往需要反复启动内核。

每个内核各自完成加载、计算和写回,再启动下一个。

计算之间就出现了大量细小的空泡。

空泡就来了。

这些碎片累积起来,就是实际速度和理论峰值之间的那道鸿沟。

既然边界本身就是浪费的来源,那能不能干脆把它抹掉。

海外团队的做法是把整个模型看成一个内核。

他们把 92 个专家层放进同一次调用里,让整个解码过程在一个内核内部走完。

当前层在算的时候,下一层的权重已经通过异步搬运从显存提前搬到了片上。

这套打法成立的关键,是芯片自带的一块片上高速缓存。

关键就在这块缓存。

数据进到这块缓存之后,什么时候搬,什么时候留,什么时候释放,都能由程序显式安排。

换句话说,他们做的是把整个模型当成一条连续的数据流。

加载与计算交替的流水示意

浪潮信息没有走到这一步。

他们把众多基础算子先融合成一套大算子,再用系统级的紧耦合架构去榨效率。

针对这套模型的推理特点,他们做出了计算与通信协同执行的大算子。

算子数量降了一个数量级,推理性能提升三倍以上。

效果很直接。

超级算子与算子串行执行的对比

两步。

第一步是把小算子焊成大算子。

按片上存储的容量划分数据块,让前一步的结果直接留在寄存器里给后一步用。

这样既少启动几次内核,也免了中间结果反复写回显存。

第二步是把通信和计算融在一起。

超级算子按数据块组织流水线,用异步搬运和多缓冲。

下一块的数据预取、当前数据的计算和上一块结果的写回,因此能同时进行。

跨芯片的通信也按数据块推进,把通信延迟尽量藏进计算过程。

思路很统一。

一个把整段解码塞进单个内核,一个把细碎算子融成大算子。

它们共同说明一件事。

过去那种一个算子对应一次内核启动的做法,正在松动。

二、让模型优化模型

超级算子能省掉搬运和等待,但它自己的设计和优化也是重活。

数据怎么复用,计算和通信怎么衔接,不同阶段怎么排成流水。

这些都得贴着具体模型和硬件一点点试。

这部分长期靠人力堆。

能不能让模型自己来做。

答案是能。

浪潮信息在适配这套模型的过程中引入了一个智能体,让模型参与自身的推理优化。

它针对推理特点生成大算子和流水结构,把计算、通信与数据搬运拉到一起执行。

3D Hyper Mesh 架构示意

该公司一位首席战略官打过个比方。

过去的大模型推理由几百个算子串联执行,像绿皮火车沿路要停几百个小站。

每站都要启停装卸,整体效率自然低。

超级算子更像一站直达的高铁,中间的停靠开销全省了。

说法很形象。

他也承认,行业早就知道旧模式的短板。

可从前的痛点是人工优化调度的量太大,根本推不动。

如今智能体带来了新的解法。

他们的思路是用这套模型去优化这套模型。

由智能体自动生成大算子,再经模型校验迭代,性能又提升了五成。

循环加速就这样形成了。

模型已经不只是被优化的对象。

角色变了。

它开始成为优化基础设施的工具。

这可能成为下一代推理优化的一个重要范式。

三、芯片是一张牌,系统是另一张

智能体时代,词元消耗的增长是数量级的。

一家咨询机构今年三月的报告给出了数据。

一个智能体工作流每个任务消耗的词元,是普通聊天机器人的 5 到 30 倍。

另一家投行预测,到 2030 年全球词元消耗量会比现在增长 24 倍。

换算下来,每月达到约 120000 万亿词元。

智能体词元消耗预测曲线

需求侧爆发,供给怎么接。

这里有两个典型困境。

第一个是向上。

模型越来越大,长上下文和复杂推理越来越多。

单机越来越难承载,算力系统必须不断突破模型能力的上限。

第二个是向广。

越来越多的用户开始调用低价模型,词元需求迅速扩张。

模型本身可能已经足够便宜,但如果算力供给跟不上,低价就很难持续。

浪潮信息的回答是两条线一起走,一条做能力型智算,一条做容量型智算。

向上,那台超节点做到每词元 5.85 毫秒、单用户每秒 170 个词元。

向广,多元算力机组按负载把预填充、解码和前馈网络分发到不同芯片上。

同等投资下,词元产能提升十倍。

智能体时代算力发展的两个维度

那中国玩家的护城河在哪里。

先看芯片。

单看芯片,本土产品与英伟达仍有差距,单卡算力、生态和工具链都有明显短板。

可到了超节点这一层,靠系统级创新可以追平,甚至超过单卡更强但系统松散的方案。

差距能补。

再看系统。

还是以那台超节点为例。

它用紧耦合架构把 128 颗本土芯片连起来。

整机提供 8TB 统一编址显存和 64TB 内存,通信时延低到 0.69 微秒。

通过对称内存技术,它第一次在基于本土芯片的超节点上做到了显存直连。

集合通信时间因此降低 3.5 倍。

这是硬指标。

那位首席战略官说,超节点最基本的特征是显存要统一寻址。

这一点做到了,大模型才装得进去。

否则只能叫节点集群,模型还是得被拆成好几段。

芯片是一张牌,系统工程是另一张牌。

与其说这是一次芯片的胜利,不如说是一次系统工程的胜利。

当芯片之间连得更紧,内存能形成统一空间,通信能藏进计算。

算子还能由智能体持续优化。

单芯片性能之外的系统红利就开始释放。

对本土算力来说,这条路的份量尤其重。

结语

算力竞争的重心,正在从造出更快的芯片,变成把现有的芯片组织到极致。

海外的团队用 16 颗芯片证明,一个内核可以装下 2.8 万亿参数。

国内这家公司用 128 颗本土芯片证明,系统级紧耦合加上大算子同样有效。

本土算力也能跑进第一梯队。

两条路线,一个方向。

效率革命才刚开始。

对做 AI工具 的团队来说,这些变化意味着成本结构要被重算。

上游的效率提升,最终会传到做 AI编程 工具的人手里。

同理,做 AI对话 产品的公司也会跟着受益。

在芯片工艺受限的约束下,系统级创新是确定性最高的那条追赶路径。