9 月 22 日,杭州云栖大会的第一个上午。
吴泳铭做完主旨演讲,千问大模型和多模态模型的负责人依次登场。再往后一位,是平头哥副总裁高慧。她的演讲题目很直接:「Agentic 时代卓越算力基石」。
平头哥这次没藏着。它把一整条产品线都搬上了台。除了最新的真武 V900 芯片,还有 ICN Switch 互联芯片。磐脉智能网卡和镇岳 SSD 主控也在。倚天 CPU 的路线图同样在列。再往下一步,是算力与存储、网络全栈协同的超节点服务器。

一家做了多年芯片的公司,为什么突然要把硬件清单摊得这么开。
答案藏在负载的变化里。今天跑在云上的 AI工具,早就不是几年前那批聊天框。算力需求的重心,正从训练滑向推理。应用形态也在变。从单轮请求,变成连续的多步任务。硬件之间的竞争,不再比某一颗芯片的指标。它比的是整个计算系统的协同能力。
一、真武 V900:一代翻三倍,显存和互联一起加码
这场发布里,分量最重的仍然是新一代训推一体 AI 芯片真武 V900。

它的显存是 216GB。片间互联带宽达到 1200GB/s。单芯片性能是上一代真武 M890 的三倍。按现场说法,这是目前中国算力性能最强的 AI 芯片。精度上,它原生支持 FP8 和 FP4。从高精度训练,一直覆盖到超低精度推理。
量产时间也给了。按照平头哥公布的计划,V900 将在 2027 年第一季度进入量产销售。再往后,2028 年第三季度,真武 J900 会接棒。
这个迭代速度值得留意。上一代真武发布,其实只过去了几个月。2026 年 5 月,真武 M890 首次亮相。它有 144GB 显存,片间互联带宽 800GB/s。性能是 810E 的三倍。精度上,它支持从 FP32 到 FP4 的多种格式。
到了 V900,性能又提升三倍。显存从 144GB 涨到 216GB。互联带宽从 800GB/s 提到 1200GB/s。
再往前看一代,2024 年的真武 810E 已经走向训推一体。它用自研并行计算架构和互联技术,并配套 SAIL 软件栈。

810E,M890,V900。连续三代产品里,平头哥一直在同时推高训练和推理。显存容量与低精度计算,也在同步往上走。
二、万亿参数之后,瓶颈从算力挪到互联
为什么要同时推这几项。因为模型本身在变。
参数过了万亿以后,MoE 几乎成了默认答案。一次推理如果让全部参数都参与计算,算力消耗和推理成本都会飞起来。MoE 的做法是把模型拆成大量专家,每个词元只调用其中一小部分。模型容量继续扩大。单次实际参与计算的参数量,却压了下来。
这招缓解了计算量。它也把压力推向了三个方向。
第一个是算力。每个子专家的参数量仍在几十万级别。词元要在很短时间内完成大量矩阵运算。进入训练阶段,还有反向传播和梯度更新这些更重的活。芯片的计算能力必须跟着涨。
第二个是显存。单颗 M890 有 144GB 显存,V900 提到 216GB。十来张 V900 就能装下一个万亿规模的大模型。据现场介绍,基于 M890 的超节点已经大规模应用。Qwen3.8 和 Kimi K3 这类超过 2 万亿参数的模型,都已经在上面跑通。
第三个是互联。这也是最容易被忽略的一环。
显存再大,也装不下数万亿参数。模型必须拆到很多颗芯片上。拆开之后,芯片之间就要不停交换数据。一颗芯片算完自己的专家部分,数据马上交给另一颗。专家算完,结果还要再汇总一次。
模型铺到几十上百张卡以后,交换数据的速度直接决定整个模型能跑多快。装得下只是一半问题。跑得动是另一半。
这也是平头哥这几年一直往互联上砸资源的原因。今年 5 月,它的互联芯片 ICN Switch 首次亮相。这颗芯片成了阿里超节点形态算力的核心之一。
据介绍,真武 V900 通过自研 ICN Switch 连接起来,具备原生内存语义。它还能做内存统一编址。结果是千卡全带宽高速互联。上千颗 V900 可以像一颗超级芯片那样协同工作。对大参数模型的训练和推理来说,这意味着高吞吐、低延迟和高并发。
算力和显存涨上去,互联能力跟上,客户圈子也就跟着扩大。
在具身智能方向,众擎机器人用真武搭了一套千卡训练平台,覆盖模型训练和数据处理等环节。端到端训练效率提升 34%。已经有 30 多个模型可以免适配直接跑通。

人形机器人研发,每天要处理 3D 动作迁移和数据标注。真武已经进入这些团队的核心训练流程。
汽车场景里,小鹏把真武用在了自动驾驶、智能座舱和企业大模型等多类业务上。现场披露的数据是,真武整机性能比对照的业界主流 GPU 提升 70%。集群故障数量也减少了 50%。另一个变化是资源池。过去多种卡型各自为政。现在可以把分散的算力资源收进同一个池子,统一管理。

截至目前,真武系列已经服务超过 650 家企业客户。行业覆盖智驾和金融,也覆盖大模型与具身智能。能源和制造也在名单里。
三、从一颗芯片到算存网全栈
V900 和 ICN Switch 之外,平头哥还把三样东西放进了同一张产品图。
磐脉智能网卡,负责把服务器接入数据中心网络。镇岳 SSD 主控,处理本地存储。倚天 CPU,承担通用计算。分工很清楚。真武管 AI 计算。ICN Switch 管芯片之间的高速互联。
这里面,倚天是一个容易被低估的点。
传统 AI 训练里,重活都压在加速器上。CPU 主要做数据准备、请求处理和调度。到了智能体这里,情况反过来了。
高慧现场举了个例子。一个智能体要交出一份报告,得先搜资料,再读文档。它还要跑代码验证,保存中间状态,最后把几路结果汇总。模型推理只占整条任务链的一部分。其他环节会一直占用 CPU。
今年 Computex 上,Intel 给过一组公开测算。前沿模型训练里,一颗 CPU 大约配八颗 GPU。到了智能体负载,CPU 的密度已经朝 1:1 甚至更高走。
所以倚天的路线图也变了。平头哥计划在 2027 年推出倚天 720 和 730。倚天 720 是 190 核,12 通道,面向吞吐并发型场景。倚天 730 是它第一代自研高性能核。它支持两路同步和多线程,单核跑分最高能到上一代的 1.4 倍。这款面向延迟敏感型场景,给 AI 头节点提供确定的单核性能。再往后还有基于第二代自研核心的倚天 750。它可以和真武通过同一套高速互联体系交换数据。CPU 与 AI 芯片之间的开销,也就压下来了。
硬件摆齐了,还有软件这道关。
模型里的注意力机制和专家网络,还有矩阵乘这类计算,最后都要变成芯片能执行的算子。同一个算子,数据怎么排布,用什么精度,怎么调片上内存,怎么编译,执行效率差很多。
以 Kimi K3 适配真武 M890 的过程为例。基于 64 张 M890,模型完成适配之后,阿里云、平头哥和 Kimi 团队并没有停手。他们继续调软件栈和核心算子。最后的结果是首词元时延下降约 35%。单卡解码吞吐提升 1.8 倍。
这里面,今年 7 月开放的 SAIL 软件栈起了关键作用。它覆盖操作系统和开发套件,也覆盖接口层。同时提供驱动,还有性能分析和调试工具。一颗新芯片做出来,原来跑在别的硬件上的模型和框架,能尽快迁过来。
目前 SAIL 已经支撑 python 和 TensorFlow。vLLM 与 SGLang 等 260 多个主流训练和推理框架,也在它的覆盖范围里。在 GitHub 上,超过 1 亿星标的主流 AI 仓库里,SAIL 的覆盖率超过 96%。vLLM 和 SGLang 这些推理框架,上游一发新版本,SAIL 就跟着适配。平均不超过一周。
再往上,是云平台。
阿里手里的链条很完整。有模型,有芯片,有推理平台,还有云。这让它可以针对具体模型,做从芯片到云平台的全链路优化。举个数字。通过算子优化和软硬件架构协同,阿里云灵骏真武超节点实例在智能体推理场景里,最多能拿到 1.5 倍的性能提升。
到这一步,一颗 AI 芯片才算真正变成云上的算力。
四、硬件跑得慢,模型跑得快
吴泳铭当天的演讲里,把机器智能时代的基础设施归成三块。AI 模型、AI 芯片和 AI 云。
他给了几组数字。
模型这一边,千问计划继续训练 5 万亿到 10 万亿参数规模的新模型。
云这一边,他说客户的 AI 需求依然非常强劲,中长期需求远超供给能力。阿里会继续投入 AI 基础设施建设。到 2032 年,阿里云运营的全球数据中心规模目标超过 20GW。这延续了过去一年持续加码算力的方向。
算力做到这个规模,自研芯片的意义也就变了。它不再只是一项证明技术能力的业务。几十万张加速卡进入同一个云计算体系,要长期面对供给和成本,也要面对功耗与服务器设计。网络怎么扩,模型怎么适配,软件效率怎么提,都是长期问题。把芯片和服务器,把超节点和网络,把模型和推理系统放在一起调优,提高的是整个集群的词元产能。
反过来看,整个阿里体系的资源和认知,也在反哺平头哥。
翻一翻过去几年的行业变化,会发现一个天然的难题。硬件的节奏和软件的节奏对不上。
一颗复杂 AI 芯片,从架构定义到设计验证,再到流片,往往以年为单位推进。EDA 厂商 Synopsys 披露过一个加速器案例。18 个月完成流片,已经被当作极快的速度。同类项目传统上要三到四年。流片之后,还有硅后验证和封装,还有良率爬坡与量产准备。
可过去三年,AI 模型从参数量到架构已经换了几轮路线。
2023 年,千问公开的最大模型还是 72B 规模的稠密 Transformer。那时硬件面对的,是一套相对直接的矩阵计算。2024 年 3 月,千问推出首个 MoE 模型。压力分散到显存、专家路由和跨卡通信。到 2025 年,稠密与 MoE 已经同时存在于一代模型里。2026 年的 Qwen3.8-Max 把稀疏 MoE 推到 2.4 万亿总参数。每次只激活 950 亿。长上下文和推理模型,又改变了单次请求的时间和内存占用。
应用侧也在改需求结构。最早的大模型应用以 AI对话 为中心。用户输入一句话,模型返回一段文本,重计算都留在模型内部。后来模型开始调用搜索和代码解释器,也调用数据库和各种接口。智能体成了主流。一部分工作被交给外部工具,CPU 和网络的重要性就被摆到了台面上。
也就是说,一颗今天立项的芯片,真正大规模投入使用时,它要服务的模型和应用,很可能已经换了样子。等 MoE 成了主流再去加强互联。等智能体进了生产环境,再回头想 CPU 和 AI 芯片的关系。时间往往不够。
硬件必须提前几年判断模型的走向。这也是阿里体系做芯片的一个特殊优势。
平头哥左手是持续变化的千问模型和智能体家族。右手是相对稳定的电商与支付场景,还有地图、办公和开发者场景。脚下是真实运行这些模型的阿里云。内外视野一叠,变化的苗头刚出现,机会就已经比公开市场更早进入芯片和系统团队的视野。
多看见的那一点未来,本身就是硬件能力的一部分。
