平头哥开源整套 AI 软件栈:最强芯片之外,另一半在生态

「这是目前中国算力性能最强的 AI 芯片,性能达到 M890 的 3 倍。」

9 月 22 日的云栖大会上,阿里集团首席执行官吴泳铭这样介绍新一代真武 V900。

硬件出鞘,把平头哥推到了聚光灯下。

但准备换芯片的客户还会问另一件事。过去写的代码,攒下的工具,还有调优的经验,能不能一起带走。

芯片算硬实力。软件生态算软实力。两样都决定客户怎么选。

对做 AI工具 的团队来说,这笔账最后都会落到迁移成本上。

一天之后的 9 月 23 日,平头哥公布了自家软件栈 SAIL 的开源进展。

开放范围扩到框架适配、加速库,工具链和通信库也在列。

道理很直白。

云栖大会现场展示的开源版图演示页

在平头哥的比喻里,AI 芯片是发动机。

软件栈相当于变速箱、传动系统和驾驶系统。

发动机再强,最终能发挥多少,还得看软件能不能让模型顺利迁移、运行和优化。

现在这套配套软件,正进一步向开发者打开。

按官方披露,真武芯片已经服务 20 多个行业、650 多家客户。

蚂蚁、小红书和小鹏汽车等头部公司,已经开始用这套软件栈。

真武芯片的行业覆盖与客户分布示意

小红书还基于它的开源代码,做了一个模型迁移与算子优化智能体。

用途是加速生成式推荐模型在真武上的部署。

平头哥出基础软件能力。客户把业务经验写进工具。

芯片背后的生态,就是在这样的参与里长起来的。

大厂造芯,正在从交付芯片走向开放共建。

这次到底打开了什么。

简单说,这套软件栈是围绕真武芯片打造的,定位对标英伟达那套 CUDA。

它连着上层的 PyTorch 等框架,也连着底层的真武硬件。

模型迁移和编译执行由它管。计算加速和开发调试也由它管。

软件栈的分层与上层框架对接示意

今年 7 月的世界人工智能大会上,平头哥宣布启动这套软件栈的开源。

当时放出了开发包和驱动,还有性能分析与调试工具。

两个多月后的云栖,清单更长了。

已开源的项目包括框架适配和源码迁移工具。

算子开发工具也在其中。

计算加速这块,有 DeepGEMM 和 FlashAttention 两个项目。

从调试工具到技术文档,再到开源框架,开发者能看得更深。

需要的时候可以查代码。也可以改代码。

这些工具回应的,是业务里最要紧的三个问题。

第一件是先解决迁移

「最大的诉求,从业务角度来说,就是迁移成本有多大。」

公开演讲时,平头哥半导体软件生态资深总监陆生华这样说。

这话不难懂。不少客户的软件已经在线上跑了很多年。

代码改过一轮又一轮。工具早就用顺手了。团队也有一套自己的调优经验。

换一款芯片,这些积累都要重新接受检验。

业务还不能因此中断。

框架适配、源码迁移和算子开发工具,先要做的就是尽量保留它们。

开发者继续沿用熟悉的 AI编程 方式,迁移工具帮忙处理已有代码。

再按新硬件的特点补上必要适配。

过去的积累越容易带走,中国芯片才越有机会成为真正可用的选择。

开源编程生态的演示页

第二件是跑起来之后继续抠性能

迁移跑通只是第一步。

如果换了芯片,效率只剩原来的三成到四成,业务里就很难接受。

所以马上会碰到第二个问题。同一个模型能不能跑得更快,资源还能不能再省一点。

只靠厂商把工具做好还不够。

DeepGEMM 和 FlashAttention 这类项目开源,意义就在这里。

开源之后,开发者不只是下载现成工具。

他们能看见里面怎么实现,再按自己的模型和负载继续改。

云栖大会上的开源状态演示页

过去要交回芯片厂商的问题,现在业务团队有机会自己定位、自己优化。

更懂模型的人,可以直接参与决定模型怎么在芯片上跑。

换句话说,开源不是多了一个下载入口。

它让开发者真正参与到芯片性能优化里。

第三件是新模型出来之后,最好当天就能跑

现在模型基本是几周一更。

适配慢一轮,业务团队试新技术的时间也跟着往后推。

尽快支持新模型,甚至做到当天可用,已经是客户对算力平台的期待。

平头哥也在持续提供面向真武适配的模型资源。

现场演讲披露,到 2026 年 9 月,它在魔搭社区上已提供 39 个量化模型。

覆盖的系列包括千问、DeepSeek 和 Kimi,累计下载超过 34.8 万次。

量化模型对齐真武特性的演示页

这些模型省掉了用户自己准备的工作,让部署和测试更早开始。

还在推进开源的东西也不少。

TensorFlow 和 JAX 的适配版本、自研推理引擎都在其中。

通信组件和调试监控工具同样在列。

代码打开之后,客户开始自己动手

小鹏解决的是把已有业务搬到新平台上。

借助这套软件栈,它把原先跑在英伟达平台上的业务模型迁到真武云端集群。

迁移的对象是智能驾驶模型训练。

迁完团队继续用性能分析工具定位瓶颈。

再围绕算子和框架做优化。

开发方式支持 C++ 和 Triton 等选择。

目的是减少重新学习的负担,让团队把精力放回模型和业务。

开发者工具链的演示页

蚂蚁面对的是适配之后的持续调优。

它的推理服务团队已经完成主要前沿模型在真武上的推理适配。

接下来还要做量化、推理阶段分离,还有专家并行负载均衡和稀疏注意力接入。

模型能返回正确结果,只解决了功能问题。

真实的推理服务还要看处理效率和资源开销。

软件优化会跟着业务一直做下去。

小红书又往前走了一步,把迁移和优化做成了自己的工具。

它面向真武架构开发了自动化智能体,用这种方式辅助优化。

厂商提供的基础实现,成了下一轮开发的起点。

这里还藏着一个矛盾。

客户想针对芯片开发高性能算子,同时又要保护自己的算法和知识产权。

算法细节不方便交出去。芯片厂商不了解细节,就没办法代为优化。

开放软件代码和架构信息之后,客户有条件自己做完这件事。

核心业务逻辑留在内部。团队按公开的硬件信息写定制算子。

之后再检查和调整实现。

愿意公开的工具和优化,可以提交给社区。

平头哥为此建了贡献流程。

开发者可以提出问题,改代码,提交贡献。

经过自动化测试和维护者评审,改进能合入主线,随版本发布。

上游软件生态建设的演示页

据介绍,开源之后,已经有阿里内部和外部客户提交代码贡献。

收到的反馈也相当具体。

有人想把自己的项目贡献出来。

有人需要更多硬件架构信息,才好开发定制算子。

还有人希望新模型和新框架得到更快支持。

云栖大会现场给出的开源原则演示页

这些需求也在改变平头哥自己的开发安排。

真武的架构信息已经公开,社区治理和贡献规则还在完善。

团队正推动软件组件解耦发布,让不同项目分别更新。

面向真武的适配成果,也在逐步提交回上游社区。

为什么选在这个时候继续开放

要理解这个时间点,得先回到芯片本身。

已经有足够多的人拿到硬件、用进业务,适配和优化的需求才会真正出现。

从 2019 年的含光 800,到 2021 年的倚天 710,再到如今的真武系列,平头哥走了很多年。

其中一条持续的路径,是从业务需求出发设计芯片。

先在阿里内部验证,再通过云服务外部客户。

平头哥开发者社区的页面截图

陆生华谈到,外部客户接触新芯片时,常会先确认一件事。阿里自己用过没有。

淘宝、搜索这些业务,还有推荐和广告,都承担了早期生产验证的角色。

经过实际流量和集群稳定性的考验,产品再逐步向外推广。

到真武 M890,团队已经完成两代完整芯片交付。

在他看来,软件的成熟度和客户对二次开发的需求,一起促成了此时的开放。

650 多家客户意味着产品被用起来了。

也意味着厂商要面对越来越多不同的问题。

汽车公司训练模型。互联网公司优化推荐。模型团队尝试新算法。

各自的计算方式和性能瓶颈并不一样。

同一套基础软件之上,还会长出大量贴近业务的开发。

客户越多,把这些活全留给芯片厂商就越难持续。

这时候扩大开放,既有验证过的软件可以拿出来,也有真正需要它、愿意继续开发的人。

此外还有一笔长期维护的账。

芯片厂商基于主流框架做适配,通常要改一部分代码。

长期维护自己的独立版本,上游每次更新都得重新同步,处理差异,再做测试验证。

分开的时间越长,这件事越重。

把适配和优化提交回上游社区,是为了让真武的支持跟着主流一起演进。

客户能更快用上新技术。平头哥也能少做重复维护。

开放之后厂商的活并没有减少。

原先统一发布的软件包拆成多个独立组件,需要新的检查与测试安排。

社区提交的改动,也要有人评审、维护,并对质量负责。

开放扩大了参与范围,也要求它练出长期协作的能力。

再把视线拉远,这个选择和阿里的整体布局是接上的。

今年云栖大会上,吴泳铭明确提出,阿里将长期投入模型、芯片和云。

早在 2025 年 2 月,阿里就宣布三年内至少投入 3800 亿元建设云和算力基础设施。

后来又说要在这个计划上继续加码。

模型带来新的算法、精度和并行需求。芯片提供计算、内存和互联能力。

这套软件靠编译器、算子库,还有通信库,让模型的需求在硬件上落地。

再由云把整套算力组织成服务,交付给用户。

这层软件能不能及时跟上,直接影响新模型多久能用上硬件性能。

阿里内部已经在做这种协同。

按陆生华的介绍,平头哥正与千问团队合作,探索让模型生成高性能算子。

生成一段功能正确的代码相对容易。

要让它吃满芯片性能,还得模型理解底层架构。

但千问的需求覆盖不了所有行业。

小红书的生成式推荐和小鹏的智能驾驶训练,各有自己的模型、数据与优化目标。

继续开放,就是让这些团队也能参与连接模型与硬件的软件开发。

把对业务的理解,变成具体实现。

阿里在模型、芯片和云上的持续投入,最终要由更多业务来检验。

芯片交付之后,软件能不能跟上,客户能不能按自己的需求开发,都会影响这些投入最终能覆盖多广的市场。

平头哥用多年投入攒下了造芯和用芯的能力。

走到今天,它开始把更多经过业务验证的代码和工具,交到开发者手里。

大厂造芯,也到了拼生态的时刻。

SAIL 的全称是「AI 库的种子」。

按平头哥的解释,每一行开源代码都是一颗种子。

芯片已经进入真实业务。

接下来就看这些种子,在更多开发者手里长出什么。