9 月 22 日的云栖大会,阿里把千问大模型的家底摊了一次。
摊出来的东西不少。参数和架构,开源和图像,音乐和语音,还有硬件。一条线一条线地过。
最扎眼的还是参数。
Qwen4 已经用全新架构进入训练。往后的 Qwen4.5 和 Qwen5,计划把总参数推到 5 万亿到 10 万亿。
这条老路,阿里打算继续走下去。
它开始给自己安排活了
比参数更值得看的是另一条线。
阿里这次重点讲的是自我进化。大模型的递归自我改进,已经初步进到训练和推理里,芯模协同这一环也算上了。
说得直白一点,模型开始给自己安排活。
这套东西落在一个叫 Qwen3.8-Max 的版本上。
它自己搭训练流程。它自己造训练数据。实验设计也归它。缺陷定位还是它。
整个链条里人类零参与,连续迭代超过一个月,跑完了 33 轮。

成绩单不算差。在 Artificial Analysis 的榜单上,这个版本的分数从 40 涨到 45。
它和 Claude 与 GPT 的最强型号同处一个阵营,把 GLM5.3 和 Kimi-K3 这些国产对手甩在了后面。
推理这一环也交出去了。
阿里的平头哥有一款新 GPU,这个版本之前没见过。它靠自主适配,把下一代架构模型的推理框架重新调了一遍。单实例的推理吞吐量涨了 96%。
再往上游走,是芯片和模型的协同设计。
只给一份真实的总线模块规范,它就把前端,验证,后端这条链自己迭代了一遍。
自主运行超过 60 小时,调用 EDA 工具超过一万次。最后给出的物理实现方案,把面积减掉了 42%。
这些活原本都是人的。现在它们落到了 AI工具 自己手上。
三个案例指向的东西是同一个。模型的进步开始不那么依赖人去推。
训练成本先砍了一刀
架构这一侧的新品是 Qwen3.8-Flash。
它的做法有点反常。下一代千问大模型的架构,被它提前开源了出来。
注意力机制动了,模型内部的信息传递机制也动了。
效果是两头都占。前沿模型的性能还在,训练成本却降了将近 90%。
它激活的参数很少。推理计算的效率被推到了一个新的帕累托前沿上。
圈里给它起了个外号,叫性价比的斩杀线。
模态这块也有新东西。全模态模型 Qwen3.8-Omni 正式亮相,把音频和视频这些不同的模态收进了同一个理解框架。
对一个要聚拢各路 AI工具 的站来说,统一框架比单项能力的提升更有意义。
开源这条线,阿里一直在推。
在 Hugging Face 上,Qwen3.8-27B 超过了 DeepSeek-R1 和 Meta-Llama3.1 这些热门模型,成了这个平台历史上最受欢迎的开源模型。
公开数据是这样的。阿里已经开源 460 多个千问模型。下载量突破 30 亿次,衍生出来的模型超过 30 万个。
它现在是全球第一的开源模型家族。
视频模型排在 11 月
视觉生成是这次讲得最细的一块。
图像生成模型 Qwen-Image-3.1 面向电商和设计这类真实商用场景做了优化。
原本要花几个小时的视觉设计,现在压到了秒级交付。它还支持对图像做精准编辑。
音乐这边发布的是 Happy Shrimp 1.1。音乐表现和人声质量都有提升,多语种演唱与指令理解也补上了。
它支持一百多种曲风,也能唱十几种主流语言。人声歌和纯音乐都能生成。
世界模型的版本号也动了。HappyOyster 2.0 Preview 对架构和训练方法做了全面升级。
智能实时交互和记忆能力都有明显提升。物理规律的遵循也更稳了。

真正要等的是视频模型。下一代的 AI视频 生成模型定在 11 月发布。
按阿里的说法,方向有四个。更长,更可控,更完整,也更智能。
更长指的是时长拉长之后画面还能保持一致。创作者可以精确控制人物和场景,镜头也能拿捏。
更智能指的是它开始有点导演思维。从生成单个镜头,走到理解一个完整的故事。
语音模型开始往硬件里钻
语音被阿里看成了人和 AI 之间更自然的入口。
Qwen-Audio-3.1 这个家族做了整体升级,分成三条线。转写,合成,还有实时交互。
新发布的 Qwen-Audio-3.1-ASR-Next 换了下代架构。
它能听懂人物的情绪,也能分辨音乐和环境声。声音描述和事件定位它都做,音频问答与推理也一样。
有人问一段录音里人的情绪怎么样,它是答得出来的。
音频创作这条线是 Qwen-Audio-3.1-TTS-Next。给一段脚本,它直接生成一段带对白和环境声的完整音频。
有声书和影视剧,还有播客这类内容,创作效率都会被拉高。
实时交互那条线也不再只是聊天。它能边听,能边想,也能边说。多语言交互和角色扮演的能力同时在增强。
这些模型已经进了硬件。千问办公和 Qoder 用上了这套能力。
QwenNote A2 随身助理和 QwenNote Eva 桌面机器人接了进来,千问 AI 眼镜也在名单里。
还有个数字挺有意思。人类同声传译的平均时延在 4 秒以上。
新登场的 Qwen3.8-LiveTranslate 把时延压到了 2.5 秒以内。它的落地对象是千问 AI 眼镜和 QwenNote A2,还有钉钉耳机。
最后是手机这一端。AI 手机的全栈解决方案 Qwen Intelligence 发布。
它给合作伙伴提供了一个基于千问大模型的 Agent 技术平台。手机要跨应用完成复杂任务,靠的就是这层。
参数之外的东西
把这场发布会串起来看,阿里这轮的落点不只在参数上。
自我进化那条线讲的是效率。训练成本砍九成,推理吞吐涨 96%,芯片设计省 42% 面积。
这些数字其实都在说同一件事。烧钱换能力的边际在变。
开源那条线讲的是生态。460 多个模型和 30 亿次下载,还有 30 万个衍生模型。
这是它能和闭源巨头叫板的底气。
终端那条线讲的是入口。眼镜,耳机,机器人,还有手机。每一个都是用户每天会碰的东西。
而 5 万亿到 10 万亿的参数计划,更像一个长期承诺。它把下一代的想象空间先占住了。
视频模型 11 月见。到时候能验证的,是这场发布会上的方向到底走了多远。
