9 月的大模型战场杀得很凶。榜单上的排名一天一个样。
这一天又冒出一匹黑马。阶跃发布了新一代开源旗舰基础模型 Step 5 Preview。

在全球权威的 Artificial Analysis 智能指数里,它拿下 44 分,排进全球开源模型前三。同时进入能力与成本权衡的帕累托前沿。
比拼的维度也变了。模型能不能处理复杂的真实任务。响应能不能满足即时需求。成本能不能撑住大规模调用。还有一点,能力能不能真的进到手机和汽车里。


挑 AI工具 的眼光这两年也变了。光看跑分已经不够,要看它能不能把活干完。
我们把这台新模型接进 WorkBuddy,一项一项试。编程和设计先上。三维生成也试了。深度调研和数据分析各跑一轮。
编程先上,小游戏写得比预期完整
第一项是用 Three.js 写五子棋。落子、轮次切换和胜负判定,构成小游戏最基本的框架。
AI编程 最吃上下文,所以先从小游戏入手。它交出的小游戏里,甚至还有人机对弈环节。

换到威尼斯快艇的案例,它不只完成了主要玩法。水面和建筑被组织进同一个场景,镜头也跟着船动。最终效果接近可以直接体验的网页小游戏。拿这类 AI小工具 来验模型的手艺,成本很低。

卡帕多奇亚的热气球场景更复杂。几十个气球同时飞行,日照和风向都能调,观察视角也能换。变量彼此关联,它仍然保持了完整的场景结构和交互逻辑。

尼亚加拉瀑布这一关更难。要处理动态水体,还要有水雾和彩虹,游船也得出现在画面里,同时支持多视角和季节切换。
它把视觉效果和运行效率都顾上了。整体完成度相当可观。

网页操作系统是一个更有参考价值的横向样本。
之前我用别的模型测过同类型的 Mac 桌面任务。这一次交出的页面,在界面完整度和细节还原上都更进一步。

网页设计和三维资产这两组测试,考的是视觉理解和空间表达。
太空行星和夜间跑车两个主题都有明确的视觉中心。模型要把构图和文字可读性塞进同一个页面,还要适配移动端。



三维资产我挑了狮身人面像。它能抓住对象的结构特征,再把它转成空间表达。

随手拍的一张照片也能用。几分钟里,它就还原出了结构和空间细节。

金融和数据分析,考的是能不能交货
相比创作任务,深度调研更考验证据组织和判断能力。金融则是检验综合能力的典型场景。
阶跃围着公司研究这条金融工作流做了三项内部评测。另有一个 FrontierFinance,里面是 220 道专家问题和 11543 项评估标准。
它在这四项金融基准里的表现都接近 Claude Opus 5。信息检索和企业估值这类任务上,优势比较明显。
回到实测。小折叠手机的立项报告要求把用户投诉和售后成本串起来,还要看外屏生态。最终给出的建议有数据支撑。
难点在于,模型既要查资料,也得从分散的信息里提炼出能影响决策的结论。

广州和佛山七日游这一题,同时塞进预算和体力,还要全程严格吃素。这种任务看着生活化,行程一长就容易忘掉限制。它一路守住了条件,方案也能落地。

销售明细表的分析更贴近企业日常。模型要先把混乱数据洗干净,再找出负利润率订单集中的大区和品类,最后画出月度销售趋势图。
判断标准很简单。过程讲得清不清楚。结论能不能复核。
这两条直接决定交付物能不能进入真实的工作流。


从网页游戏到三维资产,再到金融研究和数据分析,这些案例指向同一件事。它能理解复杂需求,能规划步骤,能调用工具,还能一直守住约束。
智能体浪潮之前,阶跃手里捏着什么
这一轮实测验证的是旗舰模型的研发能力。它背后那套全模态矩阵才是真正的底牌。
感知和理解在前。生成和交互在后。四项能力已经连成一条链路。
过去一个季度,阶跃陆续放出了 Step Edge 端侧模型和 StepAudio 3 系列语音模型。
端侧这个模型把文本和视觉基础模型,跟语音还有图形界面能力接了进来。简单任务在端侧完成,复杂任务交给云端。
它在评测汇总里拿了 29 项第一。

上周发布的 StepAudio 3 Realtime,在对话动态和语音推理两项测试里跑出 98.9% 和 99.7%。语音识别版本则以 1.7% 的词错误率并列全球第一。
目前它的版图里有云端旗舰,有轻量高效的 Flash 模型,也有端侧模型。
真正有辨识度的是 AI 加终端的落地。国内同时凑齐模型和系统,再有自己的硬件的公司,数得出来。
装机量是一个硬指标。它的模型手机装机超过 4200 万台,每天服务接近 2000 万人次,合作覆盖国内一半以上的头部手机品牌。
汽车那边,阶跃联手吉利与千里科技,做了整车智能体超级 Eva,由极氪 8X 首发搭载。
这台车载智能体装了 Step 3.5 Flash 基座模型,再加上语音和视觉理解模型,把感知和执行整合进同一套系统。
吉利银河 M9 也接了它的端到端语音大模型,成为同类模型里首次量产上车的一个。

把这些合作只当成装机数字,会低估终端的价值。
几千万台设备等于一场每天都在跑的真实测试。口音,噪声,模糊指令,网络波动,模型都能拿到真实反馈。
终端也是验证端云协同的天然场所。端侧模型管效率,云端管能力上限,语音和视觉的配合在真实交互里不断磨合。
跟主要靠开发者调用的纯接口公司比,它能把模型塞进具体设备,再靠系统适配和产品交付,把技术变成生意。

还有一个更远的判断。个人智能体很可能是编程智能体之后,全球 AI 产业的下一波浪。
个人智能体要懂屏幕,要懂声音,还要懂个人偏好,并且能跨应用把真实任务做完。它的核心载体就是 AI 原生硬件。
今年 7 月,阶跃推出了原生 AI 终端品牌 STEPX,接下来要发智能体手机 STEPX Neo。
至此,从模型到系统再到终端,三条线被拧到一起。它拿到了下一场战役的入场券。
大模型的终点不在榜单上,而在千千万万人的日常里。
