阶跃 Step 5 Preview 实测:600B 参数只激活 27B,网页小游戏一次写成

9 月的大模型战场杀得很凶。榜单上的排名一天一个样。

这一天又冒出一匹黑马。阶跃发布了新一代开源旗舰基础模型 Step 5 Preview。

阶跃发布新一代开源旗舰基础模型 Step 5 Preview

在全球权威的 Artificial Analysis 智能指数里,它拿下 44 分,排进全球开源模型前三。同时进入能力与成本权衡的帕累托前沿。

比拼的维度也变了。模型能不能处理复杂的真实任务。响应能不能满足即时需求。成本能不能撑住大规模调用。还有一点,能力能不能真的进到手机和汽车里。

智能指数与成本权衡的排名位置
同一份榜单里的开源模型对比

AI工具 的眼光这两年也变了。光看跑分已经不够,要看它能不能把活干完。

我们把这台新模型接进 WorkBuddy,一项一项试。编程和设计先上。三维生成也试了。深度调研和数据分析各跑一轮。

编程先上,小游戏写得比预期完整

第一项是用 Three.js 写五子棋。落子、轮次切换和胜负判定,构成小游戏最基本的框架。

AI编程 最吃上下文,所以先从小游戏入手。它交出的小游戏里,甚至还有人机对弈环节。

五子棋小游戏的实测画面

换到威尼斯快艇的案例,它不只完成了主要玩法。水面和建筑被组织进同一个场景,镜头也跟着船动。最终效果接近可以直接体验的网页小游戏。拿这类 AI小工具 来验模型的手艺,成本很低。

威尼斯快艇场景的运行画面

卡帕多奇亚的热气球场景更复杂。几十个气球同时飞行,日照和风向都能调,观察视角也能换。变量彼此关联,它仍然保持了完整的场景结构和交互逻辑。

卡帕多奇亚热气球场景的渲染效果

尼亚加拉瀑布这一关更难。要处理动态水体,还要有水雾和彩虹,游船也得出现在画面里,同时支持多视角和季节切换。

它把视觉效果和运行效率都顾上了。整体完成度相当可观。

尼亚加拉瀑布场景的渲染效果

网页操作系统是一个更有参考价值的横向样本。

之前我用别的模型测过同类型的 Mac 桌面任务。这一次交出的页面,在界面完整度和细节还原上都更进一步。

网页版桌面操作系统的实测画面

网页设计和三维资产这两组测试,考的是视觉理解和空间表达。

太空行星和夜间跑车两个主题都有明确的视觉中心。模型要把构图和文字可读性塞进同一个页面,还要适配移动端。

太空行星主题的网页设计稿
夜间跑车主题的网页设计稿
同一组测试里的移动端适配效果

三维资产我挑了狮身人面像。它能抓住对象的结构特征,再把它转成空间表达。

狮身人面像三维资产的重建过程

随手拍的一张照片也能用。几分钟里,它就还原出了结构和空间细节。

左为原图,右为成品

金融和数据分析,考的是能不能交货

相比创作任务,深度调研更考验证据组织和判断能力。金融则是检验综合能力的典型场景。

阶跃围着公司研究这条金融工作流做了三项内部评测。另有一个 FrontierFinance,里面是 220 道专家问题和 11543 项评估标准。

它在这四项金融基准里的表现都接近 Claude Opus 5。信息检索和企业估值这类任务上,优势比较明显。

回到实测。小折叠手机的立项报告要求把用户投诉和售后成本串起来,还要看外屏生态。最终给出的建议有数据支撑。

难点在于,模型既要查资料,也得从分散的信息里提炼出能影响决策的结论。

小折叠手机立项报告的输出结果

广州和佛山七日游这一题,同时塞进预算和体力,还要全程严格吃素。这种任务看着生活化,行程一长就容易忘掉限制。它一路守住了条件,方案也能落地。

七日游行程方案的输出结果

销售明细表的分析更贴近企业日常。模型要先把混乱数据洗干净,再找出负利润率订单集中的大区和品类,最后画出月度销售趋势图。

判断标准很简单。过程讲得清不清楚。结论能不能复核。

这两条直接决定交付物能不能进入真实的工作流。

销售明细表的分析过程
月度销售趋势图的输出结果

从网页游戏到三维资产,再到金融研究和数据分析,这些案例指向同一件事。它能理解复杂需求,能规划步骤,能调用工具,还能一直守住约束。

智能体浪潮之前,阶跃手里捏着什么

这一轮实测验证的是旗舰模型的研发能力。它背后那套全模态矩阵才是真正的底牌。

感知和理解在前。生成和交互在后。四项能力已经连成一条链路。

过去一个季度,阶跃陆续放出了 Step Edge 端侧模型和 StepAudio 3 系列语音模型。

端侧这个模型把文本和视觉基础模型,跟语音还有图形界面能力接了进来。简单任务在端侧完成,复杂任务交给云端。

它在评测汇总里拿了 29 项第一。

语音模型的两项评测成绩

上周发布的 StepAudio 3 Realtime,在对话动态和语音推理两项测试里跑出 98.9% 和 99.7%。语音识别版本则以 1.7% 的词错误率并列全球第一。

目前它的版图里有云端旗舰,有轻量高效的 Flash 模型,也有端侧模型。

真正有辨识度的是 AI 加终端的落地。国内同时凑齐模型和系统,再有自己的硬件的公司,数得出来。

装机量是一个硬指标。它的模型手机装机超过 4200 万台,每天服务接近 2000 万人次,合作覆盖国内一半以上的头部手机品牌。

汽车那边,阶跃联手吉利与千里科技,做了整车智能体超级 Eva,由极氪 8X 首发搭载。

这台车载智能体装了 Step 3.5 Flash 基座模型,再加上语音和视觉理解模型,把感知和执行整合进同一套系统。

吉利银河 M9 也接了它的端到端语音大模型,成为同类模型里首次量产上车的一个。

端到端语音大模型的量产上车合作

把这些合作只当成装机数字,会低估终端的价值。

几千万台设备等于一场每天都在跑的真实测试。口音,噪声,模糊指令,网络波动,模型都能拿到真实反馈。

终端也是验证端云协同的天然场所。端侧模型管效率,云端管能力上限,语音和视觉的配合在真实交互里不断磨合。

跟主要靠开发者调用的纯接口公司比,它能把模型塞进具体设备,再靠系统适配和产品交付,把技术变成生意。

个人智能体的核心入口载体示意

还有一个更远的判断。个人智能体很可能是编程智能体之后,全球 AI 产业的下一波浪。

个人智能体要懂屏幕,要懂声音,还要懂个人偏好,并且能跨应用把真实任务做完。它的核心载体就是 AI 原生硬件。

今年 7 月,阶跃推出了原生 AI 终端品牌 STEPX,接下来要发智能体手机 STEPX Neo。

至此,从模型到系统再到终端,三条线被拧到一起。它拿到了下一场战役的入场券。

大模型的终点不在榜单上,而在千千万万人的日常里。