8 月 19 日,GPT-5.6 Sol 上线 Ultrafast 模式预览版,底层硬件来自 Cerebras,推理速度达到标准模式的 14 倍,每秒最高输出 750 个 token。

速度到这个量级,业务直接落地。故障应急拼的是头几分钟,日志,代码变更,工程师报告一股脑喂进去,故障还没平息,根因分析和修复建议已经摆上桌。金融风控在行情跳动的当口就要识别可疑交易,等批处理跑完,损失早成定局。客服语音最吃响应时间,对话节奏一断体验就崩,多步查询和跨系统取数都得在用户察觉不到的时间里完成。电商的场景更细,顾客犹豫的几秒里实时回答商品问题、查库存和给替代款,弃单率就能往下压。
科研圈的变化最直接。以前跑一轮实验要等一整夜,第二天看结果,改方案,再排一晚。现在提出假设立刻见结果,当场调参数再来一轮,思路全程不断。实验节奏从按天计变成按小时计。
Ultrafast 目前是限量预览,OpenAI 圈了一批客户边跑边找答案。名单包括金融公司 Jane Street,客服公司 Podium,电商公司 Basis,金融研究公司 Rogo,一家对一类场景。Jane Street AI 助手团队的工程师 John Crepezzi 给出的评价是,Cerebras 带来的速度提升令人印象深刻,开发者能以更专注、更高效的方式与模型协作,他着重说的是协作方式变了,快只是顺带的结果。
OpenAI 工程团队在故障告警触发时,拿 Ultrafast 读日志,追调用链,整理上下文,从发现问题到验证修复方案的链路缩短一大截。研究团队用它加速知识检索和数据查询,原先必须过夜批跑的实验,现在一个工作日能迭代好几轮。这套方案由 OpenAI 和 Cerebras 联合推出,两家在超低延迟推理上的合作还会继续,眼下只对部分客户开放,产能爬坡后逐步扩圈。
智能换速度这道老题,跟着 Ultrafast 一起翻篇了。产品里所有为模型慢打的补丁,缓存策略,降级预案,拿小模型顶班的补偿逻辑,都该翻出来重审。等最强模型加上实时速度普及开,一批产品形态要回炉重造。我翻出两年前自己写的一份架构文档,里面三条 workaround 全是给慢模型打的补丁,看完那页我直接关了,八成要整页重写。