GPT-5.6 这轮发布,我作为开发者最大的感受是,做智能体的成本逻辑变了。官方说得很直白,这个模型家族把前沿级智能体能力做到便宜得明显,性能边界还往前推了一步,以前只有旗舰模型能干的事,现在换更小的模型、更低的推理档位就能拿下。

低推理档位是最意外的。在 Agents’ Last Exam 基准上,GPT-5.6 Sol 用 low 档跑赢了 GPT-5.5 用 high 档的成绩,以前需要拉满推理的场景,现在降一档甚至两档就够。AI 研究公司 Hex 把 5.6 接进他们的 harness 后也有同感,低推理档位直接给出最好结果,它知道数据什么时候不在那里,不会追错误线索,用更少的 token 就找到正确答案,这个反馈当时让我挺意外,毕竟按以前的思路,这种事怎么也得把推理档位拉满。
模型选择上,Luna 和 Terra 能平替旗舰。文档处理公司 Hypha 实测,Luna 保持 GPT-5.5 约 98% 的信息抽取准确率,成本只有后者的十八分之一。另一个对比更直观,BrowseComp 基准上,三个月前 GPT-5.5 拿 84.36% 花了 33.27 美元,GPT-5.6 Luna 拿 84.04% 只花 1.33 美元,性能几乎持平价格掉了二十多倍。所以高并发和低延迟的活儿,还有智能体里的重复环节,优先考虑 Terra 或 Luna 这类小模型就对了,这组数据我盯着看了两遍,性价比差距不是一点点。
光靠模型还不够。这次还给 Responses API 加了三组能力。一是推理持久化加原生压缩,推理过程跨轮次保存,长对话不用每次重拼上下文,在 ARC-AGI-3 上,Sol 从标准 harness 的 13.3% 跳到 38.3%,输出 token 还少了约六倍。二是原生多智能体编排,主智能体把任务拆给子智能体并行处理,ultra 能力档位底层就是这套机制,而且行为可调,你可以显式告诉它什么时候才允许派生子智能体。三是程序化工具调用,让模型直接写 JavaScript 编排工具,过滤、汇总加编排这类确定性工作交给代码,上下文窗口不再被中间结果塞满,金融研究公司 Rogo 用上后输入 token 少了 21%。

Prompt 缓存也升级了,整个 5.6 家族 TTL 最少 30 分钟,缓存断点可以在上下文窗口内确定性设置。AI 工程公司 Ploy 在共享的 29000 token 提示词里加了缓存断点和按工作区分的 key,未缓存输入直接砍掉 28%。这数字很实在。
整体看下来,最值得注意的不是某个单一数字,是构建智能体的经济学真的变了。会选模型、会用新 API,比无脑上旗舰省得多,GPT-5.6 把工具备齐了,接下来就看怎么用。