OpenAI 也走起了性价比路线。
9 月 23 日一早,硅谷热闹了两回。Anthropic 端出 Claude Opus 5.5。OpenAI 紧接着放出 GPT-6 Sol 与 Luna。和以往不同,这次圈里聊得最多的不是谁更聪明,而是谁更便宜。
Opus 5.5 比上一代便宜四成。GPT-6 Sol 下手更狠。性能对着上一代旗舰持平,价格直接砍半。每百万词元输入 2 美元,输出 10 美元。这一脚,看着已经踩进了 DeepSeek 的地盘。
但把价目表摊开对照,结论得改一个字。

这家公司砍掉的不是价格,是一个型号。
它原本的档位分三层:旗舰 Sol,中端 Terra,还有轻量 Luna。现在天花板换成了新名字,Sol 居中,Luna 垫底。中间那层 Terra,没了。
网友的玩笑很到位。Terra 不是消失,是往上挪了一格,变成了 Sol。便宜的是新牌子。
拿上一代 Terra 跟新 Sol 对一下。输入都是 2 美元,输出 12 美元对 10 美元。差的只有两美元。所谓腰斩,是拿新 Sol 去比老 Sol 算出来的。ChatGPT 这轮换挡,换的是名字,不是成本。

便宜是真的。但便宜的不是同一个东西。
三家账本摊开,含金量差得很远
同一天降价,三家的降法完全不是一回事。
Anthropic 最有诚意。Claude Fable 5.1 是它的天花板,专啃高难度推理。新版本在日常任务上基本追平。只在极深的逻辑推导和超大规模代码上,还差一截。花四成的钱,拿到八成能力。这笔账不难算。
更关键的是,它砍在了明处。长任务里最烧钱的隐形开销是思维链。模型会在自我纠错和反复推导中悄悄吃掉预算。它把缓存读取的费用降了 60%,深度思考的总成本跟着少了近六成。开发者这才敢频繁调用高阶推理。诚意看得见。
这家中国公司的绝对成本优势还在。闲时还能再减半。


真正容易看错的是轻量级战场。
单看高峰标价。Flash 版的输入费是 Luna 的 1.5 到 3 倍。输出费是 1.2 到 2.4 倍。账面数字上,这家反而更便宜。
问题是这两个东西不该放一起比。根本不是一个量级。Luna 是真正的小模型,参数可能只有十几亿。它干的是短文本过滤和分类这类简单活。Flash 的底层却是一个总参数 5520 亿的重型专家混合模型。编程和长文推理这些硬活,它都能接。
带着这种智商,只比 Luna 贵一点。这本身就是技术上的奇迹。
对做AI工具的人来说,光看标价会看错方向。这家公司敢把一个 5520 亿参数的模型卖到三毛钱。它靠的是非对称因果编解码架构,每次只激活一百多亿专家参数。算力损耗极低,调用量越大,调度优化越充分,成本优势越明显。不过它的低价有门槛,受错峰机制约束,还高度依赖前缀重复度。
它的便宜没有门槛。对中小开发者来说,这种省心反倒更值钱。
这家公司的打法更像商业套路。价格跳水靠两样东西:缓存命中打折,长文本加价。
先看折扣。缓存命中的输入价被压到一折,每百万词元只要 0.2 美元。这看着像让利,实际是一道生态围墙。大厂跑复杂的长程智能体任务,系统前缀往往极长。开发者为了吃到这一折,会把企业基础数据长期挂进它的缓存。想搬家时才发现,迁移成本高得动不了。门其实开在另一边。
再看加价。长文本一律涨价。只要输入超过 27 万词元,整笔请求的输入费就翻倍,输出费涨 1.5 倍。这暴露了它在长文本上的效率短板。它缺少更强的压缩技术,只能靠价格杠杆限制高消耗场景。需求被杠杆压住了。
同样是省钱,两家走了相反的路
DeepSeek 最早靠专家混合思路出圈。专家不必大,可以拆小,按需激活。总参数再大,每次推理只跑一小部分。到了 V4.1-Flash,这套思路做到了极致。预填充和解码交给不同模块非对称激活,实际动用的参数只有八十亿到一百六十亿。
省下来的大头在缓存上。早期的多头潜在注意力把缓存拆成内容与位置两部分,分别压缩存储。后来的压缩稀疏注意力又叠上稀疏编码与全局摘要。每个词元的缓存,压到了约 3560 字节。
再往后是第二代压缩稀疏注意力,从三个方向继续挤水分。层与层之间共享中间特征,不必各存一份完整缓存。数据落到极低精度格式存储,体积再降一截。滑动窗口的注意力机制配上边界重放。读取时只调用需要的片段,不必整块搬。
几层叠下来,全局缓存降到每个词元约 890 字节。这个体积只有标准架构的 2% 左右。打比方的话,原本一沓打印纸,现在压成了一张便签。这张便签还能反复用。
万卡级集群的调度也被榨过一遍。显卡的闲置时间和闲置空间几乎被吃干,连主机内存和周边总线都被拉进流水线协同干活。
另一家走的是相反的路。它尽量不动架构,靠工程优化挖效率,用商业规则控成本。
它没有跟进细粒度的专家拆分。那会打破已经规模化、跑得很稳的训练计算图体系。它选的是参数蒸馏与稀疏化重构,把上一代里部分冗余的稠密层拆成更轻的分支。框架不动,单次推理的浮点运算量却能降下来。
长上下文的显存压力,它用阶梯定价绕开。27 万词元以内靠虚拟内存技术消化。超过的部分强制调度到显存更大的节点,计费直接翻倍。这一招很务实。
真正的核心藏在提示缓存里。一家把缓存做小,另一家把缓存用满。
为了榨干缓存价值,它一边拉高命中率,一边延长缓存寿命。过去把模型从简单模式切到深度推理模式,前面算好的前缀缓存就作废了。现在支持动态调档,旧缓存能跨模式反复使用。缓存最短有效期拉长到 30 分钟,命中就一折。它还开放了显式断点,开发者能自己划定哪部分内容进缓存。配套工具还能诊断为什么没命中。
最狠的是预热。用户的请求还没发出来,系统已经把固定的系统提示和工具定义算好等着。连图片输入和结构化输出格式,只要前缀一致也能命中。这层最省事。
效果直接写在账单上。头部团队的实测里,交互式代码场景需要重新处理的词元砍掉一半以上。企业级智能体那边,原本 85% 的缓存命中率被继续拉高并稳住。账上看得出来。

「奥圣」上位,成色得打个问号
过去两年,性价比这个词一直属于 DeepSeek。梁文锋用两代架构把价格打穿地板,被网友封为「梁圣」。
这波降价之后,网上开始喊「奥圣上位」。喊声不小。
只是这位新晋选手的上位成色,多少得打个问号。它讲的性价比故事,一半靠换标,一半靠缓存折扣。两者都建立在同一个前提上:用户不细看价目表。
对天天要算调用成本的人来说,这道题不轻松。
巨头开始比价格,比的其实是身后的家底。万卡集群和自研架构缺一样,账就撑不住。那些两样都没有的玩家,下一轮很难再坐上牌桌。
Claude Code会员中转站 微信:douhanq
