GPT-6 Sol 与 Luna 发布:接口价格砍半,OpenAI 开始贴身拼低价

等了两周,新模型终于落地。

这次来的不是旗舰,是两款走量的型号。一个叫 GPT-6 Sol,一个叫 GPT-6 Luna。

价格比能力更先被人注意到。输入和输出都往下砍了将近一半。幅度不算小。

Luna 每百万词元输入 0.1 美元,输出 0.5 美元。折合人民币约 0.7 元和 3.5 元。

OpenAI 官方账号宣布 GPT-6 Sol 和 Luna 加入 GPT-6 家族

拿来对照的是 DeepSeek。它那款轻量模型在闲时缓存未命中时,输入每百万词元 1 元,输出 4 元。高峰期会涨到 2 元和 8 元。

DeepSeek 平台的模型列表与接口配置页

按普通新请求算,Luna 已经更便宜。它也没有峰谷定价。成本不会随时段跳。

对手手里还有一张牌。闲时缓存命中的输入只要每百万词元 0.02 元,比 Luna 低得多。

综合能力也更强。它有 100 万词元上下文,支持图文理解、工具调用和思考模式。

但在缓存未命中的普通请求里,Luna 已经先一步挤进了同一个价格区间。国产模型最有辨识度的低价标签,从此刻多了一个对手。

降价对天天泡在AI工具里的人最直接。省下的钱,能换成更多调用量。

旗舰管上限,这两款负责抢市场

月初发布的旗舰款,是这家公司眼下能力最强、对齐程度也最高的一款。它面向高难度任务。代价是每百万词元输入 10 美元,输出 50 美元。这个价位很难成为日常默认选项。

Sol 和 Luna 要干的是另一件事。

两款新模型沿用了和旗舰相近的训练方法。上一代在专业工作和事实准确性上的进展,会被带到更快、更便宜的产品层级。编程和电脑操作上的改进也一样。

定价有点出乎意料。

Sol 的上一代在促销期是每百万词元 4 美元输入、20 美元输出。现在降到 2 美元和 10 美元。Luna 从 0.2 美元和 1.2 美元,降到 0.1 美元和 0.5 美元。

GPT-6 API 新旧价格对照表

对做AI编程的人来说,这一栏比榜单排名更有意义。同样一段活,成本直接决定它能不能天天跑。

对于这波降价,这家公司归因于推理基础设施和缓存效率的改善。说法是为了直接让利用户。

CEO 奥尔特曼随后强调,真正重要的指标是完成一项任务要花多少钱。按他的说法,这个维度上没有产品能跟这两款模型比。

奥尔特曼关于按任务计费的推文

产品分工也清楚了。旗舰继续负责能力上限。

Sol 面向需要较强推理、编程和智能体能力的主流专业任务。Luna 用极低价格承接高频和规模化的工作。

争夺的重点也变了。从榜单上的最高分,转到每一美元能完成多少工作。

公布的成绩里,标准款的优势集中在专业工作和智能体任务上。在覆盖销售和营销等职能工作流的一项横评中,它用最高推理强度拿到 33.2%。同榜的对手旗舰在最强设置下是 26.9%。而它的单任务成本只有对方的 9%。成本才是关键。

AutomationBench 各模型成绩对比

它还超过了低推理强度的自家旗舰。成本远低于对手,分数反而更高。

GPT-6 Sol 在 AutomationBench 的得分与单任务成本

另一项评测覆盖 55 个细分行业。考的是长链路、有实际经济价值的专业任务。这款标准款在最高推理强度下得到 56.4%,超过对手在该评测的最好成绩。单任务成本低了约 60%。

Agents' Last Exam 各模型成绩对比

事实准确性也有改善。这家公司拿用户曾标记过错误的匿名真实对话做内部测试。新模型的错误数量约为上一代的一半,开始接近自己的旗舰。

困难提示词下的事实错误率对比

低价那款在较高推理强度下,用大约百分之一的成本追平了上一代的旗舰。

编程和电脑操作都更强,也开始卷低价了

编程是标准款最重要的场景之一。

这家公司披露,内部研究人员用编程智能体的规模在快速涨。按接口价格算,中位数研究人员每天消耗的词元价值已经超过 600 美元。第 90 百分位的那批人超过 7000 美元。智能体接的任务越长,推理成本对使用频率的限制就越明显。

在考察代码能否直接合并进真实项目的一项测试里,它相比上一代进步明显。用更低的成本,追平了对手的最高设置。

FrontierCode 各模型成绩对比

在真实代码库的软件工程测试中,它最高推理强度得分 68.8%。距对手的最好成绩只差 1.1 个百分点。差得很少。单任务成本约低 80%。国产那款轻量模型在同一项上拿到 74.2%。

DeepSWE v1.1 各模型成绩对比

低价那款在同一评测中得到 66.6%,与对手的中等推理强度表现相近。任务成本却低了 93% 和 96%。

它未必扛得住最复杂的软件工程项目。但在代码检查、批量修改和轻量开发这类场景里,会是个更经济的执行模型。

电脑操作方面,自家旗舰仍是最强的选择。两款新模型把成本效率往前推了一步。

在一项桌面操作离线测试里,标准款的成绩与对手的中等设置基本相当。差得不多。单任务成本低约 80%。低价那款最高推理强度的成绩超过上一代旗舰的中等设置,成本只有后者的十分之一。

OSWorld 2.0 离线测试成绩对比

模型的交流方式也继承了旗舰的调整。新模型会少用术语和古怪措辞,砍掉价值不高的细节。回答整体略短。它还会更清楚地说明自己检查过什么、没检查过什么。

对需要连续协作的编程和技术任务来说,表达可不可靠越来越要紧。它和单次回答漂不漂亮,差不多一样重要。

模型发布之后,网友的首批实测很快出来了。评价分成两派。

一位提前拿到试用的开发者说,上一代要花一小时的任务,现在常能在二十分钟内做完。词元消耗还不到原来的一半。

开发者 Flavio Adamo 的试用反馈推文
GPT-6 Sol 生成的威尼斯运河快艇游戏画面

我们用标准款实测威尼斯运河快艇游戏时,它最终交付了一个可以直接玩的成品。桥洞闯关能玩,倒计时也在跑。航迹尾流、水面反射和追逐镜头都没有掉链子。审美还挺在线。

模型自行检查游戏页面渲染与操控的录屏

另一组 3D 火箭发射的对比测试,更直接地展示了价格差距。

Bridgebench 关于 3D 火箭发射测试的推文
Bridgebench 四模型同提示词结果对比

视觉质量上的结论就没那么乐观了。

有人用同一个提示词让两款模型搭建纽约街景。对手更完整地呈现了街道和出租车,还补上了屋顶、布鲁克林大桥和中央公园这些细节。它的结果更接近静态画面。镜头移动和持续渲染都缺了。

GPT-6 Sol 与 Claude Opus 5.5 的纽约场景对比

第二轮同提示词测试里,结论还是一样。对手的视觉品味和设计完成度明显更高。

Bridgebench 认为 Opus 5.5 设计完成度更高的推文
两个模型同题出图过程的对比视频片段

不过看看对手的接口价格,这件事就没什么好挑的。性能、价格和速度本来就是个不可能三角。这两款新模型的卖点,是用可接受的能力换数量级上的成本和速度优势。

追求单次最佳效果的创意任务,高价的那家仍然更有吸引力。需要同时派出大量智能体、反复迭代或者长期运行的工作流,价格优势会迅速累积。

国产模型的价格护城河,等来了挑战

一家独立评测机构给出了更克制的观察。结论很直接。

它的智能指数和编程智能体指数显示,新模型的总体智能水平和上一代大致持平。有些项目进步,有些回退。真正明显的变化来自成本。

按这家机构测算,标准款完成一次智能指数任务约花 1.06 美元。上一代要 1.99 美元,低了将近一半。低价那款约 0.07 美元,比上一代的 0.18 美元低约 60%。

两款模型的输出词元用量反而略有增加。标准款从约 2.9 万升到 3.1 万,低价那款从 4.1 万升到 5.1 万。价格下降仍然抵消了用量增长。账还是划算的。

Artificial Analysis 智能指数对比

单价之外,提示词缓存也更新了。系统会提高默认缓存命中率,让智能体更充分地复用已有上下文。缓存输入读取可以拿到 90% 的折扣。

开发者现在能在控制台看到缓存比例和变化。也能查哪些提示词没命中缓存。

推理强度和可用工具可以在对话中途调整,调整时保留此前上下文的缓存。新的显式断点让开发者决定提示词前缀在哪里结束,方便优化复用范围。

对一直要读取代码库和历史对话的智能体来说,缓存省下的钱可能比公开单价下降更重要。

另外,两款新模型从今天起登陆 ChatGPT 的工作入口和 Codex。付费的各档订阅用户都能先用上。

OpenAI 官方发布 GPT-6 Sol 和 Luna 的页面

免费档可以在桌面应用里用低价那款。

它们暂未进入普通对话入口,权限会在当天逐步开放。按以往节奏,Codex 放得更快一些。接口用户已经可以调用新模型了。

ChatGPT Work 里的模型选择与插件界面

这家公司的产品负责人还宣布,几档付费账户会拿到一次预存额度重置。订阅用户能在现有周期里多用一轮。

OpenAI 产品负责人 Tibo Sottiaux 的发布推文

旗舰发布时,展示的是能力能顶到多高。新模型上线之后,话题换成了智能密度的经济效益。

一边是低价款的普通输入输出价格进入了国产轻量款的区间。两者的价格鸿沟明显缩小。

GPT-6 Luna、GPT-6 Sol 与 DeepSeek 的价格对照

另一边,这家公司背后还有一套更完整的产品体系。ChatGPT 的工作入口、Codex 和接口都在里面。价格接近之后,产品入口、工具支持和开发者生态都会重新影响选择。

国产模型用低价让整个行业重新算过词元的价值。算得很细。这边则把压力带进了全球前沿模型的核心战场。接下来,低价不再是某一家公司的招牌。它会成为所有头部模型都绕不开的必答题。

Codex安装汉化 中转站 微信:douhanq