OpenAI 把八成研究押给下一代,还在替 GPT-6 补短板

OpenAI 的研究重心,换了方向。

公司应用研究负责人 Boris Power 透露了一组数字。

大约八成到九成的研究,都投向了 GPT-7、GPT-8 和更往后的模型。

可眼下的 GPT-6,团队并没有放手。

合作栏目金句卡

九月刚过,这家公司先放出主打能力上限的 GPT-6 Astra。

九月二十二日,又快又省的 Sol 和 Luna 跟着上线。

一边把大部分精力押给下一代,一边还在给现役模型添柴。

这看起来有点矛盾。

两头都要顾。

于是有两个问题摆上桌面。

重心既然已经前移,手头的模型为什么还在优化。

想把模型越练越强,为什么又做更小更便宜的版本。

为什么还在补眼前的窟窿

用 Power 的话说,有些针对现役模型的投入,内部甚至叫作「极度短视」。

这类活能让团队今天迭代得更快,学到的也更多。

但长期的赌注,始终压在下一代身上。

合作栏目金句卡

这里要分清一件事。

一个今天值得做的优化,它的保质期有多久。

模型调用工具老出错,团队就收集数据、调整训练,把洞补上。

比如 AI编程 助手写错一段代码,就得回头补数据和训练。

每修好一处,对 AI工具 的用户就更好用一点,团队也多攒一份经验。

麻烦在于,下一代模型一出来,今天费力补的短板可能自动消失。

模型跑得越快,有些方案就越需要重新掂量。

但明天会过时,不代表今天能省。

用户现在就要用。

该补还得补。

对做 AI对话 产品的团队来说,这个判断尤其现实。

功能今天不稳,用户明天就走。

先练强模型,再教出小模型

既然大模型要做强,为什么还花力气做小模型。

在他的逻辑里,这两件事其实是一回事。

先练出一个能力很强的通用模型,再让它当老师,去教更小更专的模型。

他拿 Astra 和 Luna 举例,画出这条「先做强、再蒸馏」的路线。

合作栏目金句卡

这也解释了那八九成研究为什么押给下一代。

新模型既能自己解难题,也能当下一批小模型的老师,把能力搬进更便宜的产品。

蒸馏的常见做法并不复杂。

先让强模型生成示范,挑出高质量输出,再拿这些数据去训练轻量模型。

这套手法这家公司自己很熟。

2025 年 3 月发布音频模型时,团队就明说过靠蒸馏把大模型的知识传给小模型。

官方还讲过一个直观的例子。

让 GPT-4o 当老师。

去教一个更小的模型,根据葡萄酒信息判断葡萄品种。

在 300 条验证数据上,小模型的准确率从 64.67% 涨到 79.33%。

已经很接近老师的 79.67%。

蒸馏前后准确率对比

这只是单个任务的结果,不等于小模型全面追平。

学生也不必学会老师的全部本事。

只要在特定任务上够用,成本又降下来,这笔账就划算。

回到 GPT-6 家族,类似的能力迁移还在继续。

九月二十二日上线的两款新模型,主打更快更实惠。

据称它们用了相近的训练方法,把进步带给成本更低的模型。

新旧模型定价对比表

配方没有完整公开,也不能说它就是缩小版。

但方向很清楚。

大模型抬上限,小模型降门槛。

哪怕日常只用便宜模型,也可能间接受益于更强的研究成果。

大小模型怎么分工才划算

不是所有任务都值得动用最顶级的模型。

活有轻重。

一份工作里,有些环节要深度判断,有些只是把明确的要求执行到位。

让大小模型各接一段活,钱才花在刀刃上。

比如准备一次项目汇报。

几份材料说法不一,数据口径互相打架,结论也没想清楚。

这时可以让更强的模型先梳理逻辑、找出矛盾,指出还缺哪些证据。

等关键事实核实、方向定下来,后面的活就能交给小模型。

遇到材料解释不了的新问题,再请强模型回来。

大模型啃难题,小模型接住那些要求明确、反复要做的活。

具体怎么分,还得看模型在任务上的实际表现。

便宜当然有吸引力。

便宜不等于省。

可如果每次都得自己试模型、拆任务,省下的费用很可能又变成多花的时间。

合理的分工,是让小模型以低成本兜住日常工作,把难题留给需要判断的时刻。

这笔账最终要看整项工作的总成本,模型费用和人的时间都算进去。

算总账才准。

模型在进化,人的角色也在变

在他看来,这几代模型也在改变人的位置。

用 GPT-4 时,用户得精心设计提示词。

到 GPT-5,上手容易了,仍要不断反馈纠偏。

而到了第六代,它已经更像一个能接下目标、自己往前干的同事。

这只是他的判断,不能说所有任务都能彻底放手。

但公开材料里确实提到一些具体变化。

在写代码这类场景里,Astra 能一边向用户提问,一边继续处理不依赖回答的工作。

遇到重要决定,它会停下来等人拍板。

它还能在接到新要求时,记住原来的目标和约束。

这些变化没有跑分直观,却决定 AI 能不能从工具走向同事。

模型进化与角色转变示意图

背后考验的是自主推进任务、持续扛活的能力。

这不容易。

要记得住目标,推得动工作,也知道哪些决定必须请人拍板。

未来的 GPT-7、GPT-8 能把这种协作推到哪一步,还要看后续产品。

对用户来说,模型升级的价值要算一笔更实在的账。

交代完一个目标,还得替它拆多少步骤,催多少次进度,收多少烂摊子。

只有这些负担真的轻了,进步才算落到工作和生活里。