8 月 13 日谷歌发布公告,Gemini 3.7 Flash 上线,我掐指一算离 3.6 Flash 才过去三周,上个月刚照着 3.6 的文档改过配置,翻的时候忍不住嘀咕,三周前那版配置改了个寂寞,这种更新速度放在一年前不可想象,现在却成了 Flash 系列的常态。
官方评测页我只看两个数
官方评测页上数据不少,但我看下来只盯着两个数:一个是 DeepSWE v1.1,从 49.0% 提到 65.3%,另一个是 AutomationBench,从 17.0% 提到 30.4%,FrontierCode 1.1 的 43.6% 当个参考就行,跟前一次差距不大。
后两个数跟选型直接相关,DeepSWE 面向软件工程任务,AutomationBench 面向自动化流程执行,它们都在测同一件事,就是模型能不能在长链条任务里从头撑到尾,这个比单点能力重要得多。
写几行演示代码跟这个不是一回事,一个片段正确就能交差,一个要求几十步保持状态不崩。后两项接近翻倍,Agent 这类用法的实用性确实上了一个台阶,对我来说,这意味着以前只能 demo 着玩的 Agent 工作流,现在真的可以塞进生产环境了。
API 和 Spark 共用一颗引擎
还有个细节容易漏掉:3.7 Flash 同时部署在两个位置,一边是开发者调用的 API,另一边是个人 Agent 产品 Gemini Spark,拿它当了新引擎,支持跨 Gmail、日历和文档执行多步骤指令,汇总上周邮件并生成待办清单这种跨应用任务就是典型用法。
核心模型共用,你在 API 上打磨的方案,跟十亿月活用户使用的引擎完全一致,行为一致性有保障,对做 Agent 应用的团队是好消息,这相当于谷歌替你做了大规模验证,减少了很多兼容性测试的麻烦。
年底前 API 半价
定价方面的动作更大:年底前 API 半价,输入 0.75 美元每百万 token,输出 3.75 美元每百万 token,我算了下,以前跑一个中等规模的 Agent 任务,token 成本可能占掉三分之一的预算,现在直接砍半。同档位别家都在卷性能,谷歌反手卷价格,先把开发者基数灌满,这个阶段赚装机量不赚单价,对初创团队和小项目是好事。
但价格低也有代价。更新节奏这么快,意味着你今天写死的版本号,下个月可能就显得老了,对那种需要长期稳定输出的业务来说,价格波动反而是次要的,版本漂移才是大头。
我写代码的人怎么看
三周一版加主动降价,谷歌在 Flash 线上拿更新节奏换市场份额,落到我身上,有两层意思。先说价格:这个档位的价格大概率还有下探空间,此刻锁死长期合约不明智,月活不大的项目可以先用着,等合约到期再换,没必要提前锁定。
另一层更要紧。模型选择写成配置项,别写死版本号,更新周期压到三周之后,硬绑版本等于埋雷,模型一换全线返工,多花点功夫做抽象,后面的路宽一大截。我建议把模型 ID、温度参数和最大 token 数这些都放到配置文件或者环境变量里,主逻辑只调用一个封装好的接口,这样 Gemini 升到 3.8 或者切到其他模型,基本改一行就完事。这条建议现在不听,三周后还得再听一遍。这条别省。