Claude Sonnet 5体验:Anthropic最具自主执行力的中端模型

6 月 30 日上线的 Claude Sonnet 5,Anthropic 的公告、安全评估和合作伙伴的反馈我翻了一遍,翻完的结论是,这个模型把能干完一整条任务的本事下放到了中端价位。定计划、使唤浏览器和终端,自主跑任务,这些事几个月前还得靠更大更贵的模型撑,现在这个价位的也有了。

Claude Sonnet 5

性能接近 Opus 4.8,价格低一档

性能这一块,Sonnet 5 摸得到 Opus 4.8,价格低一档。跟自家上一代 Sonnet 4.6 比,推理和工具使用,编程,知识工作这些核心维度全线往上走。差距最显眼的是两处评测:BrowseComp(代理搜索评测)和 OSWorld-Verified(计算机使用评测),中等努力档位已经领先,档位再往上拉,部分任务能追平 Opus 4.8。档位可调,成本和性能的平衡点自己定,白天跑批挂中档,关键任务临时拔高,不用整天供着旗舰。

这回真能一口气干完

合作伙伴的反馈挤在同一个点上:任务跑得完全程。有个测试者派了份两步的活,先更新 Salesforce 账户层级,再给企业联系人发公告,它一气呵成,换以前的 Sonnet 就卡半路了。还有个排 bug 的例子,它自己写复现测试和落修复,再把改动暂存起来验证 bug 确实会回来,一遍过。这种自己验证自己的动作,以前的中端模型基本做不出来。

Lovable 联合创始人 Fabian Hedin 给的数字是 22%,说的是最难任务上比 Opus 4.7 的提升,运行间方差更小、可靠性更高,这条我单独标了出来。他还补了句别的,一个模型得知道什么时候说不,这跟知道怎么构建同样重要。

安全评估:攻击没练过,防护偏宽松

预部署安全评估给的说法:Sonnet 5 整体比 Sonnet 4.6 更安全。拒恶意请求的能力更强,抗提示注入也更稳,幻觉和谄媚率都压低了,自动化行为审计的整体失分也少。网络安全那块有个反常识的细节:Anthropic 没刻意练它的攻击能力,Firefox 漏洞利用测试里它写不出完整能用的利用程序,表现远弱于 Opus 4.8 和 Mythos 5。整体风险低,它启用的安全防护也比 Fable 5 宽松,正常干活被拦的次数少。

价格和入口

每百万输入 token 2 美元、输出 10 美元,最初的促销价转成了永久价,API 模型名 claude-sonnet-5。全套餐都能用,Free 和 Pro 的默认模型就是它,Max,Team,Enterprise 这些高级套餐也能选。速率限制同步上调了,给更高努力档位吃掉的 token 留了余量。天天用 Claude Code 的程序员,多数场景够用,价格只有 Opus 的三分之一。

官方藏得很低调的账单细节

Sonnet 5 换了新分词器,同样的输入可能算出更多 token,倍数在 1.0 到 1.35 之间浮动,看内容类型。单价降了没错,但输入量大的场景,账单的实际降幅未必有想的那么美,算成本时记得把这条塞进公式。这细节官方放的位置很偏,我在文档里翻了一会儿才找着,替你们标出来。

合上文档前,我又核对了一遍价格:输入 2 美元、输出 10 美元。这个价配这个能力,用 Sonnet 4.6 的用户换过来的理由很足。唯一要盯的是月底账单,别只看单价,新分词器可能把 token 数顶上去。