Claude Sonnet 5体验:Anthropic最具自主执行力的中端模型

2026年6月30日,Anthropic发布了Claude Sonnet 5。这款模型定位很明确:做最能自主干活的Sonnet。它可以制定计划、使用浏览器和终端等工具、自主运行——这些能力在几个月前还需要更大更贵的模型才能实现。

Claude Sonnet 5

Sonnet 5到底强在哪

先说结论:Sonnet 5的性能接近Opus 4.8,但价格便宜不少。跟上一代Sonnet 4.6比,在推理、工具使用、编程和知识工作这几个核心维度上都有大幅提升。

在BrowseComp(代理搜索评测)和OSWorld-Verified(计算机使用评测)中,Sonnet 5在中等努力档位下的性价比优势非常明显。如果开到更高努力档位,部分任务甚至能追平Opus 4.8。用户可以根据实际需求在成本和性能之间找到平衡点。

早期测试者的真实反馈

不少早期合作伙伴已经上手体验了Sonnet 5,反馈集中在”能端到端完成任务”这一点上。

有测试者让Sonnet 5处理一个两步任务——更新Salesforce账户层级、然后给企业联系人发送发布公告——它一口气做完了,而之前的Sonnet模型会卡在半路。还有人让它排查一个Bug,它主动写了复现测试、实现了修复,然后暂存改动确认Bug确实会回来,全程一次通过。

Lovable联合创始人Fabian Hedin的评价很有代表性:”Sonnet 5在最难的任务上比Opus 4.7提升了22%,而且运行间方差更小、可靠性更高。我们把强大的工具交给了数百万构建者,一个知道什么时候该说不的模型,和知道怎么构建的模型同样重要。”

安全性也有提升

预部署安全评估发现,Sonnet 5在整体上比Sonnet 4.6更安全。它在拒绝恶意请求和抵抗提示注入攻击方面表现更好,幻觉和谄媚率也更低。自动化行为审计中,Sonnet 5的整体失分低于Sonnet 4.6。

网络安全方面,Anthropic没有刻意训练Sonnet 5的网络安全能力。在Firefox漏洞利用测试中,Sonnet 5无法开发出完整的可用漏洞利用程序,表现远弱于Opus 4.8和Mythos 5。正因为整体风险低,Sonnet 5启用的安全防护比Fable 5要宽松不少。

定价与可用性

Sonnet 5定价为每百万输入token $2,每百万输出token $10(最初的促销价现已转为永久价格)。API模型名为claude-sonnet-5

这款模型已经在所有套餐中可用:Free和Pro套餐的默认模型就是它,Max、Team和Enterprise用户也可以选择使用。Anthropic同时提升了各平台的速率限制,以适应更高努力档位带来的更多token消耗。

对于日常开发中使用Claude Code的程序员来说,Sonnet 5是一个兼顾性能和成本的实用选择。它不是最强的模型,但在大部分场景下足够好用,而且价格只有Opus的三分之一。

一个值得注意的细节

Sonnet 5使用了更新的分词器,这意味着同样的输入可能会映射到更多token(大约1.0-1.35倍,取决于内容类型)。虽然单价更低,但如果你的输入量很大,实际账单可能没有想象中降那么多。这一点在评估成本时需要考虑进去。

总体来看,Sonnet 5填补了Sonnet系列和Opus系列之间的能力鸿沟。对于那些觉得Opus太贵、又对Sonnet 4.6能力不够满意的开发者,这版Sonnet值得切换试试。