2026年7月24日,Anthropic正式推出了Claude Opus 5。这款新模型在编程和知识工作领域拿下了当前最优成绩,而价格只有Fable 5的一半。简单来说,你花更少的钱,就能拿到接近顶级模型的智力水平。

核心性能:编码和知识工作全面领先
Opus 5在Frontier-Bench v0.1测试中超越了所有对手,成绩是上一代Opus 4.8的两倍多,而且单个任务成本更低。在CursorBench 3.2上,最高努力模式下与Fable 5的峰值只差0.5%,但成本减半。
除了编码,Opus 5在多个维度都有亮眼表现:
- ARC-AGI 3(新颖问题解决):分数是第二名的三倍
- Zapier AutomationBench(端到端业务任务):通过率约为第二名模型的1.5倍
- OSWorld 2.0(计算机使用):以约三分之一的成本超越Fable 5
- 有机化学:比Opus 4.8高10.2个百分点
- 蛋白质功能预测:比Opus 4.8高7.7个百分点
实际使用表现:更像一个靠谱的同事
Anthropic分享了三个实际案例来展示Opus 5的代理能力。其中一个让人印象深刻:在FreeCAD 3D建模任务中,Opus 5无法直接查看图纸,于是自己写了一套计算机视觉管线,从原始像素中提取几何结构,成功重建了机器零件。而竞争模型尝试五次都没搞定。
还有一个案例是修复开源包管理器的Bug——Opus 5找到了根本原因,还修了社区补丁遗漏的边缘情况。竞争模型只修了表面症状就交差了。
早期客户反馈也很积极。Devin CEO Scott Wu表示:”在FrontierCode 1.1上,Claude Code Opus 5以一半的成本接近了Fable级别的表现。”Zapier CEO Wade Foster则说之前的模型都没通过自动化测试,Opus 5直接拿了100%。
安全与对齐:迄今最佳
预部署测试中的自动化行为审计显示,Opus 5是迄今为止对齐程度最高的Anthropic模型。它的欺骗性行为发生率最低,最难被诱骗滥用,在避免不可逆后果的鲁莽行动方面也是最安全的。
网络安全方面,Opus 5在发现漏洞的能力上接近Mythos 5,但在实际利用漏洞方面仍大幅落后。网络安全分类器的干预频率比Fable 5低约85%,意味着正常使用中很少被拦截。
定价与可用性
Opus 5定价与Opus 4.8相同:每百万输入token $5,每百万输出token $25。API模型名为claude-opus-5。Fast模式速度约为默认的2.5倍,价格是基准价的2倍。
这款智能体模型已经在Claude Max上成为默认模型,Claude Pro用户也可以使用。同时推出了两个Beta功能:对话中工具变更(不使prompt cache失效)和自动回退(被安全标记的请求自动路由到其他模型)。
值得关注的视觉能力
Opus 5还展示了视觉输出能力——它可视化了空气流经空气动力学物体的流动过程。Anthropic提供了一个风洞互动演示,用户可以在其中体验不同设置下的气流模拟效果。
从整体来看,Opus 5的发布标志着Anthropic在性价比和安全性上迈出了一大步。对于需要长时间运行的AI工具任务,这款模型值得认真考虑。