Claude Opus 5正式发布:编程能力翻倍,价格不到Fable 5一半

7月24日,Anthropic 把 Claude Opus 5 放了出来,我看完第一眼记住的不是分数,是价格:编程和知识工作这块它拿了当前最优,定价只有 Fable 5 的一半,花更少的钱拿接近顶级的智力,这句话在模型圈喊了半年,这次算是真兑现了。

Claude Opus 5 发布

我挑着看的几个数,都是自己用得上的

官方放出的基准一长串,我挑着看了几个自己真会用到的,Frontier-Bench v0.1 它把对手全压了一遍,成绩是上一代 Opus 4.8 的两倍还多,单个任务的成本反而更低,CursorBench 3.2 上开最高努力模式,跟 Fable 5 的峰值只差 0.5%,花的钱砍半。

再看更偏门一点的。ARC-AGI 3 测的是没见过的新问题,它拿了第二名的三倍分。Zapier AutomationBench 测端到端业务任务,通过率是第二名模型的 1.5 倍。OSWorld 2.0 里它用差不多三分之一的成本干翻了 Fable 5。有机化学比 Opus 4.8 高了 10.2 个百分点,蛋白质功能预测高了 7.7 个百分点,这些数字分开看各有出处,合起来就是一句话:这代模型不是某一项强,是全面往前挪了一格。

我更愿意看它实际干了什么

基准归基准,我更愿意看官方放出来的实际案例,有个 FreeCAD 3D 建模任务挺邪门:Opus 5 看不到图纸本身,它自己写了一套计算机视觉管线,从原始像素里把几何结构抠出来,硬是把机器零件重建出来了。竞争模型试了五次,一次都没成。

另一个案例是修开源包管理器的 Bug,它不光找到根本原因,连社区补丁漏掉的边缘情况都顺手补了,竞争模型修完表面症状就交差了。这种差距在真实项目里就是半夜要不要爬起来看日志的区别。

早期客户的反馈也能对得上,Devin 的 CEO Scott Wu 说,在 FrontierCode 1.1 上,Claude Code 里的 Opus 5 用一半成本接近了 Fable 级别的表现。Zapier 的 CEO Wade Foster 更直接:以前所有模型都没通过他们的自动化测试,Opus 5 上来直接拿了 100%。

我翻安全说明时只看了一条

Anthropic 在安全页写了不少,我看完只记住一条有用的:这代被诱骗滥用的概率比 Fable 5 低很多,正常使用里很少被安全分类器拦下来。对普通用户来说,发现能力强但利用漏洞能力弱,这个组合比什么都能干更让人放心,至少不会因为一句 prompt 被误伤。

价目表我算了下账

输入还是每百万 token 5 美元,输出 25 美元,跟 Opus 4.8 持平,API 模型名改成 claude-opus-5。赶时间可以开 Fast 模式,速度大概快 2.5 倍,价格是基准两倍,我算了算,只有真的火烧眉毛才值得开。

Claude Max 已经把它设成默认模型,Claude Pro 用户也能切过去用。还有两个小的 Beta 功能:对话中途换工具不会把 prompt cache 冲掉。被安全标记的请求会自动换别的模型处理,不用手动报错。

最后那个风洞演示我玩了一下

它能把空气流过物体的过程可视化出来,Anthropic 放了个互动演示,我拖了张机翼截面图进去,看它一点点把流场画出来。这个炫技成分多一点,但长时间跑任务的活儿里,这代的性价比是实打实的,不只是发布会上的漂亮话。