Claude Opus 5 发布:接近旗舰性能的日常模型

Anthropic 于 7 月 24 日发布了 Claude Opus 5,这是 Opus 系列的最新旗舰模型。定价与 Opus 4.8 持平——输入 $5/百万 token,输出 $25/百万 token——但性能提升明显,在多项评测中接近 Fable 5 的水平,成本只有后者的一半。

性能亮点

基准测试的数据很直接。在 Frontier-Bench v0.1 上,Opus 5 超越了所有对手,在更低的任务成本下达到 Opus 4.8 两倍以上的得分。CursorBench 3.2 上开到最大 effort 时,它的分数只比 Fable 5 差 0.5%,而单次任务成本低了一半。ARC-AGI 3 这项评估模型解决新问题的测试上,Opus 5 的得分是次优模型的 3 倍。

OSWorld 2.0(计算机使用基准)上,Opus 5 在任何成本区间都是表现最好的。它在 Fable 5 最佳成绩的基础上更进一步,而成本只有后者的三分之一多一点。Zapier 的 AutomationBench 排行榜上,Opus 5 拿下了第一,而且没有花更多 token——它处理了一份原始的账户健康工作簿,从头跑完了整个流失预防流程。

Agent 能力

Opus 5 能更仔细地验证自己的工作。Anthropic 举了几个例子:一个 Frontier-Bench 任务要求它把一个机器零件的图纸重建为 3D FreeCAD 模型,但故意不提供直接查看图纸的方式。Opus 5 自己写了一套计算机视觉管线,从原始像素中提取了几何结构,然后重建了完整的零件。另一个任务中,它找到了一个流行开源包管理器的真实 bug 的根本原因,修复了一个社区补丁漏掉的边界情况。

Internal eval 显示,Opus 5 在 Agent 编程任务上比 Opus 4.7 提升了 22%,而且运行更稳定,每次推理的方差小了很多。

科学研究能力

在生命科学评测上,Opus 5 比 Opus 4.8 全面提升。有机化学任务提升最明显——从光谱数据推断分子结构这项上,比 Opus 4.8 高了 10.2 个百分点。预测蛋白质序列变异如何影响功能的任务上,提高了 7.7 个百分点。早期测试用户 Azalea 的 CEO 说 Opus 5 的行为"更像一个仔细的科学家"——它会主动选择正确的统计方法排除干扰,用独立方法交叉验证结果,长步骤分析也不会跑偏。

安全和部署

安全方面,Opus 5 没有推进危险的双重用途能力边界——在生物研究和进攻性网络安全上仍落后于 Mythos 5。它是 Anthropic 做过的最对齐的模型,宪法遵守度比 Opus 4.8、Sonnet 5 和 Fable 5 都好,欺骗行为率最低。

Opus 5 即日起在所有平台上可用。API 上以 claude-opus-5 名称调用,Claude Max 默认使用该模型,Claude Pro 上也是最强的可用模型。Fast 模式约 2.5 倍默认速度,价格为基础价的两倍。