Claude Opus 5 发布

产品 · 公告 · 2026年7月24日

Claude Opus 5 今天正式可用。它是一个深思熟虑且积极主动的模型,以一半的价格接近 Claude Fable 5 的前沿智能水平。

Frontier-BenchGDPval-AA 等编码和知识工作评估上,Opus 5 成为新的 state-of-the-art,尽管在网络安全任务上仍落后于 Mythos 5。

Opus 5 专为日常使用而设计:它比其他模型工作效率更高。它是 Claude Max 上的新默认模型,也是 Claude Pro 上最强的模型。

---

性能与成本效益

Claude Opus 5 在与前代产品 Opus 4.8 相同的成本下提供了大幅提升的性能。本节中的图表显示了性能如何根据模型的努力程度设置而变化,客户可以使用该设置来优化智能或节省 token 以获得更快、更便宜的结果。

Opus 5 在有价值的软件工程任务上表现出色。例如,在 Frontier-Bench v0.1 上,Opus 5 超越了所有其他模型,并且以更低的单任务成本将 Opus 4.8 的性能提高了一倍以上。在 CursorBench 3.2 上,在最大努力程度下,该模型的表现与 Fable 5 的峰值得分相差在 0.5% 以内,但单任务成本只有一半;在高、超高和最大努力程度下,它在给定成本下也比所有其他模型实现了更高的性能。

Frontier-Bench v0.1 · CursorBench · AA Coding Agent Index

我们在知识工作和解决问题的任务上看到了类似的结果。例如:

  • ARC-AGI 3(一个模型必须解决新问题的评估)上,Opus 5 的得分是次佳模型的三倍。

  • Zapier AutomationBench(衡量模型是否能从头到尾完成业务任务)上,在相同的单任务成本下,Opus 5 的通过率约为次佳模型的 1.5 倍。即使在最低努力程度设置下,Opus 5 通过的任务也比任何其他模型都多。

  • OSWorld 2.0(一个计算机使用基准)上,Opus 5 在任何给定成本下都优于所有其他模型,仅以略高于三分之一的成本超越了 Fable 5 的最佳结果。

它在几个相关评估中也是我们最好且最具成本效益的模型:

ARC-AGI 3 · GDPval-AA v2 · OSWorld 2.0 · HLE · AutomationBench · DeepSearchQA

Opus 5 在科学研究方面相比 Opus 4.8 是有意义的改进。它在我们的每一项生命科学评估中都表现出比 Opus 4.8 更好的性能,这些评估涵盖结构生物学、有机化学和生物信息学等主题。它在有机化学任务上的改进最为显著,例如从光谱数据推断分子结构(在我们的内部基准上比 Opus 4.8 高 10.2 个百分点),以及在蛋白质相关任务上,例如预测蛋白质序列变异如何影响其功能(在这里高 7.7 个百分点)。

最后,Opus 5 能够产生更强大的视觉输出:

风洞 · 细胞构件

Opus 5 可视化了空气在空气动力学(和非空气动力学)物体上的流动。在这里尝试风洞中的不同设置。

Opus 5 构建了一个简化的、交互式的细胞插图。在这里探索其元素。

---

使用 Claude Opus 5

Claude Opus 5 在验证其工作和仔细迭代直到成功方面要强得多。在评估和早期访问测试中,我们和我们的用户发现了许多 Opus 5 的智能体能力和彻底性的例子:

  • 在一个 Frontier-Bench 任务中,Opus 5 被给予一个机械零件的图纸,并被要求编写代码将其重建为 3D FreeCAD 模型。然而,在这个任务中,模型被故意不给直接查看图纸的方法。Opus 5 的回应是编写自己的计算机视觉管道,从原始像素中提取几何图形,然后重建完整的机械零件。它反复成功地做到了这一点;在相同设置下,没有竞争模型在五次尝试后能够解决它。

  • 给定一个流行开源包管理器中的真实 bug,Opus 5 找到了根本原因并修复了社区补丁遗漏的边缘情况。一个竞争模型只修复了表面症状(而不是根本原因),然后报告 bug 已解决。

  • 一家交易公司的工程师使用 Opus 5 在一次会话中为新交易所构建了市场数据馈送。以前的模型根本无法完成这项任务,即使在工程师提供了广泛计划的情况下也是如此。由于找不到实时馈送进行验证,Opus 5 甚至构建了自己的测试工具来检查其代码是否正确解析了交易所的数据。

以下是我们早期访问客户关于使用 Opus 5 体验的进一步报告:

"在 FrontierCode 1.1 上,Claude Opus 5 以一半的成本接近 Fable 级别的性能。在 Devin 中,它在困难的调试和根本原因分析任务上也表现出特别的优势。"

— Scott Wu,首席执行官
"Claude Opus 5 以 Opus 的速度和成本提供接近 Fable 5 的智能。在 CursorBench 上,它略低于 Fable 5,并且有许多相同的行为。我们很高兴看到开发者如何在 Cursor 中使用它。"

— Sualeh Asif,联合创始人
"Claude Opus 5 在 Zapier 的 AutomationBench 排行榜上名列前茅,而没有比以前的 Claude 模型花费更多 token。它拿到一个原始的客户健康工作簿,并端到端运行了完整的客户流失预防序列:标记风险账户、提醒正确的负责人,并为留存运营总结。以前的模型没有通过;Opus 5 达到了 100%。"

— Wade Foster,首席执行官
"在我们的基因组学分析工作中,Claude Opus 5 比我们运行过的任何模型都更像一个细心的科学家。它选择正确的统计测试来排除混杂因素,通过独立方法交叉检查自己的结果,并在漫长的多步骤分析中保持正轨。"

— Alfredo Andere,首席执行官
"Claude Opus 5 在我们的内部评估中领先于其家族中的每个模型。它不仅在我们最难的智能体编码任务上更好(比 Opus 4.7 高 22%),而且更稳定,运行间方差小得多。对于 Lovable 上数百万的构建者来说,这种一致性就是全部。可靠的结果,一次又一次的构建。"

— Fabian Hedin,联合创始人
"Claude Opus 5 是自 4.5 以来 Opus 家族中最大的飞跃。在相同的全栈应用构建中,前端首先显示出来:我们从 Opus 模型中见过的最好的动画、游戏和 3D 工作。"

— Madhav Jha,联合创始人兼 CTO
"我们很喜欢 Claude Opus 5。对于我们的智能体处理的那种开放式分析工作,它是对 Opus 4.8 的严格升级,收益最大的地方恰恰是重要的地方:更难、更模糊的任务。回复更清晰、更简洁,我们在更高努力程度下也看到了效率的提高。"

— Izzy Miller,AI 研究负责人
"对于我们的分析师每天运行的金融研究工作流,Claude Opus 5 相比 Opus 4.8 是一个显著的改进。它在数字推理、表格工作和在精度重要时更敏锐的批判性思维方面脱颖而出。"

— Shirley Zhang,应用 AI 高级 AI 工程师
"Claude Opus 5 提供了专业企业内容分析所必需的行业智能和准确性。Box 发现 Opus 5 比 Opus 4.8 表现好 8%,并在技术、医疗保健和公共部门组织日常依赖的数据分析(提高 11%)和尽职调查(提高 17%)工作流中提供显著的性能提升。"

— Ben Kus,首席技术官
"Claude Opus 5 是从 Opus 4.8 明显的代际提升。一个周末,我让它在我的开发环境中担任参谋长角色:它构建了自己的监视器,驱动每个盒子,只在需要判断的时候才拉我进来。"

— Cristian Rivera,高级软件工程师

"Claude Opus 5 在我们的基础研究助手代码库中进行了大规模更改,在智能体工作流中适应反馈,并比我们使用过的任何模型都更清楚地解释其推理。它处理了我们通常会分解成更小片段的工作。"

— Conor Kiernan,首席技术官

"在我们一些最难的金融建模任务上,Claude Opus 5 在准确性和效率上都比 Opus 4.8 有明显提升。其性能下限实质性更高,特别是在深度金融领域逻辑上。在不同努力程度下,它平均准确率高 9 个百分点,轮次和工具调用减少三分之一,时间减少 60%。"

— Richard Pham,评估和产品负责人
"Claude Opus 5 像真正的前端开发者一样检查自己的工作。在我们的基准测试中,它在桌面和手机宽度的浏览器中打开页面,发现了隐藏在移动折叠下方的产品和屏幕外的结账按钮,并在交回工作之前修复了两者。"

— AJ Orbach,联合创始人兼首席执行官
"与以前的 Opus 模型相比,Claude Opus 5 在法律智能体工作上的性能明显提升,我们在公司治理和仲裁等实践领域看到了最大的收益。Opus 5 在较低推理水平下保持质量的能力也给我们留下了深刻印象,在最大推理下与 Opus 4.8 相比,平均少生成 26% 的 token 就能实现类似的性能。"

— Niko Grupen,应用研究负责人
"Claude Opus 5 对我们来说最大的收益是在更长期的工作上:构建完整的演示文稿,然后修改它。构件质量是决定我们发布哪个模型的因素,这是我们见过的最明显的进步——更好的视觉理解、更清晰的格式、更少的幻灯片问题。"

— Alex Wang,应用 AI

ESC

输入关键词开始搜索

支持搜索标题、内容、标签