产品 · 2026年6月30日
Claude Sonnet 5 旨在成为迄今为止最具智能体能力的 Sonnet 模型。它能够制定计划、使用浏览器和终端等工具,并以仅仅几个月前还需要更大、更昂贵模型才能达到的水平自主运行。
对许多开发者来说,智能体 AI 时代始于 Sonnet 级别的模型:Claude Sonnet 3.5、3.6 和 3.7 是首批在编码和工具使用方面展现出令人印象深刻技能的模型。不过最近,智能体能力最显著的提升出现在我们的 Opus 级别模型中。
Sonnet 5 缩小了这一差距:其性能接近 Opus 4.8,但价格更低。在智能体性能的重要方面——推理、工具使用、编码和知识工作——它相比前代产品 Sonnet 4.6 有了实质性提升:
Sonnet 5 在各种评估中的得分与 Sonnet 4.6 和 Opus 4.8(作为参考,这是一个更通用的模型)的对比。Claude Sonnet 5 系统卡详细报告了更广泛的评估结果。
我们的安全评估发现,Sonnet 5 的不良行为总体发生率低于 Sonnet 4.6,在智能体环境中使用通常更安全。评估还显示,其执行网络安全任务的能力远低于我们当前的 Opus 模型。
从今天起,Claude Sonnet 5 在所有套餐中可用:它是免费版和 Pro 套餐的默认模型,Max、Team 和 Enterprise 用户也可以使用。定价为每百万输入 token 2 美元,每百万输出 token 10 美元。开发者可以通过 Claude API 使用 claude-sonnet-5。
---
使用 Claude Sonnet 5
下图比较了 Sonnet 5 与 Sonnet 4.6 和 Opus 4.8 在智能体搜索评估 BrowseComp 和计算机使用评估 OSWorld-Verified 上不同努力程度下的性能。Sonnet 5(橙色线)是对 Sonnet 4.6(灰色线)的严格改进,比 Opus 4.8(黄色线)覆盖了更广泛的性价比选项。它在中等努力程度下提供了显著提升的成本效率;其更高努力程度的性能在某些任务上可以与 Opus 4.8 匹敌。在 Sonnet 5 和 Opus 4.8 之间,用户可以调整努力程度来找到成本和性能的适当平衡。
智能体搜索 · 智能体计算机使用
不同努力程度下的性价比曲线。之前最好的 Sonnet 模型(Sonnet 4.6)远不及 Opus 4.8。Sonnet 5 提供比 Sonnet 4.6 更广泛的性价比选项,在某些情况下达到 Opus 4.8 的能力水平。图表显示 Sonnet 5 的定价为每百万输入 token 3 美元和每百万输出 token 15 美元(现有标准定价)。Sonnet 5 的入门定价 2 美元/百万输入和 10 美元/百万输出此后已成为永久定价,因此其实际成本低于此处显示的价格。Opus 4.8 定价为 5 美元/百万输入和 25 美元/百万输出。xhigh = 超高努力程度。
不同努力程度下的性价比曲线。之前最好的 Sonnet 模型(Sonnet 4.6)远不及 Opus 4.8。Sonnet 5 提供比 Sonnet 4.6 更广泛的性价比选项,在某些情况下达到 Opus 4.8 的能力水平。图表显示 Sonnet 5 的定价为每百万输入 token 3 美元和每百万输出 token 15 美元(现有标准定价)。Sonnet 5 的入门定价 2 美元/百万输入和 10 美元/百万输出此后已成为永久定价,因此其实际成本低于此处显示的价格。Opus 4.8 定价为 5 美元/百万输入和 25 美元/百万输出。xhigh = 超高努力程度。
我们早期访问合作伙伴的反馈是一致的:Sonnet 5 比其前代产品更具智能体能力。测试者描述了它如何完成以前 Sonnet 模型会半途而废的复杂任务,如何在没有明确要求的情况下检查自己的输出,以及如何以有吸引力的价格点完成所有这些智能体工作:
"Claude Sonnet 5 为我们的智能体提供了强大的执行层,用于多步骤软件工程工作。它在混乱的技术环境中很好地处理持续编码、工具使用和调试,对于需要跟进和技术基础的工作流特别有用。"
— Zimu Li,技术人员成员
"我们交给 Claude Sonnet 5 一个两部分的工作——更新 Salesforce 客户层级、向企业联系人发送发布公告——它端到端完成了。这以前会在中途停滞。对于日常自动化来说,这是显而易见的选择。"
— Daniel Shepard,高级工程师
"Claude Sonnet 5 用更少的资源完成更多工作。相同的输出质量,更少的步骤。它也干净、一致地拒绝不安全的请求。在 Lovable,我们将强大的工具交到数百万构建者手中。一个知道何时说不的模型与一个知道如何构建的模型同样重要。"
— Fabian Hedin,联合创始人
"我们用 Claude Sonnet 5 测试了数十个最具挑战性的真实 PR,它自己将每一个都推进到经过测试、验证的结果——让我们的工程师专注于判断、决策和最终签署。"
— Yusuke Kaji,商务 AI 总经理
"我让 Claude Sonnet 5 调查一个 bug。它主动编写了重现测试,实施了修复,然后将其暂存以确认没有更改时 bug 会重现。所有这些都在一次通过中完成。"
— Neel Chotai,Rust 工程师和软件工程师
"使用 Claude Sonnet 5,智能体保持计划、遵循我们的约定,并以高效的成本交付干净的多步骤更改。"
— Sualeh Asif,联合创始人
"Claude Sonnet 5 在棕地代码(遗留代码)上表现最佳——竞争条件、隐藏测试、没人愿意触碰的部分。它将故障追踪到真正的根本原因,并交付持久的修复,而不是修补症状。"
— Dominic Elm,创始工程师
"Claude Sonnet 5 处于 Eve 原告律师任务的帕累托前沿。我们在法律研究和分析方面看到最明显的收益,性价比使迁移选择变得容易。"
— Mauricio Wulfovich,高级 ML 工程师
"ClickHouse 智能体探索实时数据并即时产生洞察,因此在测试新模型时,洞察时间很重要。Claude Sonnet 5 以更紧凑的步骤推理,让我们的用户明显更快地得到答案。这种速度是我们客户能感受到的差异。"
— Ryadh Dahimene,AI/ML 产品总监
"在 Pace,我们的计算机使用智能体运行保险工作流——提交录入、FNOL、损失运行——在我们运营团队已经使用的系统上。Claude Sonnet 5 始终采取正确的行动并快速完成,这正是真正的保险工作所需要的。"
— Eric He,技术人员成员
"对于管理高容量、复杂工作负载的企业团队来说,Claude Sonnet 5 代表了真正的进步——在关键领域表现强劲,具有使扩展切实可行的速度和成本配置。在几项复杂任务上,它超越了当前前沿,同时以低成本提供快速响应。对于大规模运营的企业来说,这是真正的运营胜利。"
— Ben Kus,首席技术官
"Claude Sonnet 5 处理了我们测试的全部编码任务,同时解决了更多问题。这对质量和效率都是有意义的改进。"
— Manav Khurana,CPMO
"Claude Sonnet 5 是一个强大的智能体编码模型,提供与 Opus 级别模型相当的顶级准确性,相比 Sonnet 4.6 有明显的阶跃式改进。它进行彻底的探索,并在复杂任务上明显更长时间地保持专注。"---
— Deepak Singh,Kiro 副总裁
安全评估
我们的部署前安全评估发现,Sonnet 5 总体上是对 Sonnet 4.6 的改进。在智能体安全方面,该模型更善于拒绝恶意请求和抵抗提示注入攻击中的劫持尝试。该模型的幻觉和逢迎率低于 Sonnet 4.6。在我们的自动化行为审计中(测试范围广泛的错位行为,如与滥用合作和欺骗),Sonnet 5 总体得分更低(即更安全)。然而,与能力更强的 Opus 4.8 和 Claude Mythos Preview 相比,它在此评估中确实显示出略高的错位行为率。
我们自动化行为审计中的错位行为率,该审计测试了许多情况和上下文中非常广泛的不良行为(完整列表和每个特定行为的结果见 Sonnet 5 系统卡 第 6.4 节)。Sonnet 5 的总体错位行为率低于 Sonnet 4.6,但高于 Mythos Preview 和 Opus 4.8。
我们没有刻意在网络安全任务上训练 Sonnet 5。它可以执行一些常规的、无害的网络任务,但在测试潜在危险网络技能(如开发软件漏洞利用)的评估中,其表现远低于 Opus 4.8 和 Mythos 5 等模型。下图显示了一项评估的分数,该评估测试了模型为 Firefox 浏览器中的漏洞开发漏洞利用的能力。Sonnet 5 从未能开发出完整的工作漏洞利用,但它确实显示出比 Sonnet 4.6 略高的部分成功率。后一个变化可能是由于通用智能的改进而不是特定训练。
衡量模型在 Firefox 147 中为软件漏洞开发漏洞利用的成功率的分数(此评估是与 Mozilla 合作开发的;所有漏洞已在 Firefox 148 中修补)。对于每个模型,左侧条显示模型(没有安全措施)开发工作漏洞利用的频率;右侧条显示模型部分成功的频率。两个 Sonnet 模型都无法成功开发工作漏洞利用(均得分为 0.0%);Sonnet 5 的部分成功率略高于 Sonnet 4.6。两个 Sonnet 模型的网络能力都远低于 Opus 4.8 和 Mythos 5。完整细节见 Sonnet 5 系统卡 第 3.2.4 节。
由于 Sonnet 5 在这些任务上比其前代产品略强,我们在发布时默认启用了网络安全措施。这些措施——实时检测和阻止危险的网络使用——与 Claude Opus 4.7 和 4.8 中存在的措施相同(因为我们判断 Sonnet 5 的网络安全风险总体水平较低,这些措施不如 Fable 5 发布时的措施严格,后者阻止了更广泛的网络安全任务)。¹
我们在 Claude Sonnet 5 系统卡中报告了对 Sonnet 5 在许多安全和能力评估中的完整评估。
---
可用性和定价
Claude Sonnet 5 今天在所有地方可用,价格为每百万输入 token 2 美元,每百万输出 token 10 美元²。我们提高了 Chat、Cowork、Claude Code 和 Claude Platform 的速率限制³,以适应更高努力程度下更高的 token 使用量;用户可以选择适合其特定项目的任何级别。