Anthropic 发布了 Claude Sonnet 5,称其为该公司打造的最具代理性的 Sonnet 级模型。新模型于 2026 年 6 月 30 日推出,可以制定计划、使用浏览器和终端等工具,并以几个月前需要更大、更昂贵的模型的水平自主运行。此次发布之际,整个人工智能行业都在竞相将聊天机器人转变为能够代表用户行事而不仅仅是回答问题的智能代理。

对于追踪最新发展的开发人员来说,这一消息为一系列重塑竞争格局的人工智能突发新闻增添了新的内容。 Anthropic 将 Sonnet 5 定义为代理功能最终达到中等价格的时刻,这一转变可能会改变团队对自主工作流程的预算方式。

媲美旗舰的性能

据 Anthropic 称,Sonnet 5 缩小了中档 Sonnet 系列与该公司顶级 Opus 型号之间的差距。它的性能接近 Opus 4.8,但价格却低得多,并且在推理、工具使用、编码和知识工作方面比其前身 Sonnet 4.6 有显着改进。

Anthropic 发布了成本性能曲线,在两项代理评估中将模型与 Sonnet 4.6 和 Opus 4.8 进行了比较:BrowseComp(测量代理搜索)和 OSWorld-Verified(测试计算机使用情况)。该公司表示,Sonnet 5 提供了比 Sonnet 4.6 更广泛的性价比选项,并且在更高的工作量水平下,在某些任务上可以与 Opus 4.8 相媲美。

针对代理商的激进定价

定价是宣传的核心。 Claude Sonnet 5 推出时,介绍性定价为每百万输入代币 2 美元,每百万输出代币 10 美元,截止日期为 2026 年 8 月 31 日。在此窗口期之后,价格将升至每百万输入代币 3 美元,每百万输出代币 15 美元。

相比之下,Opus 4.8 的定价为每百万个输入代币 5 美元,每百万个输出代币 25 美元。由于代理在推理和调用工具的多个步骤中会消耗大量代币,因此价格差距对企业预算非常重要。 Anthropic 引用的早期访问测试人员描述了 Sonnet 5 完成了以前的 Sonnet 模型会停止的复杂任务,并在没有明确询问的情况下检查自己的输出。

每个计划的可用性

从发布之日起,Claude Sonnet 5 就适用于 Anthropic 的所有计划。它是 Free 和 Pro 用户的默认模型,并且可供 Max、Team 和 Enterprise 客户使用。开发人员可以使用模型标识符“claude-sonnet-5”通过 Claude API 以及 Claude 代码和 Claude 平台访问它。

此次广泛的推出值得注意,因为它将强大的代理性能交给了免费用户,而不仅仅是付费企业客户。 Anthropic 表示,Sonnet 系列历来是许多开发人员的代理时代开始的地方,并指出 Claude Sonnet 3.5、3.6 和 3.7 是第一个显示出强大编码和工具使用技能的模型。

内置安全故事

安全是该公告的关键部分。 Anthropic 表示,其评估发现 Sonnet 5 的不良行为率总体低于 Sonnet 4.6,并且在代理环境中使用通常更安全。该公司还指出,该模型执行网络安全任务的能力比当前的 Opus 模型低得多,这是一种经过深思熟虑的设计选择,即使在总体能力提升的情况下,也能降低误用的风险。

与模型一起发布的 Claude Sonnet 5 系统卡详细报告了更广泛的评估集。随着美国和欧洲监管机构审查前沿模型的发布,Anthropic 将安全测试的透明度定位为竞争优势。

更广泛的代理时刻

该产品的推出是在激烈的竞争中进行的。 OpenAI、谷歌和一批快速发展的中国实验室等竞争对手都在推动能够采取多步骤操作而不是简单生成文本的模型。通过以 Sonnet 的价格提供与 Opus 相邻的代理能力,Anthropic 押注下一个战场不是原始基准分数,而是在长期、复杂的任务中可靠运行代理的成本。

随着介绍性定价锁定到 8 月底,开发人员现在有一个窗口,可以在更高的费率生效之前针对其最苛刻的代理工作负载对 Sonnet 5 进行压力测试。

保持人工智能领先地位

模型发布的步伐没有放缓的迹象。如需持续报道新产品发布、融资轮次和政策转变,请访问 AI Buzz Wire 了解最新的人工智能发展动态。

阅读更多人工智能新闻 →