Anthropic 推出了 Claude Opus 5,这是一种新的人工智能模型,该公司表示,它可以提供近乎前沿的智能,而价格大约是其顶级 Fable 5 模型的一半。 Opus 5 于 2026 年 7 月 24 日发布,现已成为 Claude Max 上的默认模型,也是 Claude Pro 上可用的最强模型,将其定位为 Anthropic 的日常编码、自主代理和专业知识工作的主力。

此次发布恰逢企业正在审查人工智能支出之际。据 CNBC 报道,新模型“可与《神鬼寓言 5》相媲美,而且由于企业担心成本,因此价格更便宜”,而彭博社则将其描述为“对于日常任务而言更具成本效益的模型”。对于跟踪最新 AI 发展 的团队来说,Opus 5 代表着一种深思熟虑的赌注,即下一个竞争战场是价值,而不是原始基准霸权。

基准性能:编码和知识工作的最新技术

Anthropic 报告称,Opus 5 发布了编码和知识工作评估的最先进结果,包括 Frontier-Bench 和 GDPval-AA。该公司表示,在 Frontier-Bench v0.1 上,Opus 5 超越了所有其他型号,其性能是其前身 Opus 4.8 的两倍多,而且每任务成本更低。

根据 Anthropic 自己的基准测试,在 CursorBench 3.2 上,Opus 5 的得分与《神鬼寓言 5》的最高得分相差不到 0.5%,而每项任务的成本却只有《神鬼寓言 5》的一半。 Decrypt 指出,该模型“在大多数基准测试中都超越了《神鬼寓言 5》——而价格却只有《神鬼寓言 5》的一半。”

收益延伸到代理和解决问题的评估:

  • ARC-AGI 3: Opus 5 在这项新奇问题解决测试中的得分比次优模型高出大约三倍。
  • Zapier AutomationBench: 在相同成本下,通过率约为次佳模型的 1.5 倍,用于衡量端到端业务任务的完成情况。
  • OSWorld 2.0(计算机使用): Opus 5 以略多于三分之一的成本超越了《神鬼寓言 5》的最佳成绩。

值得注意的是,Anthropic 承认 Opus 5“在网络安全任务上仍然落后于 Mythos 5”,而在这一领域,竞争对手的前沿模型仍然保持着领先地位。

更强的代理和自我验证

公告中反复出现的主题是 Opus 5 验证自身工作和迭代直至成功的能力得到提高。 Anthropic 描述了早期测试中的几个例子,强调了这种自主性。

在一项 Frontier-Bench 任务中,模型获得了机器零件的绘图,并要求编写代码将其重建为 3D FreeCAD 模型,但故意不让其直接查看绘图。据报道,Opus 5 编写了自己的计算机视觉管道,从原始像素中提取几何图形,然后重建完整的部分,在五次尝试后没有任何竞争模型能够解决该任务的情况下屡屡取得成功。

鉴于流行的开源包管理器中存在真正的错误,Opus 5 找到了根本原因并修复了社区自己的补丁错过的边缘情况,而竞争模型仅修复了表面症状并宣布错误已解决。据报道,一家贸易公司的一名工程师使用 Opus 5 在单个会话中为新交易所构建了市场数据源——以前的模型根本无法完成这项任务——并且,由于没有找到实时数据源可供验证,因此该模型构建了自己的测试工具。

客户接待

抢先体验的合作伙伴提供了大部分积极的评价。 Cognition(Devin 编码代理的制造商)的首席执行官 Scott Wu 表示,Opus 5“以一半的成本达到了寓言级的性能”,并显示出“在困难的调试和根本原因分析任务上的特殊优势”。 Cursor 联合创始人 Sualeh Asif 表示,该模型“以 Opus 的速度和成本提供了接近《神鬼寓言 5》的智能”。

Zapier 首席执行官 Wade Foster 报告称,Opus 5“在 Zapier 的 AutomationBench 排行榜上名列前茅,而无需花费比之前的 Claude 模型更多的代币”,完成了端到端的完整客户流失预防工作流程 - 标记有风险的帐户,提醒正确的所有者,并为保留团队进行总结。以前的型号没有通过; Opus 5 达到 100%。

科学研究成果

Anthropic 还强调了 Opus 5 对科学工作的改进。该模型在 Anthropic 的每一项生命科学评估中都优于 Opus 4.8,涵盖结构生物学、有机化学和生物信息学。该公司指出,内部有机化学基准(从光谱数据推断分子结构)提高了 10.2 个百分点,蛋白质功能预测任务提高了 7.7 个百分点。一位基因组学客户将该模型描述为“更像一位细心的科学家”,进行正确的统计测试并交叉检查自己的结果。

定价策略

通过将 Opus 5 定价为与 Opus 4.8 相同的水平,同时接近 Fable 5 的智能水平,Anthropic 有效缩小了中端产品和旗舰产品之间的差距。 VentureBeat 将该版本描述为“一种更便宜的用于编码、代理和企业工作流程的人工智能模型”,Seeking Alpha 观察到 Opus 5“更接近前沿模型 Fable 5,而且更便宜”。该公司提供了一个可调整的“努力”设置,让客户可以用情报来换取速度和更低的代币成本,从而微调每个任务的性价比。

这对人工智能竞赛意味着什么

Opus 5 强调了近前沿人工智能成本下降的速度有多快。一种与现有功能最强大的系统相距不远的模型(代币价格的一半)迫使竞争对手证明溢价合理,以获得边际收益。随着 Anthropic、OpenAI、Google 和其他公司竞相打造价格足以满足日常大规模部署的模型,企业面临的问题正在从“哪种模型最聪明?”转变。到“哪种模型每美元提供的智能程度最高?”

对于 Anthropic 来说,传达的信息很明确:高端推理不再是奢侈品。 Opus 5 将前沿功能带到了一个价格点,使持续的日常部署变得现实——这可能被证明是所有细节中最重要的细节。

保持人工智能领先地位

Claude Opus 5 从今天开始可在 Claude Pro、Claude Max 和 Anthropic 的 API 上使用。有关这个故事和更广泛的人工智能领域的更多信息,请及时关注突发人工智能新闻

阅读更多人工智能新闻 →