Anthropic 于 2026 年 9 月 1 日推出了 Claude Fable 5.1 和 Claude Mythos 5.1,介绍了该公司所谓的世界上最先进的编码和知识工作模型,并初步了解了人工智能系统将如何为科学研究做出贡献。该公告发布在 Anthropic 网站上,同时还进行了一系列定价和数据处理更改,这些更改直接响应客户对成本、隐私和保障措施的反馈。
这次不同寻常的双名称发布反映了具有两种保护配置的单一基础模型。 Fable 5.1 通常可供所有用户使用,而 Mythos 5.1 则保留给 Anthropic 的可信访问计划,其保护措施专门设计用于支持网络安全和生命科学领域的工作。同一天,AWS 在其平台上发布了一篇题为“在 AWS 上介绍 Claude Fable 5.1”的发布文章,确认《神鬼寓言 5.1》已在其平台上可用,该消息登上了 Hacker News 的榜首,在发布后几个小时内就获得了 600 多个点。有关此故事的更多背景信息,请参阅我们正在进行的突发人工智能新闻 报道。
降价和数据保留让步
对于大多数客户来说,最重要的变化是成本。据 Anthropic 称,对于按代币计费的典型工作负载,《神鬼寓言 5.1》的成本预计比《神鬼寓言 5》低 25%。减少的原因是缓存读取的定价较低——当模型读取已经处理和存储的输入时。该公司表示,对于高度代理的工作,节省的费用通常会大得多,最高可达 45% 左右。
更大的结构性变化是公司称之为企业前沿保障(EFS)的新系统。 Anthropic 表示,EFS 为企业客户提供了完全的隐私——相当于零数据保留政策——同时仍然保持最先进的保护,防止敌对性使用。该机制的工作原理是将客户数据存储在完全由客户而不是 Anthropic 控制的云基础设施中。 EFS 将从今年秋天晚些时候开始分阶段向企业客户推出,在全面推出之前,符合条件的客户可以以零数据保留运行 Fable 5.1。
隐私方面的让步是在客户明显的抵制之后做出的。 CNBC 9 月 1 日报道,在客户反对后,Anthropic 改变了其数据保留政策,EFS 声明是该公司迄今为止对那些希望获得前沿模型功能但数据不依赖于 Anthropic 基础设施的企业最具体的回应。
编码和科学的基准收益
Anthropic 发布的评估显示其比上一代产品有了大幅跃进,尽管这些数字来自该公司自己的测试,应该相应地阅读。
在代理科学研究基准 Terminal-Bench-Science 0.1 上,《神鬼寓言 5.1》得分为 52.6%,而相同设置下《神鬼寓言 5》的得分为 24.7%。在同一基准测试中,Claude Opus 5 的得分为 29.0%,OpenAI 的 GPT-5.6 Sol 的得分为 22.4%。在基于终端的代理编码测试 Terminal-Bench 4.0 上,《神鬼寓言 5.1》得分为 55.8%,而具有更轻量级保护措施的 Mythos 5.1 则达到 60.9%,高于《神鬼寓言 5》的 42.0%。
知识工作和计算机使用指标也得到改善。 《神鬼寓言 5.1》在 GDPval-AA v2 评估中的得分为 1853,而《神鬼寓言 5》的得分为 1723,并且在没有工具的情况下达到了 Humanity's Last Exam 的 60.9%,在使用工具的情况下达到了 65.0%。在编码基准 CursorBench 3.2.0 上,它的得分为 73.4%,而《神鬼寓言 5》的得分为 70.5%。在计算机使用方面,它在 OSWorld 2.0 上的部分得分为 77.9%,严格得分为 41.7%,在 AutomationBench 上得分为 31.4%,高于其前身的 17.1%。
Anthropic 还披露了一个重要警告:《神鬼寓言 5.1》在启用生产保障措施的情况下进行了评估,在这些保障措施干预的任务中,该模型得分为零——该公司表示,这一因素可能会压低其在某些基准测试中的结果。
该公司指出,工作量设置对成本很重要。 《神鬼寓言 5.1》在 Claude Code 中默认为“高努力”,在 Claude Cowork 和 Claude.ai 中默认为“中等努力”,在较低的努力水平下,它以更低的成本实现了与《神鬼寓言 5》相似或更好的结果。
早期客户报告生产力提高
Anthropic 发表了早期合作伙伴的推荐书,强调了能力和经济性。 Cognition 表示,将在发布当天将其位于 Devin 的 Opus 5 流量转移至《神鬼寓言 5.1》。 Cognition 联合创始人兼首席产品官 Walden Yan 表示:“在我们的测试中,它以更低的每项任务成本与《神鬼寓言 5》相媲美或略胜一筹,而且凭借新的缓存读取定价,从代码审查开始,Fable 级模型对于我们在 Opus 上保留的工作负载来说最终变得经济实惠。”
量化交易公司 Millennium 提供了一个引人注目的调试轶事。一位高级投资组合经理表示,公司工程师四五年来一直无法解释一次罕见的崩溃(大约百万分之一),而且他尝试的每个模型都错过了它。 Fable 5.1 反汇编了一个外部供应商库,将其与核心转储进行匹配,并将崩溃追溯到该库中的错误。
媒体公司 Every 的首席执行官 Dan Shipper 表示,在他的测试中,该模型的速度大约是 Opus 5 的两倍,而使用的代币数量却是 Opus 5 的一半。公司卡初创公司 Ramp 描述了一次无人值守的 38 小时运行,其中模型将先前的机器学习结果诊断为标签伪影,对其进行纠正,在一夜之间启动了 6 个并行实验,并返回结果和后续步骤。
更软的保障措施,附带条件
在安全方面,Anthropic 表示,其最新的防护措施在网络安全方面产生的误报比以前减少了 60%。该公司还开启了一项功能转变:《神鬼寓言 5.1》现在可用于发现软件漏洞,但不能为其开发漏洞利用程序。
在生物学领域,Mythos 5.1 的先进功能将通过与美国政府合作开发的项目进行,预计很快就会开放科学家招募。今年早些时候,该公司已经加强了对《神鬼寓言 5》的生物学相关保护,这使得此次合作推出是该政策的延续,而不是逆转。
为什么它很重要
此次发布所处的市场推理价格一直在快速下降——AI Buzz Wire 分析最近发现代币价格创下历史新低——而 Anthropic 显然选择在代理工作负载的性价比上进行竞争,而不是捍卫溢价。通过与 OpenAI 的 GPT-5.6 Sol 及其自己的 Opus 5 系列进行比较,该公司将 Fable 5.1 定位为长期运行的编码和研究任务的默认选择。独立评估和企业采用是否证实这一推介将在未来几周内变得清晰。
---
保持人工智能领先地位获取最新的人工智能新闻、分析和突破——尽在一个地方。
阅读更多人工智能新闻 →