基准测试公司 Artificial Analysis 于 2026 年 9 月 4 日发布了其智能指数 4.2 版本,这是一个临时更新,重新设计了前沿人工智能模型的测量方式——根据新的排行榜,Anthropic 的 Claude Fable 5.1 占据榜首,OpenAI 的 GPT-6 Astra 比 GPT-5.6 Sol 提高了 4 个百分点,位居第二。

此次更新是在 1 月份 Index v4 推出仅八个月后进行的,该公司将这一异常快速的周转归因于最近前沿发布的步伐。该公司在公告中写道:“过去几周,前沿变化如此之快,我们认为立即提供中期更新非常重要,以确保我们的指数保持与以往一样的相关性和有用性。”

头条排名

根据公布的结果,Anthropic 的 Claude Fable 5.1 领先该指数,其次是 OpenAI 的 GPT-6 Astra,它比 GPT-5.6 Sol 提高了 4 个百分点。 Meta 是排行榜上第三强的实验室,其次是 SpaceXAI、Moonshot/Kimi、Z.AI 和 Google。

Anthropic 和 OpenAI 也分享了最新的成本效率图:这两家公司与 Meta 和 Z.AI 一起占据了该指数的“每项任务成本”帕累托前沿,这意味着目前没有其他实验室能够以每项已完成任务的相同价格提供更好的情报。

在代币效率方面,Artificial Analysis 发现 GPT-6 Astra“比接近智能前沿的几乎所有其他模型都具有更高的代币效率”,Claude Fable 5.1、Grok 4.5 和 Gemini 3.5 Flash-Lite 位于曲线的两端。然而,该公司在一份配套分析中指出,Astra 较低的代币使用量被其较高的价格所抵消——这提醒人们,原始效率和总成本并不总是同时变化。

v4.2 中发生了什么变化

最重要的结构性变化是有意推动基准游戏。该指数 40% 的权重现在来自私有的、保留的测试集——是 v4.1 中份额的两倍——包括 AA-Briefcase、AA-Omniscience 和 CritPt 的解决方案。该公司表示,该数字将在 Index v5 中进一步上升。

此次更新有两项新的评估:

  • AA-Briefcase,具有私人保留测试集的内部代理知识工作基准。模型在为期数周的专业项目上进行评估,每个项目都有许多相互关联的任务和数千个输入源文件,并通过标题评分和成对比较的组合进行分级,涵盖可验证的任务成功、分析质量和演示质量。
  • GDP.pdf,由 Surge AI 创建,测试跨专业文档的单轮推理:跨越 10 个领域的 100 个 PDF,证据分布在 4,592 页的文本、表格、图表和脚注中。根据 1,275 个专家编写的基本标准对回答进行评分,只有满足每个标准时,标题“全通过率”才会计入任务。

一项长期存在的基准即将被淘汰:研究生水平的科学推理测试 GPQA Diamond 已被删除,因为它已被前沿模型有效地饱和。

该公司还升级了其评分基础设施,发布了 AA-LCR v1.1,其中包含新的评分系统提示和更正的答案键,重新锚定 GDPval-AA v2 和 AA-Briefcase 的 Elo 量表,以便在新模型到来时评分保持稳定,并强化 SciCode 的评分沙箱,以便缓慢但正确的代码不再被视为失败。

新测试揭示了什么

新评估的结果更详细地描述了前沿实验室的实际情况。

在 AA-Briefcase 上,Anthropic 的 Claude Fable 5.1 和 Opus 5 领先,其次是 OpenAI 的 GPT-6 Astra 和 Meta 的 Muse Spark 1.3。在相同的评估中,GPT-6 Astra 的 Elo 分数比 GPT-5.6 Sol 高出大约 85 分——这与连续几代 OpenAI 相比有了很大的飞跃。

在 GDP.pdf 上,情况发生了翻转:OpenAI 以 33.2% 的全通率领先 GPT-6 Astra,其次是 GPT-5.6 Sol(28.2%)和 Claude Fable 5.1(26.2%)。这种差异表明,即使 Anthropic 的模型在整体索引和代理工作任务中领先,但在非常大的上下文中进行长文档合成仍然是 OpenAI 最新模型的相对优势。

为什么私有测试集很重要

向保留评估的转变反映了人工智能基准测试中更广泛的可信度问题。随着模型吸收了更多的公共测试数据,实验室和独立观察者越来越担心知名基准的标题分数反映的是记忆或有针对性的训练,而不是真正的能力。通过将越来越多的测试集保密并赋予它们更大的权重,Artificial Analysis 试图保留公共排行榜一直在失去的信号。

该公司表示,它“几个月来”一直在构建 Index v5 的元素,并故意推迟更新,以在最近一波主要型号发布中保持指数稳定。除了临时 v4.2 版本之外,它还计划在不久的将来完成 v5 过渡时进行更多增量更新。

对于在前沿模型之间进行选择的买家来说,v4.2 的实际收获是,市场顶部仍然是 Anthropic 和 OpenAI 之间的两匹马竞赛,Meta 缩小了差距——而且旨在抵抗游戏的评估现在正在做更多的排名工作。随着 v5 推出的临近,跟踪模型选择决策的用户可以关注最新的人工智能发展。

保持人工智能领先地位

像这样的基准更新重塑了行业判断进展的方式。 阅读更多 AI 新闻 并保持领先于每个模型的发布。

阅读更多人工智能新闻 →