在 Anthropic 的 Claude Opus 5 在 ARC-AGI-3 基准测试中占据主导地位后,OpenAI 进行了反击,发布的结果显示其自己的 GPT-5.6 Sol 模型达到了 38.3%——前提是您使用 OpenAI 的首选设置而不是官方测试工具。
这场争论于 2026 年 7 月 30 日展开,切中了人工智能评估中日益严重的问题的核心:基准测试不再仅仅衡量一个模型,而是衡量围绕该模型的整个技术框架。为了更深入地分析最新的人工智能发展 和模型发布,AI Buzz Wire 正在跟踪这个故事。
数字和陷阱
OpenAI 报告称,GPT-5.6 Sol 在 ARC-AGI-3 上达到了 38.3%,超过了 Anthropic 的 Claude Opus 5,后者的得分为 30.2%,此前是基准记录的四倍。需要注意的是:38.3% 的数字取决于 OpenAI 响应 API 的两个特定功能。
第一个是保留推理,它保留步骤之间模型的思维链,而不是在每个动作后丢弃它。第二个是压缩,它总结旧的上下文而不是截断它,允许模型继续处理长期问题而不丢失早期的推理。
通过 ARC 奖的官方标准化工具(故意避免特定于提供商的设置以确保同类比较),GPT-5.6 Sol 仅管理了 7.8%。 OpenAI 认为,原因是官方设置在每一步之后都放弃了模型的推理,从而降低了需要持续多步骤思考的任务的性能。
为纯度而构建的基准
ARC-AGI-3 由 François Chollet 和 ARC 奖团队设计,旨在探索模型解决以前从未见过的新颖推理难题的能力 - 这是对一般智力而不是记忆知识的测试。为了保持比较公平,官方工具故意去除了特定于提供商的功能,在中立的环境中测量原始模型的功能。
OpenAI 的反驳是,这种中立性可能会成为一种障碍。该公司声称,官方工具依赖于较旧的“OpenAI 式补全 API”,该 API 缺乏 Claude API 已提供的功能,这实际上使 OpenAI 在最初的比较中相对于 Anthropic 处于结构性劣势。
本质上,OpenAI 是在说:你用一只手绑在背后来测量我们的模型。
乔莱的回应
ARC 奖联合创始人 François Chollet 的回应是在两种测试设置之间划清界限。他说,“为解决基准测试而定制的或包含基准格式知识的”工具是禁止的。但通用 API 设置“不是为 ARC-AGI-3 开发的,并且可供所有 API 用户使用”是公平的游戏。
实际上,Chollet 承认 ARC 奖自己的 GPT-5.6 Sol 分数使 OpenAI 处于劣势。他指出,该组织“与 OpenAI 就如何最好地测试其模型进行了多次反复讨论,特别是在压缩方面”,并欢迎该公司“开始找出答案”。
乔莱确实提出了一个剩下的问题。不同的提供商使用不同的设置,造成了他所说的“潜在的平价问题”——但他认为“只要明确报告设置和成本”,这是可以接受的。
为什么这比排行榜更重要
这一事件凸显了一种紧张局势,这种紧张局势正在重塑人工智能行业评估进展的方式。随着模型越来越多地通过功能丰富的 API 而不是作为独立系统进行部署,模型的固有能力与其周围的工程之间的界限变得越来越模糊。忽略脚手架的基准可能会低估现实世界的性能;接受它的人可能会奖励那些玩弄测试的公司。
ARC-AGI-3 的争论不太可能是最后一次。随着前沿模型聚集在既定基准的顶部附近,关于什么才是公平测量以及谁的工具可以设定标准的分歧只会加剧。
保持人工智能领先地位
想要关注有关模型、基准测试和构建它们的实验室的突发人工智能新闻? AI Buzz Wire 可以满足您的需求。
阅读更多人工智能新闻