根据 ARC 奖基金会周三发布的结果,OpenAI 的 GPT-6 Astra 已在 ARC-AGI-3 上发布了最先进的结果,ARC-AGI-3 是旨在测量代理智能的抽象推理基准。该模型在基金会标准工具下的基准半私有集上得分为 62.7%,在使用提供者适配器工具进行评估时得分为 99.9%,该工具保留了模型在请求之间的内部推理状态。

该结果是在 OpenAI 开始分阶段推出 Astra 的一天后得出的,Astra 是该公司将其视为新时代开始的旗舰机型。对于那些试图在前沿实验室贸易基准爆发时保持分数的读者来说,最新的人工智能发展页面跟踪了每个主要版本的发布。

两个安全带,两个截然不同的分数

阿斯特拉两个标题数字之间的差距是报告中最重要的细节。 ARC 奖评估不同工具下的代理,并且每种工具都会改变模型在其自身上下文中允许执行的操作。

在标准工具下,模型可以在环境中工作时转发它选择保留的注释。通过这种设置,Astra 在最大推理努力下得分为 62.7%,评估运行的总成本为 26,098 美元。另一方面,在关闭推理的情况下运行相同的工具仅产生 35.2% 的结果,同时成本更高(49,791 美元),因为模型需要更多的操作才能取得进展。

Provider Adapter 工具更加慷慨:它保留了模型在请求之间的不透明推理状态,并使用压缩来进行较长的对话,让 Astra 可以重用之前的工作。在此框架下,Astra 在高推理努力下得分为 99.9%,得分为 18,817 美元;在最大推理得分下得分为 98.6%,得分为 17,332 美元。即便是最低推理设定也达到了96.7%。

换句话说,部分得分和近乎完美得分之间的区别不仅仅在于原始能力,还在于模型的工作状态在步骤之间有多少幸存下来。

在行动效率上击败人类

ARC-AGI-3 围绕新颖、抽象、回合制游戏环境构建。智能体必须在没有指令的情况下进行探索,推断世界是如何运作的,从稀疏的奖励中确定目标,并计划多步骤的行动。环境经过校准,以便人类能够 100% 解决问题,这使得人类表现成为基准衡量的基线。

Astra 不仅解决了大多数关卡,而且还高效地解决了它们。根据 ARC 奖,该模型在 96% 的水平上使用的动作比测试的人类中位数要少,在整个集合的动作效率方面超过了人类基线。

比较的经济学意义是显而易见的。人类测试参与者每 90 分钟的会话获得 115 美元,加上每完成游戏 5 美元,算下来每场尝试的游戏大约为 12.78 美元。完整的 Astra 评估运行费用为五位数,具体取决于配置。但 ARC 奖指出了一个违反直觉的问题:更高的推理工作通常成本更低,因为 Astra 用更少的动作解决了游戏,从而减少了模型调用和每次运行消耗的代币总数。

构建自己语言的模型

除了分数之外,ARC 奖还强调了团队观察到的定性行为。 Astra 始终将陌生的环境转化为紧凑的符号世界模型——将游戏机制表示为逻辑规则,并开发自己的特定领域的速记法来跟踪状态和计划行动。

这正是 ARC-AGI-3 旨在探测的技能。前几代基准测试针对新颖模式的流畅推理,而第三代基准测试代理是否可以在从未见过的环境中探索、建模、设定目标和执行计划——ARC 奖列出的组件为探索、建模、目标设定以及规划和执行。

AGI 时代背景

基准测试结果是在 OpenAI 本身的最大言论中得出的。根据 The New Stack 对此次发布的报道,在周四发布前的新闻发布会上,公司总裁格雷格·布罗克曼 (Greg Brockman) 表示,“我们现在处于 AGI 时代并不是没有道理的”,但他没有发表正式声明。他将 AGI 描述为“使命概念或精神概念”,而不是契约触发器。

OpenAI 研究员 Aidan Clark 表示,Astra 是该公司迄今为止最大规模的训练——首次在德克萨斯州 Stargate 站点上对超过 100,000 个 GPU 进行了预训练——也是 OpenAI 的第一个版本,其中早期模型在监督训练过程中发挥了重要作用。访问仍处于阶段性阶段:在 Daybreak 计划中首先向企业客户推出,并承诺在未来几天提供 Plus、Pro、Business 和 Enterprise 可用性以及 API 和 AWS 访问。

乐谱上的星号

需要在几个方面保持谨慎。正如两个标题数据所示,Astra 的 ARC-AGI-3 性能在很大程度上取决于线束配置,而保留模型状态的定制线束一直是基准争议中反复出现的争论点。 New Stack 对此次发布的分析指出,Astra“在专门任务上取得了巨大的进步,但它的价格很高,而且并没有明显领先于编码包”——这提醒我们,代理谜题基准测试和日常商业工作负载衡量的是不同的东西。

ARC 奖本身将这项活动定义为衡量当前人工智能和通用人工智能之间的“剩余差距”,将通用人工智能定义为像人类一样高效地获得人类所能获得的任何技能的能力。在有利的条件下获得近乎完美的分数本身并不能缩小这一差距。每次评估运行的费用为 17,000 至 50,000 美元,只有资源充足的实验室才能负担得起以这种规模运行基准测试 - 尽管 ARC 奖的成本数据显示,更明智的推理实际上可以减少费用。

为什么它很重要

行动效率是一个真正的新比较轴。一个解决每个关卡但却浪费了数千次调用的模型比 Astra 在这里所做的那样有用,而且更昂贵:故意探索,压缩它学到的东西,然后对其采取行动。无论人们对 AGI 争论有何结论,ARC 奖数据显示,前沿特工现在不仅在是否能够解决新问题方面与人类进行匹配,而且还在如何经济地解决问题方面与人类进行匹配。

保持人工智能领先地位

每一个基准测试结果、模型发布和安全辩论,都会在发生时进行跟踪 - 阅读更多人工智能新闻 →