Nvidia 研究人员构建了一个代理系统,使 Anthropic 的 Claude Opus 5 在 ARC-AGI-3 上获得了 100% 的完美分数,ARC-AGI-3 是人工智能领域最苛刻的交互式推理基准测试之一,使用的模型在单独运行时得分为 30%。周五在 Nvidia 技术博客上发布的结果是迄今为止最有力的证据,表明围绕前沿模型的软件与模型本身一样重要。对于任何追踪最新人工智能发展的人来说,这标志着代理人工智能竞争优势实际存在的转变。
该系统称为 AVO,是 Agentic Variation Operators 的缩写,它是 Nvidia 针对长视野自主代理的通用架构 - 人工智能可以在数小时或数天内执行任务,而不是回答单个提示。在 ARC-AGI-3 公共集上,AVO 在所有 25 个游戏环境中记录了 100.00 RHAE 分数,使用 Claude Opus 5 作为后端模型,在 6,624 个环境操作中完成了所有 183 个关卡。
ARC-AGI-3 实际测试什么
ARC-AGI-3 是由 ARC 奖基金会创建的交互式推理基准。特工被投入到陌生的、类似游戏的环境中,没有指示、没有规定的规则、也没有规定的目标。它必须通过反复试验进行探索,推断环境如何运作,弄清楚“获胜”意味着什么,然后采取足够有效的行动,以逐步克服越来越难的关卡。
该基准的评分指标“相对人类行动效率”(RHAE) 将任务完成情况与代理相对于首次人类玩家浪费的行动数量结合起来。这使得它成为对持续自主性的残酷考验:智能体必须记住它学到的东西,从错误中恢复,并在整个运行过程中仔细预算其行动。
英伟达的标题数字通过比较获得了背景信息。 VISTA 是之前的直接交互工具,也使用了 Claude Opus 5,在 7,542 项环境操作中完成了相同的 183 个公共设置级别。根据 Nvidia 的博客文章,AVO 完成这项工作所需的操作减少了大约 12%。
从 GPU 内核到未知游戏
AVO 不是为拼图而设计的。 Nvidia 首先展示了 GPU 内核优化的架构,在这个领域,小的代码更改可能会以不可预测的方式破坏正确性、内存行为和吞吐量。在一项注意力内核研究中,AVO 连续运行了 7 天,探索了 500 多个优化方向,并提交了 40 个内核版本。在 NVIDIA DGX B200 系统上,生成的多头注意力内核的性能优于 cuDNN 高达 3.5%,优于 FlashAttention-4 高达 10.5%。然后,代理在大约 30 分钟的额外自主工作中调整其进化的内核以适应分组查询注意力。
然后将相同的核心循环(检查、计划、实施、测试、评估)指向 ARC-AGI-3,仅更改任务接口。延续了两种机制。第一个是持久内存,它存储先前的实现、评估结果、编译器和分析器输出以及累积的推理,因此代理可以从当前状态恢复,而不是从头开始重建上下文。第二个是监督者,第二个代理,负责观察整体轨迹并在进展停滞时进行干预。
主管是突破
TechCrunch 采访了 Nvidia 人工智能部门产品副总裁 Adel El Hallak,强调主管是最重要的因素。 “当代理偏离方向或开始探索一条可能通向死胡同的道路时,或者重新探索以前走过的道路时,它几乎就像首席执行官一样推动代理,”埃尔哈拉克告诉该出版物。
性能差距十分明显。 Nvidia 的测试发现,没有复杂线束的 Claude Opus 5 在 ARC-AGI-3 上的得分为 30%——这是测试的裸模型中最好的结果,但远未达到满分。 OpenAI 的模型在基准测试中的得分低于 10%,该公司上个月发布的研究显示,仅调整两个线束设置,其得分就增加了两倍。没有任何纯模型配置能够接近 AVO 所达到的 100%。
值得注意的是,AVO 配置以纯文本模式运行:每个观察结果都以精确的 64x64 文本网格形式提供,没有图像或图像标记发送到模型。推理能力来自模型周围的循环,而不是来自多模态感知。
为什么业界押注于安全带
这一发现出现在一系列证据表明代理基础设施,而不是原始模型能力,是自主人工智能当前的瓶颈。 Databricks 在 7 月份发布的基准研究表明,该工具对性能和成本都有显着影响。 Databricks 首席执行官 Ali Ghodsi 告诉 TechCrunch:“你可以选择相同的型号,但使用不同的线束,如果使用错误的线束,你的成本会显着增加。” “这本身就可以使你的成本增加两倍。”
El Hallak 在开放性方面阐述了英伟达更广泛的论点。他说:“我们相信,拥有一个开放的代理堆栈——您可以在其中跨线束、跨基础设施、跨运行时进行控制——是我们引领生态系统安全向前发展所必需的。” Nvidia 在其 NeMo 品牌下拥有开放尺寸的线束技术,AVO 研究记录在 arXiv 上的一篇论文中。
有历史的基准
ARC-AGI-3 已成为前沿实验室竞争中的一个热点。 OpenAI 此前声称其 GPT-5.6 Sol 模型在基准测试中取得了强劲的成绩,引起了对所使用的评估设置的严格审查。英伟达的结果在某种意义上回避了这一争论——它并没有声称有一个更智能的模型,只是围绕现有模型设计了一个更好的代理。
对于构建代理产品的开发人员和企业来说,这个信息是直接的:模型选择仍然很重要,但系统设计现在决定了前沿模型是否能够提供前沿结果。正如 Nvidia 所说,评估模型与评估代理不同——2026 年的基准表越来越奖励构建脚手架的工程师。
保持人工智能领先地位
代理架构的发展速度比以往任何时候都快,好的工具和坏的工具之间的差距现在以基准点和实际美元来衡量。 关注 AI Buzz Wire,获取经过来源验证的每日 AI 研究、基准测试和产品发布报道。
阅读更多人工智能研究新闻 →