Nvidia の研究者は、AI で最も要求の厳しいインタラクティブ推論ベンチマークの 1 つである ARC-AGI-3 で、Anthropic の Claude Opus 5 を完璧な 100% スコアに押し上げるエージェント システムを構築しました。これは、単独で実行すると 30% のスコアを獲得するまったく同じモデルを使用しています。金曜日に Nvidia テクニカル ブログで公開されたこの結果は、フロンティア モデルを包むソフトウェアがモデル自体と同じくらい重要であることを示す、これまでで最も強力な証拠です。 最新の AI 開発 を追跡している人にとって、これはエージェント型 AI における競争上の優位性が実際に存在する場所の変化を示しています。
このシステムは AVO (Agentic variation Operators の略) と呼ばれ、長距離自律エージェント (単一のプロンプトに応答する代わりに、数時間または数日間タスクを継続できる AI) のための汎用アーキテクチャを Nvidia が取り入れたものです。 ARC-AGI-3 パブリック セットでは、AVO はバックエンド モデルとして Claude Opus 5 を使用し、25 のゲーム環境すべてで 100.00 RHAE スコアを記録し、6,624 の環境アクションで 183 レベルすべてを完了しました。
ARC-AGI-3 が実際にテストする内容
ARC-AGI-3 は、ARC プライズ財団によって作成された対話型推論ベンチマークです。エージェントは、指示もルールも目標も定められていない、なじみのないゲームのような環境に放り込まれます。試行錯誤を通じて探索し、環境がどのように機能するかを推測し、「勝利」が何を意味するかを理解してから、段階的に難しいレベルを進むために効率的に行動する必要があります。
ベンチマークのスコア指標である相対人間アクション効率 (RHAE) は、タスクの完了と、初めて人間のプレイヤーと比較してエージェントが無駄にするアクションの少なさを組み合わせたものです。そのため、これは持続的な自律性を試す過酷なテストになります。エージェントは学習したことを記憶し、間違いから回復し、実行全体にわたって慎重に行動の予算を立てなければなりません。
Nvidia の見出しの数字は、比較することで文脈がわかります。以前の直接インタラクション ハーネスである VISTA (Claude Opus 5 も使用) は、7,542 の環境アクションで同じ 183 の公開設定レベルを完了しました。 Nvidia のブログ投稿によると、AVO はジョブを完了するために必要なアクションが約 12% 減りました。
GPU カーネルから未知のゲームまで
AVO はパズル用に作られたものではありません。 Nvidia は、GPU カーネルの最適化に関するアーキテクチャを初めて実証しました。これは、コードの小さな変更により、正確性、メモリの動作、およびスループットが予測不可能な方法で損なわれる可能性がある領域です。あるアテンションカーネル調査では、AVO を 7 日間継続的に実行し、500 以上の最適化の方向性を検討し、40 のカーネル バージョンをコミットしました。 NVIDIA DGX B200 システムでは、結果として得られるマルチヘッド アテンション カーネルは、cuDNN を最大 3.5%、FlashAttendant-4 を最大 10.5% 上回りました。その後、エージェントは、約 30 分間の追加の自律作業で、進化したカーネルをグループ化されたクエリ アテンションに適応させました。
次に、同じコア ループ (検査、計画、実装、テスト、評価) が ARC-AGI-3 を指すようになり、タスク インターフェイスのみが変更されました。 2つの機構を引き継いだ。 1 つ目は永続メモリで、以前の実装、評価結果、コンパイラとプロファイラの出力、蓄積された推論を保存するため、エージェントはコンテキストを最初から再構築するのではなく、現在の状態から再開できます。 2 つ目はスーパーバイザーであり、全体の軌道を監視し、進捗が停滞した場合に介入する 2 番目のエージェントです。
スーパーバイザーは画期的な存在です
TechCrunchは、NvidiaのAI部門製品担当副社長であるAdel El Hallak氏にインタビューし、スーパーバイザーが最も重要な要素であることを強調した。 「エージェントが方向を外したり、行き止まりにつながる可能性のある道を探索し始めたり、以前に歩いた道を再探索し始めたりしたときに、エージェントを小突くのはほとんどCEOのような役割を果たします」とエル・ハラック氏は出版物に語った。
パフォーマンスの差は歴然です。 Nvidia のテストでは、洗練されたハーネスを備えていない Claude Opus 5 が ARC-AGI-3 で 30% のスコアを達成したことがわかりました。これは、テストしたベア モデルの中で最高の結果でしたが、完全な実行には程遠いものでした。 OpenAI のモデルのベンチマークスコアは 10% 未満であり、同社は先月、ハーネス設定を 2 つ調整するだけでスコアが 3 倍になったことを示す独自の調査結果を発表しました。 AVO が達成した 100% に近いモデルのみの構成はありません。
特に、AVO 構成はテキストのみのモダリティで実行されました。各観測値は正確な 64x64 のテキスト グリッドとして提供され、画像や画像トークンはモデルに送信されませんでした。推論力は、マルチモーダルな認識からではなく、モデルの周囲のループから得られました。
業界がハーネスに賭ける理由
この発見は、自律型 AI の現在のボトルネックは、生のモデルの機能ではなく、エージェントのインフラストラクチャであるという証拠が次々と出てくる真っ只中にありました。 Databricks は 7 月に、ハーネスがパフォーマンスとコストの両方に劇的な影響を与えることを示すベンチマーク調査を発表しました。 「同じモデルで異なるハーネスを選択することもできますが、間違ったハーネスを使用すると、コストが大幅に増加します」とDatabricksのCEO、Ali Ghodsi氏はTechCrunchに語った。 「それ自体でコストが 2 倍になる可能性があります。」
El Hallak 氏は、NVIDIA の広範な議論をオープン性の観点から組み立てました。 「私たちは、ハーネス全体、インフラストラクチャ全体、ランタイム全体を制御できるオープンなエージェント スタックを持つことが、エコシステムを前進かつ安全に導くために必要なものであると信じています」と同氏は述べた。 Nvidia は NeMo ブランドでオープンサイズのハーネス テクノロジーを提供しており、AVO の研究は arXiv の論文に記載されています。
歴史のあるベンチマーク
ARC-AGI-3 は、フロンティアと研究室の対立の火種となっています。 OpenAIは以前、GPT-5.6 Solモデルのベンチマークで良好な結果が得られたと主張し、使用された評価設定について厳しい調査を行っていた。 Nvidia の結果は、ある意味でこの議論を回避しています。それは、よりスマートなモデルを主張しているのではなく、既存のモデルに基づいてより適切に設計されたエージェントを主張しているだけです。
エージェント製品を構築する開発者や企業に対するメッセージは直接的です。モデルの選択は依然として重要ですが、フロンティア モデルがフロンティアの結果をもたらすかどうかはシステム設計によって決まります。 Nvidia が言うように、モデルの評価はエージェントの評価と同じではありません。そして 2026 年のベンチマーク テーブルでは、足場を構築するエンジニアにますます報酬が与えられることになります。
AI の先を行く
エージェント アーキテクチャはかつてないほど急速に進化しており、優れたハーネスと悪いハーネスの差はベンチマーク ポイントと実質金額で測定されるようになりました。 AI Buzz Wire をフォローすると、AI 研究、ベンチマーク、製品発売に関する情報源が確認された報道が毎日配信されます。
AI研究ニュースをもっと読む→