ARCプライズ財団が水曜日に発表した結果によると、OpenAIのGPT-6 Astraは、エージェントの知能を測定するために設計された抽象推論ベンチマークであるARC-AGI-3に関する最先端の結果を発表した。このモデルは、基盤の標準ハーネスに基づくベンチマークのセミプライベート セットで 62.7% のスコアを獲得し、リクエスト間のモデルの内部推論状態を保持するプロバイダー アダプター ハーネスを使用して評価した場合は 99.9% のスコアを獲得しました。

この結果は、OpenAI が新時代の始まりとして同社が掲げる主力モデルである Astra の段階的展開を開始した翌日に発表されました。フロンティア ラボの取引ベンチマークが崩れてもスコアを維持しようとしている読者のために、最新の AI 開発 ページでは、メジャー リリースが発生するたびに追跡しています。

2 つのハーネス、2 つのまったく異なるスコア

アストラ社の2つのヘッドライン数値の差は、レポートの中で最も重要な詳細である。 ARCプライズはさまざまなハーネスの下でエージェントを評価し、それぞれが独自のコンテキストでモデルに許可される内容を変更します。

標準ハーネスでは、モデルは環境内で作業するときに保持することを選択したメモを引き継ぐことができます。この設定では、Astra は推論努力を最大化した場合に 62.7% のスコアを獲得し、評価実行の総コストは 26,098 ドルでした。逆に、推論をオフにして同じハーネスを実行すると、モデルが進歩するためにさらに多くのアクションが必要になったため、コストは 49,791 ドルと高くなりますが、生成率はわずか 35.2% でした。

プロバイダー アダプター ハーネスはより寛大です。リクエスト間のモデルの不透明な推論状態を保存し、より長い会話には圧縮を使用して、Astra が以前の作業を再利用できるようにします。そのハーネスの下で、Astra は 18,817 ドルで高い推論努力で 99.9% のスコアを獲得し、17,332 ドルで最大努力で 98.6% のスコアを獲得しました。最も低い推論設定でも 96.7% に達しました。

言い換えれば、部分的なスコアとほぼ完璧なスコアの違いは、生の能力だけではなく、モデルの動作状態がステップ間でどの程度存続するかによって決まります。

アクション効率で人間に勝つ

ARC-AGI-3 は、斬新で抽象的なターンベースのゲーム環境を中心に構築されています。エージェントは指示なしで探索し、世界がどのように機能するかを推測し、まばらな報酬から目標を特定し、複数段階のアクションを計画する必要があります。環境は人間が 100% 解決できるように調整されており、人間のパフォーマンスがベンチマークの基準となります。

Astra はほとんどのレベルを解決するだけでなく、それらを効率的に解決しました。 ARCプライズによると、モデルは96%のレベルでテストされた人間の中央値よりも少ないアクションを使用し、セット全体のアクション効率において人間のベースラインを上回りました。

この比較の経済性は明らかです。人間によるテストの参加者には、90 分のセッションごとに 115 ドルと、完了したゲームごとに 5 ドルが支払われ、試行されたゲームごとに約 12.78 ドルが支払われました。 Astra の完全な評価実行には、構成に応じて 5 桁の費用がかかります。しかし、ARC プライズは、直感に反する問題点を指摘しました。つまり、Astra はより少ないアクションでゲームを解決し、実行ごとに消費されるモデル呼び出しとトークンの総数が減少したため、推論の労力が増えると一般にコストが安くなります。

独自の言語を構築するモデル

ARC 賞は、スコア以外にも、チームが観察した定性的な行動を強調しました。 Astra は一貫して、馴染みのない環境をコンパクトな象徴的な世界モデルに変換し、ゲームの仕組みを論理的なルールとして表現し、状態を追跡しアクションを計画するための独自のドメイン固有の短縮表現を開発しました。

それはまさに、ARC-AGI-3 が調査するために設計されたスキルです。前世代のベンチマークでは、新しいパターンに対する流動的な推論をテストしていましたが、第 3 世代では、エージェントがこれまで見たことのない環境で探索、モデル化、目標設定、計画の実行ができるかどうかをテストします。これらのコンポーネントは、ARC 賞が探索、モデリング、目標設定、計画と実行として挙げています。

AGI 時代の背景

ベンチマークの結果は、OpenAI 自体からの最大限のレトリックの中で発表されました。 The New Stackのこの打ち上げに関する報道によると、木曜日の打ち上げ前の記者会見で、同社社長のグレッグ・ブロックマン氏は、正式な宣言には至らずに「今はAGIの時代に入っていると感じるのも無理はない」と語った。彼はAGIを契約上のトリガーではなく「使命概念または精神的な概念」と説明しました。

OpenAIの研究者エイダン・クラーク氏は、Astraは同社のこれまでで最大のトレーニング実行であり、テキサス州のスターゲイト・サイトで10万以上のGPUで事前トレーニングされた初のトレーニングであり、以前のモデルがトレーニング・プロセスの監視において重要な役割を果たした最初のOpenAIリリースであると述べた。アクセスはまだ段階的に行われています。展開は Daybreak プログラムの企業顧客から始まり、Plus、Pro、Business、Enterprise の可用性と、API と AWS へのアクセスが数日以内に提供される予定です。

スコア上のアスタリスク

いくつかの面で注意が必要です。見出しの 2 つの数字が示すように、Astra の ARC-AGI-3 のパフォーマンスはハーネス構成に大きく依存しており、モデルの状態を保持するカスタム ハーネスがベンチマーク論争で繰り返し争点となっています。 New Stack の発表分析では、Astra は「特殊なタスクで大きな利益を上げているが、それにはプレミアムが付いており、コーディング パックを明確にリードしているわけではない」と指摘されています。これは、エージェントのパズル ベンチマークと日常の商用ワークロードでは測定されるものが異なることを思い出させます。

ARC プライズ自体は、この演習を現在の AI と AGI の間の「残存ギャップ」を測定するものとして枠付けし、AGI を人間ができるあらゆるスキルを人間と同じくらい効率的に習得できる能力と定義しています。好条件下でほぼ完璧なスコアを獲得しても、それだけではその差は縮まりません。また、評価実行ごとに 17,000 ドルから 50,000 ドルがかかり、この規模でベンチマークを実行できるのは十分なリソースを備えたラボだけです。ただし、ARC プライズのコスト データは、より賢明な推論により実際に請求額を削減できることを示しています。

なぜそれが重要なのか

アクション効率は、真に新しい比較軸です。すべてのレベルを解決するが、そのために何千もの呼び出しを無駄にするモデルは、Astra がここで行ったように機能するモデル (意図的に探索し、学習した内容を圧縮し、それに基づいて動作するモデル) よりも有用性が低く、コストが高くなります。 AGI 論争について誰が結論を下すにせよ、ARC 賞のデータは、フロンティアエージェントが新しい問題を解決できるかどうかだけでなく、どれだけ経済的に問題を解決できるかについても人間と肩を並べていることを示している。

AI の一歩先を行く

すべてのベンチマーク結果、モデルの発売、安全性に関する議論を随時追跡 — AI ニュースの続きを読む →