Anthropic の Claude Opus 5 が ARC-AGI-3 ベンチマークを独占したことを受けて、OpenAI は反発しており、独自の GPT-5.6 Sol モデルが 38.3 パーセントに達することを示す結果を公開しています。ただし、公式のテスト ハーネスではなく OpenAI の優先設定を使用している場合に限ります。
2026 年 7 月 30 日に行われたこの論争は、AI 評価における増大する問題の核心に切り込んでいます。ベンチマークはもはやモデルだけを測定するのではなく、モデルを取り巻く技術的な足場全体を測定するものになっています。 最新の AI 開発 とモデルのリリースをより深く分析するために、AI Buzz Wire がストーリーを追跡しています。
数字と獲物
OpenAI の報告によると、GPT-5.6 Sol は ARC-AGI-3 で 38.3 パーセントに達し、以前にベンチマークの記録を 4 倍にしていた Anthropic の Claude Opus 5 の 30.2 パーセントをわずかに上回りました。この 38.3% という数字は、OpenAI の Responses API の 2 つの特定の機能に依存しているという点に注意が必要です。
1 つ目は 保持推論 です。これは、各アクションの後にモデルの思考連鎖を破棄するのではなく、ステップ間でモデルの思考連鎖を保持します。 2 つ目は 圧縮 で、古いコンテキストを切り捨てるのではなく要約することで、モデルが以前の推論を失うことなく長い問題に取り組み続けることができるようにします。
ARC プライズの公式標準化ハーネス(同一対同一の比較を保証するためにプロバイダー固有の設定を意図的に回避している)を実行した場合、GPT-5.6 Sol はわずか 7.8% を管理しました。その理由は、公式の設定ではステップごとにモデルの推論が破棄され、持続的な複数ステップの思考が必要なタスクのパフォーマンスが低下するためだとOpenAIは主張する。
純度を追求して構築されたベンチマーク
ARC-AGI-3 は、これまでに見たことのない斬新な推論パズルを解くモデルの能力を調査するために、フランソワ ショレと ARC プライズ チームによって設計されました。これは、記憶された知識ではなく一般的な知能のテストです。比較の公平性を保つために、公式ハーネスはプロバイダー固有の機能を意図的に取り除き、中立的な環境で生のモデルの機能を測定します。
OpenAIの反論は、この中立性がハンディキャップになる可能性があるというものだ。同社は、公式ハーネスは、Claude API がすでに提供していた機能を欠いた古い「OpenAI スタイルの補完 API」に依存しており、元の比較において OpenAI が Anthropic と比較して実質的に構造的に不利な立場にあると主張している。
要するに、OpenAI は「あなたは片手を後ろ手に縛った状態でモデルを測定した」と言っているのです。
チョレットの応答
ARCプライズの共同創設者フランソワ・ショレ氏は、2種類のテスト設定の間に明確な線を引くことでこれに応えた。同氏によると、「ベンチマークを解決するためにカスタムメイドされた、またはベンチマーク形式に関する知識を含む」ハーネスは立ち入り禁止だという。ただし、「ARC-AGI-3 用に開発されておらず、すべての API ユーザーが利用できる」汎用 API 設定は、公正なゲームです。
実際、Chollet 氏は、ARC プライズの GPT-5.6 Sol スコアが OpenAI に不利な状況にあることを認めました。同氏は、同組織が「特に圧縮に関して、モデルを最適にテストする方法についてOpenAIと何度もやり取り」を行ってきたと述べ、同社が「答えを見つけ始めている」ことを歓迎した。
Chollet は、残りの 1 つの懸念にフラグを立てました。異なるプロバイダーが異なる設定を使用すると、同氏の言うところの「潜在的な同等の問題」が発生しますが、「設定とコストが明確に報告されている限り」それは許容できると同氏は考えています。
リーダーボードを超えてこれが重要な理由
このエピソードは、AI業界の進歩の評価方法を変えつつある緊張を浮き彫りにしている。モデルがスタンドアロン システムとしてではなく、機能豊富な API を介してデプロイされることが増えているため、モデル本来の能力とそれを取り巻くエンジニアリングとの間の境界線は曖昧になり続けています。スキャフォールディングを無視したベンチマークは、実際のパフォーマンスを過小評価する可能性があります。これを採用する企業は、テストに挑戦した企業に報酬を与えるかもしれない。
ARC-AGI-3 の議論が最後になる可能性は低いです。確立されたベンチマークの上位付近にフロンティアモデルが集まるにつれ、何が公正な測定とみなされるのか、そして誰のハーネスが標準を設定するのかをめぐる意見の相違は激化するばかりだ。
AI の先を行く
モデル、ベンチマーク、それらを構築しているラボに関する AI ニュース速報 をフォローしたいですか? AI Buzz Wire があなたをサポートします。
AI ニュースをもっと読む