ベンチマーク会社 Artificial Analysis は、2026 年 9 月 4 日に自社の Intelligence Index バージョン 4.2 をリリースしました。これは、フロンティア AI モデルの測定方法を再構築する中間アップデートです。新しいリーダーボードによると、Anthropic の Claude Fable 5.1 がトップの座を維持し、OpenAI の GPT-6 Astra が GPT-5.6 Sol に 4 ポイントの差をつけて 2 位となっています。

このアップデートは、Index v4 が 1 月にリリースされてからわずか 8 か月後に行われました。これは、同社が最近のフロンティア リリースのペースのおかげであると考えられます。同社は発表文の中で、「過去数週間でフロンティアが非常に急速に動いているため、当社のインデックスがこれまでと同様に関連性があり有用であり続けることを保証するために、即時中間アップデートを提供することが重要であると感じている」と述べている。

見出しランキング

公開された結果によると、Anthropic の Claude Fable 5.1 がインデックスをリードし、OpenAI の GPT-6 Astra がそれに続き、GPT-5.6 Sol より 4 ポイント向上しました。 Meta はリーダーボードで 3 番目に強い研究機関としてランクされており、SpaceXAI、Moonshot/Kimi、Z.AI、Google がそれに続きます。

Anthropic と OpenAI は、最新のコスト効率の状況も共有しています。この 2 社は、Meta と Z.AI とともに、インデックスの「タスクあたりのコスト」パレート フロンティアを占めています。つまり、現在、完了したタスクあたりの同じ価格で厳密に優れたインテリジェンスを提供しているラボは他にありません。

トークン効率に関して、Artificial Analysis は、GPT-6 Astra が「インテリジェンスフロンティアに近い他のほぼすべてのモデルよりもトークン効率が高い」ことを発見し、Claude Fable 5.1、Grok 4.5、および Gemini 3.5 Flash-Lite が曲線の両端に位置しています。しかし、同社はコンパニオン分析の中で、アストラのトークン使用量の少なさは価格の高さを上回っていると指摘しており、これは、本来の効率と総コストが必ずしも一致するわけではないことを思い出させます。

v4.2 での変更点

最も重要な構造的変化は、ベンチマーク ゲームに対する意図的な推進です。現在、インデックスの重み付けの 40% は、AA-Briefcase、AA-Omniscience、CritPt のソリューションを含む非公開の保留テスト セットによるものであり、v4.1 ではシェアが 2 倍になっています。同社は、この数字はインデックスv5ではさらに上昇すると述べた。

2 つの新しい評価がアップデートをアンカーします。

  • AA-Briefcase、非公開のテスト セットを使用した社内エージェントのナレッジ ワーク ベンチマーク。モデルは、複数週間にわたる専門的なプロジェクトで評価されます。それぞれのプロジェクトには、リンクされた多くのタスクと数千の入力ソース ファイルがあり、検証可能なタスクの成功、分析品質、プレゼンテーション品質をカバーするルーブリック スコアリングとペアごとの比較の組み合わせによって等級付けされます。
  • GDP.pdf、Surge AI によって作成され、専門的な文書全体でシングルターン推論をテストします。10 のドメインにまたがる 100 の PDF があり、証拠が 4,592 ページのテキスト、表、グラフ、脚注に分散されています。回答は、専門家が作成した 1,275 の基本的な基準に基づいて採点され、見出しの全合格率は、すべての基準が満たされた場合にのみタスクとして評価されます。

長年続いてきたベンチマークの 1 つが廃止されつつあります。大学院レベルの科学推論テストである GPQA ダイヤモンドは、フロンティア モデルによって実質的に飽和状態になったため、削除されました。

同社はまた、グレーディング インフラストラクチャもアップグレードし、新しいグレーディング システム プロンプトと修正された回答キーを備えた AA-LCR v1.1 をリリースしました。また、GDPval-AA v2 と AA-Briefcase の Elo スケールを再固定して、新しいモデルが到着しても評価が安定するようにし、SciCode のグレーディング サンドボックスを強化して、遅くても正しいコードは失敗としてカウントされなくなりました。

新しいテストで明らかになったもの

新しい評価の結果は、フロンティアラボが実際にどのような立場にあるのかについて、より詳細な全体像を提供します。

AA-Briefcase では、Anthropic の Claude Fable 5.1 と Opus 5 がリードし、OpenAI の GPT-6 Astra と Meta の Muse Spark 1.3 が続きます。 GPT-6 Astra は、同じ評価で GPT-5.6 Sol よりも約 85 Elo ポイント高いスコアを獲得しています。これは、歴代の OpenAI 世代間で大幅なジャンプです。

GDP.pdf では状況が反転します。OpenAI が GPT-6 Astra で全パス率 33.2% でトップとなり、GPT-5.6 Sol が 28.2%、Claude Fable 5.1 が 26.2% で続きます。この相違は、Anthropic のモデルがインデックスとエージェントの作業タスク全体をリードしているにもかかわらず、非常に大規模なコンテキストにわたる長い文書の合成が OpenAI の最新モデルの相対的な強みであり続けていることを示唆しています。

プライベート テスト セットが重要な理由

評価を保留する方向への移行は、AI ベンチマークにおけるより広範な信頼性の問題を反映しています。モデルがより多くの公開テストデータを吸収するにつれて、研究室や独立した観察者は、有名なベンチマークのヘッドラインスコアが本物の能力ではなく暗記や目標を絞ったトレーニングを反映しているのではないかとの懸念を強めています。 Artificial Analysis は、増加するテスト セットのシェアを非公開に保ち、より重み付けすることで、公開リーダーボードが失いつつあるシグナルを維持しようとしています。

同社は、インデックスv5の要素を「何ヶ月も」構築しており、最近の主要モデルの発売の波を通じてインデックスを安定させるために更新を意図的に保留していると述べた。 v4.2 の暫定リリースを超えて、v5 への移行が完了するにつれて、近い将来さらに増分アップデートを計画しています。

フロンティア モデルのどちらかを選択するバイヤーにとって、v4.2 から実際に得られる点は、市場のトップは依然として Anthropic と OpenAI の二頭立てであり、Meta がその差を縮めているということです。また、ゲームに耐えるように設計された評価がランキングでより多くの役割を果たしているということです。モデル選択の決定を追跡しているユーザーは、v5 のロールアウトが近づくにつれて最新の AI 開発を追跡できます。

AI の先を行く

今回のようなベンチマークの更新により、業界が進歩を判断する方法が変わります。 AI ニュースの詳細を読む を参照して、すべてのモデルのリリースを先取りしてください。

AIニュースをもっと読む→