Real-SWE と呼ばれる新しいベンチマークは、AI 業界がコーディング能力を測定する方法に挑戦しており、最初の結果はフロンティア ラボにとって屈辱的なものです。 Claude Code ハーネス内で実行されている Anthropic の Fable 5.1 は、プライベートな現実世界のエンタープライズ コードベースから抽出されたタスクの解決率 38.8% でボードをリードしています。テストしたモデルで 40% をクリアしたものはありません。

Specific Labs が今月リリースしたこのベンチマークは、チームが実際の企業からライセンスを取得したプライベート運用コードベースでフロンティア AI モデルを評価します。その作成者らは、専門家が生成したタスクや合成タスクは、たとえ適切に設計されていたとしても、実際の企業のエンジニアが実際に行っているそのままの作業ではないと主張しています。 この件の詳細は、人工知能の最新情報をご覧ください。

プライベートコードベースが状況を変える理由

著者によれば、Real-SWE は、基礎となるコーディング成果物と命令の特異性という 2 つの軸で、SWE ベンチのような確立されたベンチマークとは異なります。各タスクは独自のシステムから提供され、そのコードとソリューションは公共のインターネット上では入手できません。つまり、エージェントは公共のリポジトリから取得した記憶された回答に頼ることができません。

このタスクはビジネス上の影響も伴います。ベンチマークのタスク例には、請求の適正化、税金の計算、顧客の移行などが含まれます。これは、多くの場合、複数のサービスにわたるビジネスの運営方法に影響を与える変更です。どの企業にも独自の規約やコードの書き方があり、エージェントはそれらの規範を理解し、既存のものに合わせて変更を加える必要があります。

「コーディングエージェントは実際に現実世界でソフトウェアエンジニアの仕事をすることができるのでしょうか?」ベンチマークの導入部分はこう尋ねています。リーダーボードによると、現時点での答えは、せいぜい 3 分の 1 程度に過ぎないということです。

完全なリーダーボード

特定のラボでは、8 つのフロンティア モデルとハーネスの組み合わせを評価し、タスクごとに 8 回の独立した実行で平均した pass@1 としての解決率を 95 パーセントの信頼区間で測定しました。

1. 寓話 5.1 (クロード コード) — 38.8%
2. GPT-6 アストラ (コーデックス CLI) — 33.8%
3. Gemini 3.8 フラッシュ (Gemini CLI) — 31.2%
4. GLM 5.3 (クロード コード) — 28.8%
5. (同率) Grok 4.6 (Grok Build) — 23.8%
5. (同点) Muse Spark 1.3 (Muse Code) — 23.8%
7. キミ K3 (キミ コード) — 18.8%
8. GPT-5.6 ソル (コーデックス CLI) — 16.2%

この結果は週末に Hacker News で広く議論され、ベンチマークは数百の賛成票を集め、プライベート コードベースの評価がエージェントの進歩の正しい基準であるかどうかについて活発な議論が行われました。

狭いながらも意味のある上部のスプレッド

上位 4 つのシステム間のギャップは、現在の競争環境を物語る点で注目に値します。 OpenAI の GPT-6 Astra に対する Fable 5.1 の 5 ポイントのリードは、すべてのタスクが実際の運用上の問題であるベンチマークでは意味があります。 Gemini 3.8 Flash が 3 位になったのは驚くべきことです。なぜなら、このモデルはフラッグシップ推論システムというよりも、高速で低コストの主力製品として位置付けられているからです。クロード コードを通じて評価された Z.ai の GLM 5.3 がリーダーから 5 ポイント以内に着いたことは、オープンウェイト モデルが実際のエンジニアリング作業においていかに競争力のあるものになっているかを強調しています。

同様に、下部のスプレッドもわかります。 OpenAI の以前のリリースである GPT-5.6 Sol は、解決するタスクの数が Fable 5.1 の半分以下です。これは、フロンティアがどれほど急速に移動したか、そしてわずか 1 モデル世代前にその減少がどれほど急であるかを思い出させます。

ハーネスはモデルと同じくらい重要です

ベンチマークの方法論的選択の 1 つは注目を集めています。Real-SWE は、モデルを個別に評価するのではなく、ネイティブ ハーネス (Claude Code、Codex CLI、Gemini CLI、Grok Build) を使用して、エンタープライズ エンジニアが実際にどのように作業しているかを反映しています。リーダーボードでは、モデルとハーネスの組み合わせが明示的にランク付けされており、スキャフォールディング、ツール アクセス、および反復ループが実際のデプロイメントにおけるモデルの機能から切り離せないものになっていることが認識されています。

企業がシステムを選択する際には、その枠組みが重要です。同じモデルでも、それに巻き付けられているエージェント ハーネスに応じてパフォーマンスが大きく異なる可能性があり、公開ベンチマーク数値に基づいてコーディング アシスタントを評価している購入者は、それらのシステムが独自のコードベースでどのように動作するかについて、歪んだ状況を把握している可能性があります。

業界にとっての意味

フロンティアモデルが公開テストでほぼ完璧なスコアを記録し、それがトレーニングデータに漏洩するなど、ベンチマークは飽和状態にあると繰り返し非難されてきた。 Real-SWE の設計は、両方の問題に同時に対処しようとしています。コードは非公開でライセンスが付与されており、タスクは実際に働いているエンジニアリング チームの本物の作業成果物であり、指示は洗練された問題ステートメントではなく、実際のチケットの乱雑な特異性を反映しています。

身の引き締まる思いは絶対的なレベルです。最良のシステムであっても、最初の試行で解決できる実際のエンタープライズ タスクは 10 件中 4 件未満であり、8 回の実行で平均されます。エージェントティック コーディングはこれだけ進歩しているにもかかわらず、ベンチマークは、実際の実運用システムにおける自律的なソフトウェア エンジニアリングが依然として監視下で行われている作業であることを示唆しています。つまり、ベンダーのデモが示すよりも人間のエンジニアがレビュー、リダイレクト、修復を行う頻度がはるかに高いのです。

コーディング アシスタントの中から選択する企業にとって、このベンチマークは実用的なチェックリストを提供します。プライベート コードで評価されるシステムを好み、単一実行のヘッドライン数値よりも信頼区間を重視し、生のモデルの機能と同じくらいハーネスの品質を重視します。 Real-SWE の最初のリーダーボードが最後の言葉ではありませんが、これはエージェント コーディングについてすべてのエンジニアリング リーダーが抱いている質問に対するこれまでで最も直接的な答えです。

コーディング エージェント、モデル リリース、およびそれらを形成する研究の詳細については、次のベンチマーク結果が発表されるときに最新の AI ニュースに従ってください。

---

AIの最新情報をお届け

AIの最新ニュース、分析、ブレイクスルーを一箇所で。

AIニュースをもっと読む →