Devin AI ソフトウェア エンジニアを擁する Cognition は、木曜日に SWE-2 を発表し、これを同社のこれまでで最も先進的なコーディング モデルであると説明しました。同社は9月10日に公開したブログ投稿で、新モデルは機能とコストのパレートフロンティアと呼ばれるものを押し広げ、FrontierCode 1.1 Mainベンチマークで50.0%のスコアを獲得しながら、50.9%でわずか1ポイント上に位置するAnthropicモデルであるFable 5.1よりもコストが64%低いと述べた。

このローンチは、Cognition が評価額 480 億ドルで 20 億ドルの資金調達ラウンドを確認してからわずか 1 日後に行われ、このエージェント コーディングのスタートアップがサードパーティのフロンティア モデルだけに依存するのではなく、自社のモデル開発にいかに積極的に投資しているかを示しています。 AI コーディング競争や業界を動かすその他すべてのことを継続的に報道するには、AI ニュース最新情報の毎日の情報源である AI Buzz Wire をブックマークしてください。

SWE-2 がベンチマークに到達する場所

Cognition が公開した結果によると、SWE-2 は FrontierCode 1.1 Main で 50.0% を記録し、Grok 4.6 の 48.0%、GPT-5.6 Sol の 47.5% を上回り、53.3% でこの分野をリードする GPT-6 Astra の射程内にあります。 DeepSWE 1.1 ベンチマークでは、SWE-2 は 73.0% に達し、Cognition リストにあるモデルの中で Astra の 74.1% に次ぐ 2 番目です。

最も優れた結果を示しているのは Terminal-Bench 2.1 で、SWE-2 のスコアは 92.8% で、Cognition の比較表で最も高い数値であり、Fable 5.1 の 91.4% や GPT-6 Astra の 89.9% を上回っています。より難しいターミナルベンチ 4 では状況が変わり、GPT-6 アストラの 57.9%、Fable 5.1 の 55.8% に対して、SWE-2 は 27.3% を管理しています。これは、モデルの効率第一の設計がタスクの難易度の最上位に余裕を残していることを思い出させます。

Cognition はこの位置付けを率直に要約しています。FrontierCode 1.1 Main および DeepSWE 1.1 では、SWE-2 はスコアとコストの両方で前モデルの SWE-1.7 および Grok 4.6 を上回り、価格の数分の 1 で GPT-5.6 Sol および Fable 5/5.1 に匹敵し、コストの 4 分の 1 では GPT-6 Astra の数ポイント以内に来ています。

数兆規模で キミ K3 からトレーニング後のトレーニング

SWE-2 は最初から構築されたものではありません。 Cognition は、すでにエージェント コーディングのための大規模な強化学習を経た Moonshot AI の 2.8 兆パラメータの基本モデルである Kim K3 のモデルをポストトレーニングしました。その基盤に加えて、Cognition 社は、RL プロセスによって多くのベンチマークで 5 ~ 6 ポイントが追加され、K3 のコストパフォーマンスのフロンティア全体が変化したと述べています。

同社によれば、SWE-2 は、SWE-1.7 用に開発されたトレーニング インフラストラクチャとレシピに基づいて強化学習を数兆パラメータ領域に拡張した初めての製品であるとのことです。重要な追加点は、低、中、高の労力を個別のトレーニング ターゲットとして扱うのではなく、すべての推論努力レベルを 1 回の実行でトレーニングする RL アルゴリズムです。

コストペナルティがフロンティア全体を形作る

SWE-2 のトレーニングの中心となるアイデアは、単一の RL 実行内のエフォート レベルごとに線形コスト ペナルティを適用することであり、各ペナルティはベース モデルのパレート フロンティアの局所的な傾きに合わせて調整されます。コグニション社によると、第一原理から導き出されたこのアプローチは、モデルの形状を維持し、実際のユーザーのコストをトレーニングに可能な限り直接反映しながら、モデル全体のコストパフォーマンスの最前線を前進させます。

同社はまた、SWE-1.6 以来使用している長さ加重報酬ベースラインについても詳しく説明しました。これにより、デコード スループットを向上させるオンライン ドラフト モデルを含む RL ロールアウト サービングの改善とともに、トレーニングが大幅に安定化したと評価しています。 Cognition 社は、NVFP4 および FP8 カーネルと量子化対応トレーニングにより、基本モデルのパラメータが前モデルのほぼ 3 倍であるにもかかわらず、全体的なメモリ使用量を削減したと述べています。

トレーニング データ パイプラインも拡張されました。Cognition は RL 環境の数を 3 倍に増やし、命令に従うオーバーレイを追加し、モデルのスコア付けに使用される検証器を反復的に強化する以前の SWE-2 チェックポイントを利用したフライホイールを構築しました。

インテリジェンスと同じくらい効率も重視

認識は、SWE-2 の向上が効率と密接に関係していると考えています。同社によれば、エンジニアリング上の判断が強化されることで、エージェントは寄り道や冗長な読み取りを減らして、より完全なソリューションを作成できるようになります。 FrontierCode 1.1 Main では、SWE-2 の中程度の労力の構成は、SWE-1.7 よりもスコアが高く、ターン数が 58% 少なく、コストが 81% 低くなります。

その枠組みはコグニションのビジネスにとって重要だ。 Devin は自律型ソフトウェア エンジニアとして売り出されており、推論コストが価格設定と利益に直接影響します。タスクごとのターンとトークンを削減しながら、フロンティアに隣接した品質を維持するモデルは、同社が提供するすべての Devin セッションの経済性を変えます。

可用性

同社によると、SWE-2は今日からDevin DesktopとDevin CLIで利用可能となり、Devin WebとFusionでの展開も進行中だという。コグニション社は、数日以内にユーザーはモデルが表面全体に表示されるのを確認できるはずだと述べている。

コーディング モデル市場にとっての意味

このリリースにより、GPT-6 Astra の後ろにすでに混雑している集団がさらに引き締められます。 Cognition は現在、Anthropic、OpenAI、xAI の製品を大幅に低コストで利用できるモデルを所有しており、モデルからエージェント製品までのフルスタックを制御しています。競合他社は、特に SWE-2 のコスト プロファイルが最も強い中程度の難易度の大量のタスクでは、機能だけでなく価格でも対応するというプレッシャーに直面するでしょう。

AI コーディング ツールの購入者にとって、実質的な利点は、フロンティア レベルのコーディング ヘルプにはフロンティア レベルの価格設定が必要なくなるということです。業界の残りの部分にとって、SWE-2 は、基本モデルの規模だけでなく、トレーニング後のインフラストラクチャ効率が決定的な競争力となっている証拠です。

---

AI の先を行く

最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。

AI ニュースをもっと読む→