xAI は、フロンティア大規模言語モデルの最新版である Grok 4.6 をリリースしました。このバージョンでは、人工分析インテリジェンス インデックスで 61 を獲得し、OpenAI の GPT-5.6 Sol に匹敵します。このモデルは本日リリースされ、OpenRouter、Vercel、Cloudflare を介した API アクセスとパートナー統合により、Cursor および Grok Build ですぐに利用可能になります。

最新の AI ニュース速報と分析については、AI Buzz Wire をご覧ください。

わずかなコストでフロンティア インテリジェンスを実現

独立系ベンチマーク プラットフォームである Artificial Analysis によると、Grok 4.6 はインテリジェンス インデックスで前世代の Grok 4.5 より 5 ポイント向上し、xAI を OpenAI と並ぶフロンティア層に戻しました。このモデルは、Anthropic の Claude Opus 5 (63) および Claude Fable 5 (62) のすぐ後ろに位置し、Kimi K3 の前に位置します。

Grok 4.6 の特に注目すべき点は、その価格設定です。ヘッドラインの価格は Grok 4.5 から変わらず、入力トークン 100 万あたり 2 ドル、出力トークン 100 万あたり 6 ドルです。つまり、Claude Opus 5 ($5/$25) や GPT-5.6 Sol ($5/$30) を 60% 以上下回っています。タスクあたりの測定コストは 0.84 ドルで、インテリジェンスとコストのパレートの境界線に位置します。

フロンティアでは通常、知性の向上には価格の上昇が伴うため、世代を超えて価格を一定に保つのは異例だ。 Grok 4.6 は、価格を変更せずにインテリジェンス インデックスが 5 ポイント向上しました。

長期稼働エージェント向けに構築

Grok 4.6 は Grok 4.5 をベースに構築されており、xAI によれば、長時間実行されるエージェントと、より野心的なインタラクティブでビジュアルな作業に特に焦点を当てています。同社によれば、このモデルは、トピックの調査、情報の分析、コードベース全体での作業、またはアイデアを洗練されたアプリケーションに変換するなど、多くのステップにわたる複雑なタスクに対応します。

エージェントのベンチマークは、説得力のあるストーリーを伝えています。現実世界のエージェント ナレッジ ワークの主要な尺度である GDPval-AA v2 では、Grok 4.6 は 1753 の Elo を達成し、Claude Opus 5 に次ぎ、統計的には Claude Fable 5 および Qwen3.8 Max と同等です。マルチターン顧客サービスのタウ 3 乗バンキング ベンチマークでは 50.7% のスコアを獲得し、Qwen3.8 Max と並んでトップ 2 に入ります。

CursorBench v3.2 では、Grok 4.6 のスコアは 69.9% で、GPT-5.6 Sol (67.2%) と Grok 4.5 (66.7%) を上回っています。 DeepSWE v1.1 では 65.9%、FrontierCode v1.1 Extended では 61.3% を記録しています。

驚くべき回転効率

Artificial Analysis で得られた顕著な発見の 1 つは、長期的なエージェントのナレッジ ワーク タスクのプライベート ベンチマークである AA-Briefcase での Grok 4.6 の効率プロファイルです。このモデルは 1577 の Elo でデビューし、Fable 5 層に位置します。

効率の数値は驚くべきものです。 Grok 4.6 は、平均して約 53 ターンと 5 億の入力トークンでタスクを解決します。これに対し、Claude Opus 5 の最大値は約 103 ターンと 20 億の入力トークンでした。長期的なエージェント作業ではコンテキストが急速に蓄積されるため、ターンの半分と入力トークンの 4 分の 1 で同等の回答に到達するモデルには、トークンごとの価格設定をはるかに超えるコスト上の利点があります。

トレーニングと安全性

Grok 4.6 では、Grok 4.5 よりも長い補足トレーニングが実行され、推論と高度な技術概念のための厳選されたモデル生成データ、高品質のエンジニアリング データ、改良されたオプティマイザーとトレーニング レシピが使用されました。 xAI は Grok 4.5 を使用して、推論作業、エージェント ハーネス、および STEM、ソフトウェア エンジニアリング、ナレッジ ワークなどのドメインにわたる SFT 軌跡を再生成しました。

このモデルには、Grok 4.5 から変更されていない 500,000 トークンのコンテキスト ウィンドウが搭載されています。 xAI の報告によると、Grok 4.6 は、機能と安全対策の調整に関するこれまでで最も広範な導入前テストと、広範な導入後およびサードパーティによるテストを実施しました。

在庫状況と価格

Grok 4.6 は現在、Cursor および Grok Build で利用可能です。 xAI は、最初の 1 週間、両方のプラットフォーム内で 2 倍の使用量を提供します。価格は入力トークン 100 万あたり 2 ドル、出力トークン 100 万あたり 6 ドルから始まり、高速バリアントは 2 倍の価格で利用できます。キャッシュ ヒットは、100 万トークンあたり 0.50 ドルに割引されます。

xAI のリリースは引き続き急速に行われており、Grok 4.6 は Grok 4.5 のわずか 1 か月後にリリースされます。このモデルでは、特にエージェントのパフォーマンスとコスト効率を優先する開発者にとって、xAI をフロンティア競争における深刻な競争相手として位置付けています。

AI の一歩先を行く

AI 業界の最も重要な動向を継続的に報道するには、AI Buzz Wire をブックマークして、ニュース速報を見逃さないようにしてください。

AI ニュースをもっと読む