xAI は、数週間にわたる公開予告と少なくとも 1 回の遅延を経て、これまでで同社のコーディングおよびナレッジ ワーク向けの最も有能なモデルである Grok 4.7 をリリースしました。日曜日に同社のサイトで発表されたこのモデルは、前世代のGrok 4.6と同じ価格と提供速度で登場する。入力トークン100万あたり2ドル、出力トークン100万あたり6ドルで、OpenAIのGPT-5.6 Sol Max(4ドル/20ドル)の定価の約半額で、AnthropicのFable 5.1 Max(10ドル/50ドル)を大きく下回っている。
最新の AI ニュース速報と分析については、AI Buzz Wire をご覧ください。
長時間のタスク向けにトレーニングされた、より大きな基本モデル
xAI の発表によると、Grok 4.7 は Grok 4.6 と比較して新しい大規模な基本モデルを使用し、完了までに何時間もかかる問題に重点を置き、より困難なタスクの組み合わせでより長い強化学習を実行してトレーニングされました。同社によれば、このモデルは自身の作業の検証とより長いコンテキストの管理において優れており、Grok Bot ハーネスをネイティブに理解するように訓練されており、会話タスクと一般知識作業が改善されているという。
騒々しい助走の後にリリースが行われます。 TeslaNorth.com によると、イーロン・マスク氏は最初、9月上旬にGrok 4.7は10日以内にリリースされるだろうと述べ、その後9月中旬にモデルにはさらに数日の改良が必要であることを認めたという。現在出荷されており、GitHub は同日、Grok 4.7 が GitHub Copilot で利用可能であることを確認しました。
ベンチマーク画像: 強力ではあるが、広範囲にわたるものではない
xAI が公開したベンチマーク データは、いくつかの長期的なカテゴリでリードしながら、他のカテゴリでは Anthropic の最も高価な構成に遅れをとっているモデルを示しています。
- 長時間実行されるコーディング タスクに重点を置く CursorBench 4.0: Grok 4.7 のスコアは 46.3% で、GPT-5.6 Sol Max (41.7%) および Grok 4.6 High (40.4%) を上回っていますが、Fable 5.1 Max (51.8%) には及んでいません。
- Terminal-Bench 4.0、複数時間のターミナル作業: 38.0%、Grok 4.6 の 20.3% から大幅に増加し、GPT-5.6 Sol Max (37.3%) をわずかに上回っていますが、Fable 5.1 Max が 57.9% でリードしています。
- EEBench、電気工学ベンチマーク: 64.0%、Grok 4.6 の 53.0% から大幅に上昇し、リストされているモデルの中で最高です。
- DeepSWE v1.1: 高負荷時では 71.0%、Grok 4.6 では 65.2%、GPT-5.6 Sol Max では 72.7%。
- AA ブリーフケース v1.1、複数時間のオフィスワーク数: 1,546 から 1,657 に増加し、Fable 5.1 Max の 1,678 に迫っています。
- Harvey Legal Agent Benchmark: 19.6%、この指標では Grok 4.6 (15.8%) を上回り、GPT-5.6 Sol Max (2.5%) および Fable 5.1 Max (6.7%) を大きく上回っています。
- HealthBench Professional: 56.7% で、Grok 4.6 の 48.5% を上回っていますが、GPT-5.6 Sol Max (60.5%) や Fable 5.1 Max (62.1%) には及んでいません。
Elo によってスコア付けされた専門知識作業ベンチマークである GDPval では、xAI のグラフでは Grok 4.7 の xhigh 推論値が 1,695 で、Grok 4.6 の 1,605 から増加し、Fable 5.1 Max (1,735) に次ぎ、GPT-6 Astra Max (1,542) を上回っています。
価格が物語です
この発表の中で最も積極的な主張は、技術的というよりも経済的なものである。xAI は、Grok 4.7 は同等のモデルの半分の価格で 2 倍高速であると説明しており、公開された価格表は、主要なライバル 2 社の最上位構成との主要な比較を裏付けている。 Grok 4.7 の 2 ドル/6 ドルのトークン価格は Grok 4.6 から変更されていません。つまり、購入者は価格を上げることなく世代間の改善を得ることができます。
この位置付けは、xAI が Grok 4.x 製品ライン全体で追求してきた戦略を拡張するものです。OpenAI や Anthropic のプレミアム価格帯を引き下げながら、最前線の品質に匹敵するかそれに近づき、GitHub、Cursor、OpenRouter などのパートナーを通じて積極的に配布します。
何を見るべきか
正直な注意点は、xAI 自体が比較表を公開しており、ベンチマーク アグリゲーターからの独立した検証には数日かかるということです。 xAI が強調するために選んだ数字に関して言えば、Grok 4.7 は Grok 4.6 からの真のステップアップです (ターミナルベンチ 4.0 と EEBench で最も顕著に現れています) が、出力トークンあたりのコストが 5 倍高い一方で、コーディングと健全性ベンチマークでリードを維持している Fable 5.1 Max を圧倒するわけではありません。
数時間にわたる長時間のエージェント ワークロードを実行する開発者にとっては、リーダーボードでの順位よりも価格パフォーマンスの計算の方が重要になる場合があります。 Grok 4.7 は、xAI の API および GitHub Copilot を通じて現在入手可能です。
AI の一歩先を行く
AI 業界の最も重要な動向を継続的に報道するには、AI Buzz Wire をブックマークして、ニュース速報を見逃さないようにしてください。
AI ニュースをもっと読む