Cerebras と OpenAI は、OpenAI API で最初に開始され、Cerebras ハードウェアを利用する新しいサービス層である Ultrafast Mode を世界にいち早く公開しました。 2026 年 8 月 13 日に公開された Cerebras の発表によると、Ultrafast で実行される GPT-5.6 Sol は、品質に妥協することなく 1 秒あたり最大 750 の出力トークン を提供します。

The tier is initially available to a select group of customers, with access expanding over time. Cerebras の Joyce Er 氏が執筆したこの発表では、この製品は、長年にわたって AI 製品開発を定義してきたトレードオフの解決策であると位置づけられています。つまり、モデルがより大きく、よりスマートになると、計算コストとデータ移動コストが増大し、応答時間が遅くなるため、開発者はスピードとインテリジェンスのどちらかを選択する必要がありました。 Readers following the race to accelerate frontier models can track the latest developments on AI Buzz Wire.

超高速とは正確にはどのくらいの速度ですか?

The raw throughput number is striking on its own, but Cerebras also supplied comparative context. According to output speeds reported by Artificial Analysis, an independent benchmarking service, GPT-5.6 Sol on Ultrafast mode runs:

  • フェイブル 5 より 11 倍高速
  • 高速モードでは Opus 4.8 より 5 倍高速

この主張を強調テストするために、Cerebras は、人類最後の試験 (HLE) でこのモデルを人気の競合他社と直接対決させました。このテストは、通常、化学、経済学、文学などの分野で博士号を取得した人のみが回答できる 2,500 問からなる難問のベンチマークです。

The result: GPT-5.6 Sol on Ultrafast answered all 2,500 HLE questions in 11 hours and 11 minutes. Claude Fable 5 needed 78 hours and 27 minutes — more than three days of continuous compute — to arrive at the same conclusions.言い換えれば、Ultrafast は人間の知識の最前線を 1 営業日で処理し、ほぼ 7 倍の速さで同等の精度を達成しました。

Cerebras はそのベンチマーク手法について言及しました。GPT-5.6 Sol Ultrafast は 7 月 10 日に xhigh 推論で Codex を使用してテストされ、一方、Claude Fable 5 は 7 月 13 ~ 15 日に xhigh 推論で Claude Code でテストされました。

ベンチマークだけではない実際のワークロード

途中で品質が低下すると、速度ベンチマークは誤解を招く可能性があります。そのため、Cerebras は、経済的に価値のあるナレッジ ワーク タスクのベンチマークである GDP-Val の結果も強調しました。 Cerebras が Codex 内の中程度の推論で GPT-5.6 Sol および GPT-5.6 Sol Ultrafast を使用して 2026 年 7 月 31 日に実行したテストによると、GDP-Val では、Ultrafast は 品質の低下なしで 5.6 倍のエンドツーエンドの高速化**を実現しました。

同社によれば、GPT-5.6 Solは、法的準備書面、財務モデル、エンジニアリングレポートなど、出力品質と所要時間の両方が財務に直接影響を与える分野において、OpenAIのこれまでで最高のモデルだという。

速度がエージェントの方程式を変える理由

The more consequential shift may be in how AI agents operate.推論が高速化すると、エージェントは一秒を争う問題のクリティカル パスに配置できるため、個人や組織の可能性が変わります。

「GPT-5.6 Sol Ultrafast により、Cerebras は、ユーザーの考え方、コーディング、コラボレーションの方法に常に対応する AI を実現します」と OpenAI の製品担当 Rohan Varma 氏は発表文で引用した声明で述べています。 "We're excited to see how workflows and applications are transformed by Ultrafast inference."

Cerebras outlined several high-stakes scenarios where the speedup matters:

インシデント対応

Web サービスを運営する企業は、Ultrafast を使用して、運用停止の根本原因を突き止めて対処し、顧客の信頼を維持し、収益の損失を防ぎ、SLA に対するダウンタイムの分を節約できます。

サイバーセキュリティ

敵対的で一か八かのサイバー攻撃では、セキュリティ チームは、壊滅的な損失を食い止めるために、悪意のある攻撃者を迅速に検出して対応する必要があります。これは、推論の遅延がダメージ コントロールに直接影響するタスクです。

エージェントの生産性

Ultrafast は、リアルタイムの洞察と更新を提供することで、エージェントとの新しい連携モードを可能にし、並列セッション間でコンテキストを切り替える必要性を減らします。

「以前はタスクが終了するまでに数分待たなければならなかったが、今ではコンテキストを切り替える前にタスクが終了する。生産性がずっと向上した」と OpenAI の研究者 Jeffrey Wang 氏は発表の中で述べた。

パートナーシップの背後にある戦略

Cerebras にとって、この契約は、AI 推論のウエハースケールの高速化を商業化する取り組みにおける新たなマイルストーンとなる。 OpenAI の場合、推論遅延が競争力の差別化要因になっている現在、超高速モードは API にプレミアム速度層を追加します。特に、多くのモデル呼び出しを連鎖させて呼び出しごとの遅延が数分の待機時間につながるエージェント アプリケーションの場合に当てはまります。

両社は、この層をフロンティア AI を使用して入ってくる情報に迅速に対応するための組織の永続的なエッジとして構成し、時間に敏感な作業のための超高速処理と、バックグラウンドで並列化できるコモディティ タスクのための標準処理を組み合わせています。

アクセスは段階的に展開されています。 Cerebras 氏によると、最初に選ばれた顧客グループからのアクセスは時間の経過とともに拡大するとのことなので、興味のある開発者は OpenAI API ドキュメントの可用性を監視できます。

AI の先を行く

人工知能を再構築するハードウェアとインフラストラクチャの競争についてさらに詳しく知りたい場合は、AI Buzz Wire をブックマークし、AI ハードウェア ニュース フィードをフォローしてください。

AIニュースをもっと読む→