Googleは火曜日、Gemini 3.8 Flashを発売した。これは、同社の最高の推論およびコーディングシステムとして位置付けられている最新の主力モデルでありながら、防御的なサイバーセキュリティ作業のために構築されたGemini 3.8 Flash Cyber​​と呼ばれる特殊なバージョンと並んで、前モデルと同じ価格である。この発表は、製品管理担当シニア ディレクターの Tulsee Doshi 氏と、Google DeepMind の Gemini セキュリティ リードである Raluca Ada Popa 氏によって Google 公式ブログで公開されたもので、Google がわずか 6 週間で 3 回目の Flash リリースを行うことになります。

この発売は、異常に混雑したリリースシーズンの真っ只中に行われ、競合他社がGoogleのモデルラインに課している価格と性能のプレッシャーに対する直接の答えとなる。フロンティア ラボがどのように打撃を交換しているかをより広範に把握するために、AI ニュース速報 チームは、メジャー モデルのリリースが発生するたびに追跡しています。

2 つのバリエーション、1 つの基礎

Gemini 3.8 には、同じ基本インテリジェンスに基づいて構築された 2 つのバージョンがあります。 Gemini 3.8 Flash は汎用の主力製品です。Google によれば、ソフトウェア エンジニアリング、エージェント タスク、特殊な領域での複数ステップの推論にわたって 3.7 Flash に比べて大幅な改善を実現しており、その導入価格は同じ 100 万入力トークンあたり 0.75 ドル、100 万出力トークンあたり 3.75 ドルです。

Gemini 3.8 Flash Cyber​​ は、Google の最も有能なサイバーセキュリティ モデルと言われており、脆弱性検出と自動パッチ適用において同社がフロンティア レベルのパフォーマンスと呼ぶものを備えています。標準の Flash モデルとは異なり、広く利用できるわけではありません。Google は、Fairwind と呼ばれる新しいプログラムを通じて、一連の信頼できる防御者に配布しています。

ブログ投稿によると、共有コア全体でのコーディングと推論の向上は、サイバーセキュリティの要求の厳しい領域での厳しいトレーニングによって部分的に促進され、両方のモデルは、基礎となるモデルを再帰的に評価して改良するように設計された長時間実行のエージェント ループによって高速化されました。

ベンチマーク: 大きくなるだけでなく、より熱心に取り組む

Google のベンチマークの主張は、同社が簡潔に要約した設計哲学に基づいています: 3.8 Flash は「より強力に機能する」。複雑なタスクでは、モデルは追加の推論ステップを実行し、ツールを繰り返し呼び出します。場合によっては、より高い作業レベルでパフォーマンスを最大化するためにより多くのトークンを消費します。開発者は、トークンのオーバーヘッドを削減するために労力を減らすことも、効率性を最優先したワークロードに対して引き続き完全にサポートされている Gemini 3.7 フラッシュを使い続けることもできます。

Google が引用した見出しの結果は次のとおりです。

  • DeepSWE v1.1 (長期的なソフトウェア エンジニアリング): 3.8 Flash は、Google が数分の 1 のコストで複雑なエンジニアリングの問題をエンドツーエンドで自律的に解決する点で、ほとんどの大規模なフロンティア モデルよりも優れたパフォーマンスを発揮します。
  • Vals Finance Agent V2 および Harvey's Legal Agent Benchmark: 3.8 Flash は、高度な分析とレポートを必要とする定量的および専門的分野において、3.7 Flash やその他のフロンティア モデルよりも優れています。
  • HLE 検証済み: 3.8 Flash は 54.9% を達成しており、Google はこれを STEM、人文科学、専門分野にわたる多段階推論の証拠として示しています。

Flash Cyber: 攻撃よりも防御

Cyber バージョンは、より珍しいリリースです。 Googleは、エクスプロイトなどの攻撃的な機能よりも脆弱性の修正を意図的に優先したと述べている。 Collinear が実行する外部パッチベンチマークである CWE-Bench では、Gemini 3.8 Flash Cyber​​ は 47.2% の合格@1 を記録しました。Google によると、主要なフロンティア モデルの 47.8% にわずかに及ばないものの、コストが大幅に低く、ベンチマークのパレート フロンティアに位置しています。

Googleは、脆弱性発見のための標準的な業界ベンチマークであるCyber​​Gymにおいて、Cyber​​モデルはフロンティアレベルの自律的な脆弱性発見を実証しており、前身の3.5 Flash Cyber​​や大幅に大規模なフロンティアモデルを上回っていると述べている。 20 のプログラミング言語の複雑なコードベースにわたる Google の内部ベンチマークでは、このモデルは 70% を超える成功率に達しました。

すでに Google 独自のコードを保護しています

Google によれば、Cyber モデルはすでに社内に導入されており、提供されている例は具体的です。

  • Chrome セキュリティ チームは、3.8 Flash Cyber​​ が、最高の商用モデルよりも 2.6 倍多く、Chrome の脆弱性に対して正確なパッチを生成したことを発見しました。これははるかに規模が大きいです。
  • セキュリティ会社 Wiz では、このモデルは、他の主要なフロンティア モデルと比較して、2.3 ~ 5.2 倍の低コストで、内部侵入テスト ベンチマークで 7.5 ~ 9.7 パーセント高い再現率を達成しました。
  • Google のクラウド脆弱性調査チームは、このモデルを使用して、重大な基礎的脆弱性を 2 時間以内に発見しました。Google によれば、この脆弱性の種類は、調査と発見に通常数か月かかります。

開発者と市場にとっての意味

開発者にとって実際に得られるのは、フロンティアのローエンドでの価格の安定です。 3.8 Flash を 3.7 の導入価格で維持することで、競争力のあるコーディングおよびエージェント モデルのコストは 100 万トークンあたり 0.75 ドル / 3.75 ドルに抑えられます。このセグメントでは、無差別級の挑戦者やライバルのラボが年間を通じて既存企業を下回っています。 Google のメッセージは、購入者が主力層のコストと機能のどちらかを選択する必要がなくなったということです。

Flash Cyber​​ の Fairwind Program 配布モデルも同様に物語っています。最前線のラボでは、精鋭のサイバーセキュリティ能力を広く出荷するのではなくゲートするものとして扱うことが増えており、攻撃的な悪用の可能性を制限しながら、精査された防御者に最先端の防御ツールを提供しています。モデルのトレーニングにおける活用機能よりもベンチマークのパッチ適用を優先するという Google の決定も、同じ論理に従っています。

リズムも顕著です。 6 週間で 3 回の Flash リリース(3 週間前の 3.7 Flash、今回の 3.8)は、Google が 2 年前の年次スタイルのリリース サイクルよりもはるかに速く中間層ラインを反復していることを示しています。 OpenAI の GPT-6 の展開による競争圧力と、中国からの急速に動く無差別級モデルの波により、すべての人のタイムラインが圧縮されており、Google は明らかに主力層でのスピードを選択しており、自社のフロンティア モデルは研究の旗を掲げています。

3.8 Flash の「よりハードに動作する」アプローチ(勤勉な複数ステップの推論により多くのトークンを費やす)が、生のモデル スケールよりも実際に効率的であることが証明されるかどうかは、今後数か月のうちに開発者の請求書に反映されるでしょう。 Google 自身のベンチマークは、この取引が勤勉さを優先する可能性があることを示唆しています。市場は一度に 1 つの API 請求書ごとに評決を下します。

AI の一歩先を行く

すべてのモデルの発売、ベンチマーク、価格の変化を随時追跡 — AI ニュースの続きを読む →