Google は火曜日、ソフトウェア エンジニアリング、エンタープライズ ナレッジ タスク、サイバーセキュリティ防御における長期にわたる専門的作業向けに構築された最新のフロンティア モデルである Gemini 4 Argon を発表しました。 Google DeepMind の上級副社長でチーフ AI アーキテクトの Koray Kavukcuoglu 氏は、Google の公式ブログで、このモデルはまず Google の Fairwind プログラムを通じて信頼できるサイバー防御者に展開され、ガードレールが強化されればより広範なアクセスが可能になると述べました。

この発表は、フロンティア AI のリリースが一年で最も忙しい時期の 1 つに行われました。モデルの発売、政策闘争、資金調達ラウンドを継続的に報道するため、AI Buzz Wire は、重要な発展が起こるたびに追跡します。

慎重さによって形作られた段階的な展開

通常のメジャーモデルの発売とは異なり、現在はほとんどのユーザーが Argon を試すことができません。 Googleは、プレリリースモデルへのアクセスに関する米国政府の自主的なプロセスに参加しており、初期のテスターからのフィードバックがガードレールを形成するにつれて、利用可能性を徐々に拡大すると述べた。ロイター通信は、フラッグシップモデルが数カ月の遅れを経て到着すると報じ、VentureBeatは、限定リリース戦略により、依然としてGoogleがOpenAIやAnthropicに対するベンチマークのリードを取り戻すことができると指摘した。ブルームバーグは、発売に先立ってグーグル社内の従業員の間で新モデルに対する明らかな懐疑論があったと報じた。

より幅広いアクセスが可能になった場合、Google は有料 API 顧客と Google AI Ultra サブスクライバーから開始すると述べました。

Google が Argon にできることと言っていること

最大の能力変化は耐久力です。 Argon の出力トークン制限は、以前の 64,000 トークンから業界をリードする 100 万トークンに拡張されました。 Googleは、単一の軌道で数十万のトークンを推論するヘッドルームをモデルに与えることで、セッション間で作業を断片化するのではなく、難しい問題を1回のパスで解決できると主張している。

Google はフロンティアの主張を裏付けるベンチマーク結果を公開しました。

  • DeepSWE v1.1: 77.9% — 現実世界のソフトウェア エンジニアリング ベンチマークの新しい最先端
  • Vals Index: No. 1 — 米国の GDP への貢献を重視した財務、コーディング、法務、税務業務全体でトップのパフォーマンスを発揮
  • AutomationBench: 51.3% — Zapier のエンドツーエンドのビジネス実行ベンチマークで 1 位
  • LVBench: 91.7% — 長時間ビデオの理解における最先端
  • CWE ベンチ v1: 68% — セキュリティ脆弱性の修復で同率 1 位

Google 独自のワークフローの内部

Argon はすでに Google の内部作業を推進しており、同社は珍しく具体的な例を示しました。量子コンピューティングでは、モデルはボトルネック サブルーチンの時空リソースを最適化し、公開されているベースラインを数分で 40% 上回りました。 Argon エージェントのチームは、フリート全体のプロファイリング テレメトリを分析して、メモリの最適化を特定し、Google のデータ センター全体に適用しました。これにより、展開後に 300 TiB 以上が解放され、推定合計で 500 TiB ~ 1 PiB の節約が実現しました。

このモデルは、C/C++ から Rust への大規模なコードの移行も推進しており、re2 や libgav1 などのコア ライブラリの数万行から、Fuchsia Zircon カーネルの 800,000 行以上まで拡張されています。 Google のオープンソース ビデオ デコーダである libgav1 の場合、Argon エージェントは 32,000 行の SIMD コードをコンパイラに適した安全な Rust に置き換え、以前の Rust ポートよりも 2.7 倍高速に動作し、出力が同一のメモリ安全なデコーダを生成しました。

サイバーセキュリティ防御が最優先

アルゴンは、重大なソフトウェアの脆弱性を自律的に発見、検証し、パッチを適用するという防御的なサイバー作業について明確に訓練を受けました。信頼できる防御者と Google 社内チーム向けに、同社はサイバー ガードレールなしのモデルをリリースし、防御者がフル機能を利用できるようにします。脆弱性の修復を測定する CWE ベンチ v1 では、Argon が 68% で首位タイとなり、3.8 Flash Cyber​​ の最前線のパフォーマンスに基づいており、Wiz の内部ブラックボックス侵入テスト ベンチマークにおける攻撃対象領域の発見と概念実証の生成において Argon がそのモデルを上回ったと Google は述べています。

セキュリティ企業 Wiz は、重要な公共インフラを無料で保護する Scan for Good イニシアチブを通じてすでに Argon を使用しています。 Googleは初期のデモンストレーションで、このモデルが世界中の病院で使用されているヘルスケアソフトウェア全体で機密の個人情報を公開する重大な脆弱性を発見したと述べた。これまでのフロンティアモデルが見逃していたリスクだ。

4 層のフロンティア保護策

広く利用できるようになる前に、Google は 4 つの分野で安全対策を強化しています。悪用に対して、Argon は、モデルの内部活性化を監視して悪用を発見する新しい技術を備え、合法的な二重使用研究を維持しながら、サイバーおよび CBRN 攻撃要求を拒否するように設計されています。プロンプト インジェクションに対して、敵対的トレーニングにより Argon Google のモデルはこれまでで最も回復力が高く、Grey Swan の間接プロンプト インジェクション ベンチマークをリードしています。

不整合に対して、Google は Argon の一連の思考と行動を監視し、必要に応じて実行を停止し、専用のインシデント対応チームにアラートを送信する緩和策を導入しています。同社はまた、サンドボックス化されたトレーニングおよび評価環境を強化し、リスクの高い実行の前にそれらを封鎖しました。特に、Google は、モデルの思考が不整合の診断に有用であり続けるよう、推論の透明性を維持するよう業界の他の企業に要請しました。

価格と入手可能性

Argon は、入力トークン 100 万あたり 2 ドル、出力トークン 100 万あたり 10 ドルの導入価格で開始され、キャッシュされた入力トークンは入力価格の 95% オフになります。導入期間の後、価格は入力トークン 100 万あたり 4 ドル、出力トークン 100 万あたり 20 ドルに上昇し、Argon は競合するフロンティア製品に対して積極的に位置付けられます。

この段階的なデビューは、フロンティア リリースの新たな現実を反映しています。今や能力が賭け金であり、差別化要因はコントロールを実証することです。 Google は、サイバー防御者、病院用ソフトウェア、Rust への移行がその適切な事例であり、一般への展開が遅くても、別の安全インシデントよりもコストがかからないと確信しています。開発者と企業は、有料の API と AI Ultra のアクセス ウィンドウに注目する必要があります。Google によれば、ガードレールのテストが可能になり次第、このアクセス ウィンドウが開く予定です。

---

AI の先を行く

最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。

AI ニュースをもっと読む→