Google DeepMind は、コンピューターの使用を Gemini 3.5 Flash 内の組み込みツールに変え、サードパーティのフレームワークを利用することなく、プラットフォーム間でソフトウェアと対話できる AI エージェントを構築するネイティブな方法を開発者に提供します。
2026 年 6 月 24 日に Google の公式 Keyword ブログで公開されたこの発表では、Gemini 3.5 Flash が、最近まで大規模なカスタム エンジニアリングが必要だった、画面の表示、カーソルの移動、クリック、入力ができるエージェントの急速に変化する市場における競争相手として位置づけられています。 この件の詳細は、人工知能の最新情報をご覧ください。
「コンピューターを使用することで、プラットフォーム間で対話できるエージェントを構築するための Gemini 3.5 Flash の組み込みツールが利用できるようになりました」と同社は書いています。この投稿は、Google DeepMind のプロダクト マネージャーである Mateo Quiros によって作成されました。
仕組み
コンピューターを使用すると、モデルは画面上の内容を解釈し、クリック、スクロール、テキストの入力などのアクションを実行することで、人間と同じようにコンピューターを操作できます。 Google は、この機能を別の製品として提供するのではなく、Gemini 3.5 Flash に直接組み込むことで、実際のアプリケーション、Web サイト、オペレーティング システムをナビゲートするエージェントを構築したい開発者の障壁を下げています。
ブログ投稿によると、開発者や企業は、Gemini API と、エージェントを大規模に構築および展開するための Google の専用環境である Gemini Enterprise Agent Platform を介して、3.5 Flash でのコンピュータの利用を開始できるという。
Google は、具体的なユースケースを使ってその機能を実証しました。一例では、Gemini 3.5 Flash はコンピューターを使用して Gemini アプリ自体を分析し、分類された機能のリストを返しました。別のモデルでは、アクセシビリティの問題について、モデル自体の文書を監査しました。これは、コンピュータを使用するエージェントが、いつかそれらが実行されるソフトウェア エコシステムの維持にどのように役立つかを示唆する自己参照的なタスクです。
安全性: 敵対的トレーニングと「多層防御」アプローチ
このリリースの最も重要な部分は、Google が安全性について述べたことかもしれません。ライブ環境で動作するエージェントは、プロンプト インジェクション (Web ページ、電子メール、またはドキュメントに埋め込まれた隠された命令によってエージェントがハイジャックされ、意図しないアクションを実行する攻撃) に対して独特の脆弱性を持っています。
Googleは、これらのリスクを軽減するために、Gemini 3.5 Flashでのコンピュータ使用に対象を絞った敵対的トレーニングを使用したと述べた。また、オプションの 2 つのエンタープライズ セーフガード システムもリリースします。これにより、組織はエージェントが実行できることをより適切に制御できるようになると同社は述べています。
Google は「多層防御」アプローチを採用し、これらの機能を安全なサンドボックス、人間参加型検証、厳格なアクセス制御と組み合わせるように開発者に推奨しました。同社は、この機能のベスト プラクティス ドキュメントで追加のガイダンスを公開しました。
その枠組みが重要です。コンピュータの使用は、侵害されたエージェントがユーザーのアカウントやシステム内で実際のアクションを実行する可能性があるため、導入するのがより危険なエージェント機能の 1 つであると広く認識されています。 Googleは、敵対的トレーニングと多層的な保護手段を先導することで、カーソルの制御をAIに委ねることに躊躇する企業の購入者を安心させようとしている。
コンピューターの使用が戦場になっている理由
Gemini 3.5 Flash のコンピュータ使用は、主要な AI 研究所が質問に答えるだけでなく有用な作業を実行できるエージェントの開発を競う中、登場しました。 Anthropic は 2024 年後半に Claude 用のコンピューター使用ツールを導入し、OpenAI のオペレーター製品とエージェント製品も同じ方向を目指しています。この機能をプレミアム層用に確保するのではなく、Flash のような高速でコスト効率の高いモデルにネイティブにすることは、Google がエージェント制御を迅速にコモディティ化したいことを示しています。
Flash を選択したこと自体が注目に値します。 Flash は Google の効率層モデルであり、速度とコストが最適化されています。大規模な Pro モデルだけでなく、そこにコンピュータの使用を組み込むということは、Google が大量のレイテンシーに敏感なエージェント ワークロード、つまりビジネス ソフトウェア全体にわたる反復タスクを大規模に自動化する種類のワークロードを期待していることを示唆しています。
Googleは、顧客がコンピュータの使用によって価値を高めているのをすでに目にしていると述べたが、ブログ投稿では具体的な商用展開の名前やその結果の定量化については触れていない。
競争上の賭け金
開発者にとって、組み込みのコンピュータ使用ツールの魅力は明白です。維持する必要のある統合が少なく、単一のベンダーがモデルとエージェント層の両方を担当できるということです。しかし、それは同時に Google のプラットフォームへの依存を深め、企業はモデルに依存しないエージェント フレームワークの柔軟性とのトレードオフを考慮することになります。
この解放はまた、エージェント経済におけるより広範な緊張を先鋭化させる。複数の LLM プロバイダーを OpenAI 互換にする Lightport フレームワークなど、独立して開発されたオープンソース エージェント ゲートウェイは、ポータブル エージェント インフラストラクチャに対する需要がどれほどあるかを示しています。 Google の賭けは、ファーストパーティの安全性が強化されたコンピュータ使用ツールが、サードパーティのツールをつなぎ合わせようとする開発者を魅了することだ。モデルが画面上で動作する機能を獲得するにつれて、AI アシスタントと自律型オペレーターの間の境界線は曖昧になり続けています。同様に、生産性の向上とセキュリティ責任の間の境界線も曖昧になってきています。この緊張に対する Google の答えは、多層的な安全策と敵対的トレーニングです。それがリスクを嫌う企業を満足させるのに十分であるかどうかによって、コンピューターを使用するエージェントがデモから日常使用にどれだけ早く移行できるかが決まります。
Google は、Gemini 3.5 Flash で明確な賭けをしました。AI の未来は単に応答するモデルではなく、動作するモデルです。開発者が自社のプラットフォーム上でそれらの動作するモデルを構築することを望んでいます。
---
AIの最新情報をお届けAIの最新ニュース、分析、ブレイクスルーを一箇所で。
AIニュースをもっと読む →


