Google DeepMind a transformé l'utilisation de l'ordinateur en un outil intégré à Gemini 3.5 Flash, offrant aux développeurs un moyen natif de créer des agents d'IA capables d'interagir avec des logiciels sur toutes les plates-formes sans recourir à des frameworks tiers.

L'annonce, publiée le 24 juin 2026 sur le blog Keyword officiel de Google, positionne Gemini 3.5 Flash comme un concurrent sur le marché en évolution rapide des agents capables de voir un écran, de déplacer un curseur, de cliquer et de taper — des capacités qui nécessitaient jusqu'à récemment une ingénierie personnalisée importante. Pour plus de contexte sur cette histoire, consultez notre tendances IA.

"L'utilisation de l'ordinateur est désormais un outil intégré dans Gemini 3.5 Flash pour créer des agents capables d'interagir sur plusieurs plates-formes", a écrit la société. Le message a été rédigé par Mateo Quiros, chef de produit chez Google DeepMind.

Comment ça marche

L'utilisation d'un ordinateur permet à un modèle de faire fonctionner un ordinateur un peu comme le ferait un humain : en interprétant ce qui est à l'écran et en effectuant des actions telles que cliquer, faire défiler et saisir du texte. En intégrant cette fonctionnalité directement dans Gemini 3.5 Flash plutôt que de la proposer en tant que produit distinct, Google abaisse les barrières pour les développeurs qui souhaitent créer des agents capables de naviguer dans des applications, des sites Web et des systèmes d'exploitation réels.

Selon le billet de blog, les développeurs et les entreprises peuvent commencer à utiliser les ordinateurs en Flash 3.5 via l'API Gemini et la Gemini Enterprise Agent Platform, l'environnement dédié de Google pour créer et déployer des agents à grande échelle.

Google a démontré cette capacité avec des cas d'utilisation concrets. Dans un exemple, Gemini 3.5 Flash a utilisé l'ordinateur pour analyser l'application Gemini elle-même et renvoyer une liste catégorisée de fonctionnalités. Dans un autre cas, le modèle a audité sa propre documentation pour les problèmes d'accessibilité – une tâche autoréférentielle qui suggère comment les agents utilisant un ordinateur pourraient un jour aider à maintenir les écosystèmes logiciels sur lesquels ils fonctionnent.

Sécurité : entraînement contradictoire et approche de « défense en profondeur »

La partie la plus importante de la publication est peut-être ce que Google a dit à propos de la sécurité. Les agents qui opèrent dans des environnements réels sont particulièrement vulnérables aux attaques par injection rapide, dans lesquelles des instructions cachées intégrées dans une page Web, un courrier électronique ou un document détournent l'agent pour qu'il entreprenne des actions involontaires.

Google a déclaré avoir utilisé une formation contradictoire ciblée sur l'utilisation de l'ordinateur dans Gemini 3.5 Flash afin d'atténuer ces risques. Elle propose également deux systèmes de sauvegarde d'entreprise facultatifs qui, selon la société, permettent aux organisations de mieux contrôler ce que leurs agents peuvent faire.

En adoptant une approche de « défense en profondeur », Google a encouragé les développeurs à combiner ces fonctionnalités avec un sandboxing sécurisé, une vérification humaine dans la boucle et des contrôles d'accès stricts. La société a publié des conseils supplémentaires dans sa documentation sur les meilleures pratiques pour cette fonctionnalité.

Ce cadrage est important. L'utilisation d'un ordinateur est largement considérée comme l'une des capacités d'agent les plus dangereuses à déployer, car un agent compromis peut entreprendre des actions réelles au sein des comptes et des systèmes d'un utilisateur. En menant une formation contradictoire et des protections à plusieurs niveaux, Google tente de rassurer les acheteurs d'entreprise qui hésitent à confier le contrôle d'un curseur à une IA.

Pourquoi l'utilisation de l'ordinateur devient un champ de bataille

L'utilisation informatique de Gemini 3.5 Flash arrive alors que les principaux laboratoires d'IA se précipitent pour créer des agents capables d'effectuer un travail utile plutôt que de simplement répondre à des questions. Anthropic a présenté un outil d'utilisation informatique pour Claude fin 2024, et les produits d'opérateur et d'agent d'OpenAI ont poussé dans la même direction. Rendre cette fonctionnalité native à un modèle rapide et rentable comme Flash – plutôt que de la réserver à un niveau premium – indique que Google souhaite banaliser rapidement le contrôle des agents.

Le choix de Flash est en lui-même remarquable. Flash est le modèle efficace de Google, optimisé pour la vitesse et le coût. L'intégration de l'utilisation de l'ordinateur ici, plutôt que seulement dans le modèle Pro plus large, suggère que Google s'attend à des charges de travail d'agents à volume élevé et sensibles à la latence, du genre qui automatisent les tâches répétitives dans les logiciels d'entreprise à grande échelle.

Google a déclaré qu'il voyait déjà ses clients générer de la valeur grâce à l'utilisation de l'ordinateur, bien que le billet de blog ne mentionne pas de déploiements commerciaux spécifiques ni ne quantifie les résultats.

Les enjeux compétitifs

Pour les développeurs, l’attrait d’un outil informatique intégré est simple : moins d’intégrations à maintenir et un seul fournisseur responsable à la fois du modèle et de la couche agent. Mais cela renforce également la dépendance à l'égard de la plate-forme de Google, un compromis que les entreprises devront peser par rapport à la flexibilité des cadres d'agents indépendants du modèle.

Cette publication accentue également une tension plus large dans l’économie des agents. Les passerelles d'agent open source développées indépendamment, telles que le framework Lightport qui rend plusieurs fournisseurs LLM compatibles OpenAI, montrent à quel point il existe une demande pour une infrastructure d'agent portable. Le pari de Google est qu'un outil informatique propriétaire et sécurisé séduira les développeurs qui, autrement, assembleraient des outils tiers. À mesure que les modèles acquièrent la capacité d’agir sur les écrans, la frontière entre un assistant IA et un opérateur autonome continue de s’estomper – tout comme la frontière entre une avancée en termes de productivité et un problème de sécurité. La réponse de Google à cette tension consiste en des garanties à plusieurs niveaux et une formation contradictoire. La question de savoir si cela suffira à satisfaire les entreprises réticentes à prendre des risques déterminera la rapidité avec laquelle les agents utilisant des ordinateurs passeront des démos à une utilisation quotidienne.

Avec Gemini 3.5 Flash, Google a fait un pari clair : l’avenir de l’IA ne se limite pas à des modèles qui répondent, mais à des modèles qui agissent – ​​et il veut que les développeurs construisent ces modèles agissant sur sa plateforme.

---

Restez à la Pointe de l'IA

Les dernières actualités, analyses et percées en IA — au même endroit.

Lire plus d'actualités IA →