Google a annoncé mardi Gemini 4 Argon, son nouveau modèle pionnier conçu pour le travail professionnel à long terme dans les domaines de l'ingénierie logicielle, des tâches de connaissances d'entreprise et de la défense de la cybersécurité. Écrivant sur le blog officiel de Google, Koray Kavukcuoglu, vice-président directeur de Google DeepMind et architecte en chef de l'IA, a déclaré que le modèle était initialement déployé auprès d'un ensemble de cyberdéfenseurs de confiance via le programme Fairwind de Google, avec un accès plus large à suivre une fois les garde-fous renforcés.

L’annonce arrive au cours de l’une des périodes les plus chargées de l’année pour les versions de Frontier AI. Pour une couverture continue des lancements de modèles, des luttes politiques et des cycles de financement, AI Buzz Wire suit les développements importants au fur et à mesure qu'ils se produisent.

Un déploiement progressif marqué par la prudence

Contrairement à un lancement de modèle majeur typique, la plupart des utilisateurs ne peuvent pas essayer Argon aujourd'hui. Google a déclaré qu'il était engagé dans le processus volontaire du gouvernement américain pour l'accès aux modèles en préversion et qu'il étendrait progressivement la disponibilité à mesure que les commentaires des premiers testeurs façonneraient ses garde-fous. Reuters a rapporté que le produit phare arrive après des mois de retard, et VentureBeat a noté que la stratégie de publication limitée permet toujours à Google de revendiquer une avance de référence sur OpenAI et Anthropic. Bloomberg a fait état d'un scepticisme mesurable à l'égard du nouveau modèle parmi les employés de Google avant son lancement.

Lorsqu'un accès plus large arrivera, Google a déclaré que cela commencerait avec les clients API payants et les abonnés Google AI Ultra.

Ce que Google dit qu'Argon peut faire

Le principal changement de capacité est l’endurance. La limite de jetons de production d'Argon a été étendue à 1 million de jetons, un chiffre en hausse par rapport aux 64 000 précédents. Google affirme que donner à un modèle la marge de manœuvre nécessaire pour raisonner sur des centaines de milliers de jetons dans une seule trajectoire lui permet de résoudre des problèmes difficiles en une seule passe plutôt que de fragmenter le travail entre les sessions.

Google a publié des résultats de référence pour étayer cette affirmation :

  • DeepSWE v1.1 : 77,9 % — un nouvel état de l'art sur la référence réelle en matière d'ingénierie logicielle
  • Indice Vals : n° 1 – performance de premier plan dans les domaines de la finance, du codage, du droit et de la fiscalité, pondérée par la contribution au PIB américain
  • AutomationBench : 51,3 % — première place sur le benchmark d'exécution commerciale de bout en bout de Zapier
  • LVBench : 91,7 % – état de l'art en matière de compréhension des vidéos longues
  • CWE-bench v1 : 68 % — à égalité au premier rang pour la correction des vulnérabilités de sécurité

Dans les propres workflows de Google

Argon alimente déjà le travail interne de Google et la société a proposé des exemples inhabituellement concrets. Concernant l'informatique quantique, le modèle a optimisé les ressources spatio-temporelles pour les sous-programmes de goulot d'étranglement, dépassant de 40 % en quelques minutes une référence publiée. En analysant la télémétrie de profilage à l'échelle de la flotte, les équipes d'agents Argon ont identifié et appliqué des optimisations de mémoire dans les centres de données de Google qui ont libéré plus de 300 Tio une fois déployés, avec une économie totale estimée entre 500 Tio et 1 PiB.

Le modèle entraîne également des migrations de code à grande échelle de C/C++ vers Rust, allant de dizaines de milliers de lignes dans les bibliothèques principales comme re2 et libgav1 jusqu'à plus de 800 000 lignes dans le noyau Fuchsia Zircon. Pour libgav1, le décodeur vidéo open source de Google, les agents Argon ont remplacé 32 000 lignes de code SIMD par Rust, convivial pour le compilateur, produisant un décodeur sécurisé en mémoire qui s'exécute 2,7 fois plus rapidement que le port Rust précédent avec une sortie identique.

La défense de la cybersécurité passe avant tout

Argon a été explicitement formé au cybertravail défensif : trouver, valider et corriger de manière autonome les vulnérabilités logicielles critiques. Pour les défenseurs de confiance et les équipes internes de Google, la société publiera le modèle sans cyber-garde-fous afin que les défenseurs bénéficient de toutes leurs capacités. Sur le banc CWE v1, qui mesure la correction des vulnérabilités, Argon occupe la première place avec 68 %, en s'appuyant sur les performances de pointe de 3,8 Flash Cyber, et Google affirme qu'Argon a surpassé ce modèle en matière de découverte de surface d'attaque et de génération de preuve de concept sur le test de pénétration interne de la boîte noire de Wiz.

La société de sécurité Wiz utilise déjà Argon dans le cadre de son initiative Scan for Good, qui protège gratuitement les infrastructures publiques critiques. Lors d'une première démonstration, Google affirme que le modèle a découvert une vulnérabilité critique exposant des informations personnelles sensibles dans les logiciels de santé utilisés par les hôpitaux du monde entier – un risque que les modèles pionniers précédents n'avaient pas vu.

Quatre niveaux de garanties aux frontières

Avant une large disponibilité, Google renforce les garanties dans quatre domaines. Contre les abus, Argon est conçu pour refuser les demandes d'attaques cybernétiques et CBRN tout en préservant la recherche légitime à double usage, avec de nouvelles techniques qui surveillent les activations internes du modèle pour détecter les abus. Face à l'injection rapide, la formation contradictoire a fait d'Argon le modèle le plus résilient de Google à ce jour, en tête du benchmark d'injection rapide indirecte de Grey Swan.

En cas de désalignement, Google déploie des mesures d'atténuation qui surveillent la chaîne de pensée et d'action d'Argon, interrompant l'exécution si nécessaire, avec des alertes acheminées vers une équipe dédiée de réponse aux incidents. L'entreprise a également renforcé ses environnements de formation et d'évaluation en bac à sable, en les scellant avant les exécutions à haut risque. Google a notamment exhorté le reste du secteur à préserver la transparence du raisonnement afin que les réflexions du modèle restent utiles pour diagnostiquer un désalignement.

Tarifs et disponibilité

Argon sera lancé au prix de lancement de 2 $ par million de jetons d'entrée et de 10 $ par million de jetons de sortie, avec des jetons d'entrée en cache à 95 % de réduction sur le prix d'entrée. Après la période d'introduction, le prix passe à 4 $ par million de jetons d'entrée et à 20 $ par million de jetons de sortie, ce qui positionne Argon de manière agressive par rapport aux offres frontières concurrentes.

Ces débuts mis en scène reflètent une nouvelle réalité pour les versions frontières : la capacité est désormais un enjeu de table, et le différenciateur est la démonstration du contrôle. Google parie que les cyberdéfenseurs, les logiciels hospitaliers et les migrations Rust sont la bonne vitrine – et qu’un déploiement public plus lent coûte moins cher qu’un autre incident de sécurité. Les développeurs et les entreprises doivent surveiller la fenêtre d’accès payante à l’API et à l’IA Ultra, qui, selon Google, s’ouvrira dès que les tests de garde-corps le permettront.

---

Gardez une longueur d'avance sur l'IA

Recevez les dernières actualités, analyses et avancées en matière d'IA, le tout en un seul endroit.

Lire plus d'actualités sur l'IA →