Google a lancé mardi Gemini 3.8 Flash, son nouveau modèle performant, positionné comme le meilleur système de raisonnement et de codage de l'entreprise, mais au même prix que son prédécesseur, aux côtés d'une variante spécialisée appelée Gemini 3.8 Flash Cyber, conçue pour les travaux défensifs de cybersécurité. L'annonce, publiée sur le blog officiel de Google par Tulsee Doshi, directeur principal de la gestion des produits, et Raluca Ada Popa, responsable de la sécurité Gemini chez Google DeepMind, marque la troisième version Flash de Google en seulement six semaines.
Le lancement a lieu au milieu d'une saison de lancement inhabituellement chargée et constitue une réponse directe à la pression que les concurrents ont exercée sur les prix et les performances de la gamme de modèles de Google. Pour une vision plus large de la façon dont les laboratoires frontaliers échangent des coups, l'équipe dernières nouvelles sur l'IA suit chaque version majeure de modèle au fur et à mesure qu'elle se produit.
Deux variantes, une fondation
Gemini 3.8 est disponible en deux versions construites sur la même intelligence fondamentale. Gemini 3.8 Flash est le cheval de bataille à usage général : Google affirme qu'il offre des améliorations significatives par rapport à 3,7 Flash en matière d'ingénierie logicielle, de tâches agents et de raisonnement en plusieurs étapes dans des domaines spécialisés, au même prix de lancement de 0,75 $ par million de jetons d'entrée et de 3,75 $ par million de jetons de sortie.
Gemini 3.8 Flash Cyber est décrit comme le modèle de cybersécurité le plus performant de Google, avec ce que la société appelle des performances de pointe en matière de détection des vulnérabilités et de correction automatisée. Contrairement au modèle Flash standard, il n'est pas largement disponible : Google le distribue à un ensemble de défenseurs de confiance via un nouveau programme appelé Fairwind.
Selon le billet de blog, les gains de codage et de raisonnement dans le noyau partagé ont été en partie motivés par une formation rigoureuse dans le domaine exigeant de la cybersécurité, et les deux modèles ont été accélérés par des boucles agentiques de longue durée conçues pour évaluer et affiner de manière récursive les modèles sous-jacents.
Benchmarks : Travailler plus dur, pas seulement grandir
Les affirmations de référence de Google se concentrent sur une philosophie de conception que l'entreprise résume clairement : 3.8 Flash « travaille plus dur ». Sur des tâches complexes, le modèle exécute des étapes de raisonnement supplémentaires et appelle des outils de manière itérative, consommant parfois plus de jetons pour maximiser les performances à des niveaux d'effort plus élevés. Les développeurs peuvent réduire leurs efforts pour réduire la surcharge des jetons, ou rester sur Gemini 3.7 Flash, qui reste entièrement pris en charge pour les charges de travail axées sur l'efficacité.
Les principaux résultats cités par Google :
- DeepSWE v1.1 (ingénierie logicielle à long terme) : 3.8 Flash surpasse la plupart des modèles de pointe en résolvant de manière autonome des problèmes d'ingénierie complexes de bout en bout, pour ce que Google décrit comme une fraction du coût.
- Vals Finance Agent V2 et Harvey's Legal Agent Benchmark : 3,8 Flash surpasse 3,7 Flash et d'autres modèles frontières dans des domaines quantitatifs et professionnels nécessitant une analyse et un reporting avancés.
- HLE-Verified : 3,8 Flash atteint 54,9 %, ce que Google présente comme une preuve d'un raisonnement en plusieurs étapes dans les domaines STEM, sciences humaines et professionnels.
Flash Cyber : la défense plutôt que l'offensive
La variante Cyber est la version la plus inhabituelle. Google affirme avoir délibérément donné la priorité à la correction des vulnérabilités plutôt qu'aux capacités offensives telles que l'exploitation. Sur CWE-Bench, un benchmark externe de correctifs géré par Collinear, Gemini 3.8 Flash Cyber a obtenu un pass@1 de 47,2 % — juste derrière un modèle frontière leader à 47,8 %, selon Google, mais à un coût nettement inférieur, le plaçant sur la frontière de Pareto du benchmark.
Sur CyberGym, une référence industrielle standard pour la recherche de vulnérabilités, Google affirme que le modèle Cyber démontre une découverte autonome des vulnérabilités au niveau de la frontière, surpassant son prédécesseur 3.5 Flash Cyber ainsi que des modèles frontières nettement plus grands. Selon le benchmark interne de Google couvrant des bases de code complexes dans 20 langages de programmation, le modèle a atteint un taux de réussite supérieur à 70 %.
Sécurise déjà le code de Google
Google affirme que le modèle Cyber est déjà déployé en interne et que les exemples qu'il fournit sont spécifiques :
- L'équipe de sécurité de Chrome a constaté que la version 3.8 de Flash Cyber produisait 2,6 fois plus de correctifs correctifs pour les vulnérabilités de Chrome que les meilleurs modèles commerciaux, qui sont beaucoup plus volumineux.
- Chez la société de sécurité Wiz, le modèle a obtenu un taux de mémorisation de 7,5 à 9,7 points de pourcentage plus élevé lors d'un test d'intrusion interne, à un coût 2,3 à 5,2 fois inférieur à celui des autres modèles phares.
- L'équipe de recherche sur les vulnérabilités du cloud de Google a utilisé le modèle pour trouver une vulnérabilité fondamentale critique en moins de deux heures – une classe de vulnérabilité dont la recherche et la découverte, note Google, prennent généralement des mois.
Ce que cela signifie pour les développeurs et le marché
Pour les promoteurs, l’avantage pratique est la stabilité des prix au bas de la frontière. Le fait de conserver 3,8 Flash au prix de lancement de 3,7 maintient le coût d'un modèle de codage et d'agent compétitif à 0,75 $/3,75 $ par million de jetons, un segment dans lequel les challengers de poids ouvert et les laboratoires rivaux ont sous-coté les opérateurs historiques toute l'année. Le message de Google est que les acheteurs n'ont plus besoin de choisir entre le coût et les capacités du niveau bête de somme.
Le modèle de distribution du programme Fairwind pour Flash Cyber est tout aussi révélateur. Les laboratoires de premier plan traitent de plus en plus les capacités d’élite en matière de cybersécurité comme quelque chose qui doit être contrôlé plutôt que distribué à grande échelle – fournissant des outils défensifs de pointe aux défenseurs approuvés tout en limitant le risque d’utilisation abusive offensive. La décision de Google de donner la priorité aux tests de correctifs plutôt qu'aux capacités d'exploitation dans la formation du modèle suit la même logique.
La cadence est également remarquable. Trois versions de Flash en six semaines – 3,7 Flash il y a trois semaines, maintenant 3,8 – montrent que Google itère sa gamme de niveau intermédiaire beaucoup plus rapidement que les cycles de publication annuels d'il y a deux ans. La pression concurrentielle exercée par le déploiement de GPT-6 d'OpenAI et une vague de modèles ouverts à évolution rapide en provenance de Chine ont compressé les délais de chacun, et Google choisit clairement la vitesse au niveau de la bête de somme tandis que ses modèles pionniers portent le drapeau de la recherche.
L'approche "travailler plus dur" de Flash 3.8 - dépenser plus de jetons pour un raisonnement diligent en plusieurs étapes - s'avère-t-elle plus efficace dans la pratique que l'échelle brute du modèle n'apparaîtra dans les factures des développeurs au cours des prochains mois. Les propres benchmarks de Google suggèrent que le commerce peut favoriser la diligence ; le marché rendra son verdict une facture API à la fois.
Gardez une longueur d'avance sur l'IA
Chaque lancement de modèle, référence et changement de prix, suivi au fur et à mesure — lire plus d'actualités sur l'IA →
