Google a lancé Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, deux modèles de dialogue en direct que la société décrit comme les plus avancés à ce jour pour les conversations vocales naturelles. Les modèles ont commencé à être déployés le 15 septembre sur l'API Gemini, Google AI Studio, Search Live, Gemini Live et Google Workspace, avec un accès entreprise en version préliminaire privée via Gemini Enterprise.
L'annonce est venue de Tom Ouyang, ingénieur principal, et de Malini Jaganathan, membre du personnel technique, écrivant au nom de l'équipe Gemini Audio. Il étend la famille Gemini 3.8 qui a fait ses débuts plus tôt ce mois-ci avec les modèles Flash et Flash Cyber, et marque l'effort le plus agressif de Google dans le domaine de l'assistance vocale multimodale en temps réel - un marché où le mode vocal d'OpenAI et une vague de startups vocales se disputent le même cas d'utilisation quotidienne.
Le lancement s'inscrit dans une période remarquablement encombrée pour la gamme de modèles de Google ; la couverture des derniers développements de l'IA montre que la société a désormais expédié à plusieurs reprises en l'espace de quelques semaines alors qu'elle se bat contre ses concurrents en matière de prix, de codage et maintenant de voix.
Conçu pour les conversations en temps réel
Ce qui distingue les modèles Live d'un modèle de discussion standard avec un microphone connecté, c'est la latence et l'état. La documentation Live API de Google décrit une interface à faible latence qui traite des flux continus d'audio, d'images et de texte via une connexion WebSocket avec état, acceptant l'audio PCM brut à 16 kHz, les images JPEG jusqu'à une image par seconde et le texte, et renvoyant l'audio parlé en temps réel.
Les modèles traitent les entrées visuelles en temps quasi réel, permettant à l'assistant de voir ce que voit l'utilisateur. Les vidéos de démonstration de Google montrent Gemini 3.8 Live guidant une session d'intégration d'un employé à l'aide d'un contexte visuel, jouant aux échecs en temps quasi réel et élaborant des plans d'affaires complets et des boîtes à outils marketing personnalisées grâce à la parole naturelle. Les modèles peuvent également détecter et basculer automatiquement entre 97 langues prises en charge, en cours de conversation, sans que l'utilisateur ne change de paramètres.
Peut-être le plus important pour une utilisation pratique : les modèles exécutent des outils et des appels d'API en arrière-plan pendant que la conversation se poursuit, accusant réception des demandes et poursuivant le dialogue pendant la fin des tâches. Cela transforme l'assistant d'un répondant strictement au tour par tour en quelque chose de plus proche d'un agent qui parle.
Les chiffres vantés par Google
Google rapporte que Gemini 3.8 Live Extended Thinking a pris la première place globale dans l'indice de qualité de la parole d'Artificial Analysis avec un score de 82,6. En ce qui concerne l'achèvement des tâches agentiques, la société cite 68,6 % sur le benchmark τ-Voice et 35,1 % sur l'évaluation τ-Voice-banking de Sierra, ainsi qu'un score de 97,7 % sur Big Bench Audio.
Ce sont les chiffres rapportés par Google, et une vérification indépendante prendra du temps – mais la prétention au sommet du classement d'Analyse artificielle, si elle se confirme, placerait Google devant les offres optimisées pour la parole d'OpenAI et des sociétés dédiées à l'IA vocale sur la qualité globale des conversations. Google affirme également qu'Extended Thinking maintient un prix très compétitif, un clin d'œil implicite à la pression sur les prix qui a défini la génération 3.8.
Tout l'audio généré par les modèles est filigrané avec SynthID, le filigrane imperceptible de Google, de sorte que la parole générée par l'IA reste détectable – une garantie de conformité et de désinformation qui devient la norme dans les produits génératifs de Google.
Où vous pouvez l'utiliser
La disponibilité diffère entre les deux modèles. Gemini 3.8 Live est accessible à tous dans Search Live, le mode de recherche visuelle en temps réel de Google. Extended Thinking est disponible dans Gemini Live, dans Docs pour les abonnés Google AI Pro et Ultra via Workspace, ainsi que dans Gmail et Keep pour tous les utilisateurs de Google.
Les développeurs obtiennent les modèles via l'API Gemini et Google AI Studio, et Google affirme que l'API Live est déjà utilisée par des plates-formes telles qu'Agora, Fishjam, LiveKit, Pipecat, Vercel et Vision Agents pour créer des interfaces vocales au-dessus de l'infrastructure en temps réel de Google. Salesforce, Genspark et Lumeris sont nommés partenaires de lancement des nouveaux modèles.
Un marché de l'IA vocale encombré
La voix devient le champ de bataille des interfaces de 2026 car c’est là que l’IA échappe enfin au clavier. Un modèle capable de voir, d'écouter, de changer de langue et d'exécuter des outils tout en parlant n'est pas en concurrence avec d'autres chatbots mais avec l'appel téléphonique, la ligne d'assistance client et l'assistant personnel.
L'avantage de Google réside dans la distribution : Search, Android, Workspace et Chrome confèrent aux modèles Live une base installée qu'aucun rival ne peut égaler. La société parie qu'être présent à chaque instant de la journée d'un utilisateur - désormais avec ses meilleurs modèles vocaux - comptera plus que n'importe quelle victoire de référence. Les concurrents auront l'occasion de répondre, mais Google a clairement indiqué que la voix, autrefois une fonctionnalité de démonstration, est désormais une gamme de produits de première classe.
Pour les développeurs, le message est tout aussi direct. En publiant des formats d'entrée exacts, en documentant l'exécution des outils en arrière-plan et en ensemençant l'écosystème avec des plates-formes Live API, Google tente de faire de sa pile le substrat par défaut pour quiconque crée des interfaces vocales - des robots de support client aux assistants portables. Que les affirmations de qualité de Gemini 3.8 Live tiennent le coup lors de tests indépendants, le jeu de disponibilité est déjà en mouvement.
---
Gardez une longueur d'avance sur l'IARecevez les dernières actualités, analyses et avancées en matière d'IA, le tout en un seul endroit.
Lire plus d'actualités sur l'IA →