Google a présenté mercredi deux nouveaux modèles de synthèse vocale – Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS – les qualifiant de modèles de génération audio les plus expressifs à ce jour. Les modèles sont disponibles dans Google AI Studio, l'API Gemini, Gemini Enterprise, Gemini Notebook et Google Vids, selon l'annonce de Google faite par Leland Rechis, chef de produit du groupe, et Alan Cowen, directeur de la recherche scientifique au sein de l'équipe audio Gemini.
Le lancement déplace la génération de voix au-delà des préréglages vocaux statiques vers ce que Google décrit comme un studio de création : des voix conçues à partir d'une invite de texte, des performances dirigées ligne par ligne et un échafaudage de sécurité intégré dès le départ. Pour en savoir plus sur cette version et sur d'autres versions, consultez nos Actualités sur les modèles d'IA.
Deux modèles, deux métiers
Les deux hommes répartissent la charge de travail à la manière habituelle de Google. Gemini 3.8 Flash TTS est conçu pour une direction créative approfondie et la conception de personnages — créant des voix entièrement nouvelles à partir de zéro via des invites en langage naturel pour les jeux, des livres audio immersifs, des podcasts et des médias interactifs, avec un contrôle granulaire sur les signaux d'acteur, le rythme, les changements de dialecte et le backchanneling. Gemini 3.8 Flash-Lite TTS est la lecture de volume : optimisé pour le doublage de gros volumes, la création de contenu audio et les agents vocaux expressifs à grande échelle, avec un contrôle précis du ton, du rythme et des nuances à moindre coût.
Le positionnement de Google présente la paire comme transformant la génération vocale « de préréglages statiques en un studio de création dynamique ». La société considère les livres audio, les jeux et les podcasts comme des destinations naturelles pour le modèle phare, tandis que la variante Lite cible le marché peu glamour mais énorme du doublage et des agents vocaux toujours actifs, où le coût par minute générée compte plus que la puissance des stars. Les deux modèles sont intégrés aux produits Google – parmi eux Gemini Notebook et Google Vids – signalant que la technologie fera surface dans les outils destinés aux consommateurs plutôt que de rester un jeu uniquement API.
Un studio vocal complet, de 30 voix à l'infini
Google affirme que les développeurs peuvent désormais passer de 30 voix originales à ce qu'il appelle une bibliothèque infinie. Le système de conception vocale générative permet aux utilisateurs de créer des voix sur mesure en spécifiant le rôle, l'accent et les caractéristiques de la voix dans plus de 100 langues et dialectes. Les démos de Google vont d'une voix de DJ énergique de Melbourne à un « robot super-mince et monotone » et un dragon japonais.
Parallèlement à la génération, les modèles sont livrés avec une bibliothèque de plus de 2 000 voix prêtes à la production, y compris des variétés régionales telles que l'espagnol mexicain, le français québécois et l'anglais écossais.
La réplication vocale est incluse avec les garde-fous : les utilisateurs peuvent recréer un profil vocal cohérent à partir d'un échantillon audio de 30 secondes seulement (de leur propre voix, ou de celui qu'ils ont le droit d'utiliser), soutenu par une vérification de consentement intégrée, un filigrane SynthID et des informations d'identification C2PA. Google ajoute également une fonctionnalité de sauvegarde et de mise à l'échelle pour maintenir la cohérence des voix personnalisées d'un projet à l'autre, avec un remixage vocal (ajustant le timbre, la hauteur, le rythme et l'accent via des invites) répertorié comme étant à venir.
Diriger la performance, ligne par ligne
Les deux modèles prennent en charge une direction précise par ligne. Les développeurs peuvent écrire leurs propres mises en scène ou laisser le modèle diriger la livraison à partir d'indices naturels du script - la différence entre un agent du service client calme et une scène de suspense chuchotée. Des éclats vocaux scriptés tels que
Deux fonctionnalités ciblent le travail de forme plus longue et multi-voix. La génération de formats longs maintient la qualité et le rythme de la voix pendant des heures d’audio continu avec une dérive minimale des locuteurs – destinée aux podcasts et aux livres audio – tandis que la mise en scène native à deux haut-parleurs dirige les conversations à plusieurs tours à partir d’un seul script avec un tour de rôle naturel et des voix clairement séparées.
Benchmarks : N°1 sur Hume AI
Google est en tête de l'annonce avec des chiffres tiers. Gemini 3.8 Flash TTS a pris la première place globale sur le Voice Design Benchmark de Hume AI avec un score de 71,4 et est en tête en matière de modélisation d'accent avec 60,8. Sur l'indice de qualité globale de Hume AI, les deux nouveaux modèles revendiquent respectivement les places n°1 et n°2.
Les affirmations de référence du fournisseur doivent toujours être lues avec une certaine prudence, mais Hume AI – une société indépendante de recherche sur l’IA vocale – est un arbitre raisonnable en matière de qualité vocale, et les scores donnent à Google un argument de discussion concret contre ses rivaux en matière de génération vocale.
La course aux armements audio continue
Les nouveaux modèles rejoignent une famille audio Gemini en pleine croissance qui comprend déjà 3.5 Live Translate, 3.5 Transcribe, 3.8 Live et 3.8 Live Extended Thinking – les modèles vocaux en temps réel que Google a déployés plus tôt ce mois-ci. Cette cadence n'est pas un hasard : la synthèse vocale expressive et fiable devient une infrastructure essentielle pour les agents vocaux, le support client, les outils d'accessibilité et la production multimédia, et Google souhaite que Gemini soit la couche par défaut pour tout cela.
Pour les développeurs, le résultat immédiat est pratique plutôt que futuriste : des voix personnalisées, un doublage multilingue et des heures de narration sont désormais disponibles dans l'API Gemini et AI Studio, avec des filigranes attachés.
Ce sont les facteurs économiques qui décideront dans quelle mesure ce potentiel sera utilisé. Google n'a pas mis l'accent sur les prix dans les documents de lancement, mais l'existence d'un niveau Flash-Lite implique une option délibérément peu coûteuse pour les charges de travail en masse, reflétant la stratégie de hiérarchisation qu'elle applique dans la famille de modèles Gemini. Les entreprises sur Gemini Enterprise bénéficient des mêmes capacités que celles de leurs accords existants, et c'est là que Google s'attend à ce que l'essentiel de la production audio à haut volume atterrisse.
Reste à savoir avec quelle rapidité les industries créatives adopteront la narration synthétisée. Le filigrane et la vérification du consentement réduisent les barrières juridiques et éthiques, et les chiffres de référence suggèrent que la qualité n'est plus le goulot d'étranglement. Si les affirmations de Google tiennent la route, l'écart entre une voix off humaine enregistrée et une voix générée est désormais suffisamment étroit pour que le coût et le délai d'exécution, et non l'authenticité, détermineront la décision pour la plupart des projets.
---
Gardez une longueur d'avance sur l'IARecevez les dernières actualités, analyses et avancées en matière d'IA, le tout en un seul endroit.
Lire plus d'actualités sur l'IA →