Google a lancé Gemini 3.5 Transcribe, un nouveau modèle de synthèse vocale conçu pour la transcription en temps réel qui reconnaît automatiquement plus de 85 langues et peaufine le résultat en cours de route, en supprimant les mots de remplissage et en corrigeant les erreurs verbales sans qu'on le lui demande.
Ce lancement positionne la pile vocale de Google comme un concurrent direct sur le marché en croissance rapide de la transcription, où la précision et la latence déterminent de plus en plus les services que les développeurs adoptent pour les appels, les réunions, les sous-titres et les interfaces vocales. Pour plus de contexte sur cette histoire, consultez notre couverture de l'industrie de l'IA.
Ce que le modèle peut faire
Selon l'annonce de Google, dont la couverture a été publiée par The Decoder, Gemini 3.5 Transcribe va bien au-delà de la conversion de mots prononcés en texte :
- Détection automatique des langues dans plus de 85 langues, sans configuration requise
- Suppression des mots de remplissage, nettoyage de « euh », « euh » et disfluences similaires
- Correction des lapsus, produisant une prose lisible plutôt que du bruit verbatim
- Formatage de texte autonome, y compris la ponctuation et la structure
La société rapporte un taux d'erreur de mots de 4,0 % pour le streaming audio et de 2,6 % pour l'audio enregistré, ainsi que des réductions de latence d'environ 70 % par rapport à son prédécesseur, Chirp 3 – une marge substantielle dans les scénarios de sous-titrage en direct où le retard interrompt les conversations.
Deux interfaces pour deux tâches
Les développeurs ont accès via deux interfaces de programmation d'applications distinctes :
API Live — `gemini-3.5-transcribe-live`
Gère le streaming en temps réel avec une latence très faible, en ciblant les sous-titres en direct, les agents vocaux et les assistants interactifs là où le temps de réponse compte le plus.API d'interactions — `gemini-3.5-transcribe`
Traite l’audio enregistré et renvoie les transcriptions avec l’attribution des intervenants et les horodatages – le flux de travail typique pour les réunions, les interviews, les podcasts et la post-production multimédia.Au-delà de la transcription, le modèle prend en charge les appels de fonctions, ce qui signifie qu'il peut déléguer des tâches de suivi à d'autres modèles de la famille Gemini, par exemple en déclenchant une demande de génération d'image ou une recherche sur le Web basée sur quelque chose dit lors d'une session. Cela transforme un moteur de transcription en une couche d'interface contrôlable pour les applications vocales.
Déjà expédié sur les produits Google
Le modèle est aujourd'hui disponible dans Google AI Studio et sur Gemini Enterprise Agent Platform pour les développeurs. Google l'a également intégré aux surfaces grand public : Gboard sur Android l'utilise via un composant interne appelé Rambler pour la dictée, l'application Gemini sur macOS l'applique à la saisie vocale et l'intégration de Chrome devrait suivre.
Cette répartition est importante. La reconnaissance vocale gagne sa place à grande échelle et l'intégration du modèle dans les claviers, les applications de bureau et les navigateurs la place quotidiennement devant des milliards d'interactions d'entrée - tout en alimentant les boucles d'évaluation nécessaires pour maintenir les taux d'erreur en baisse sur les accents, les dialectes et les environnements bruyants.
Enjeux compétitifs dans l'IA vocale
La transcription est progressivement devenue un champ de bataille concurrentiel entre les laboratoires pionniers et les fournisseurs spécialisés. Une compréhension vocale précise et à faible latence est la clé d'entrée pour les produits agents qui agissent sur les commandes vocales, l'intelligence des réunions d'entreprise, les fonctionnalités d'accessibilité et l'automatisation du service client multilingue.
En associant des améliorations agressives de latence à une sortie auto-correctrice, Google parie que les développeurs préfèrent les transcriptions qui se lisent comme du texte édité plutôt que la capture phonétique brute – échangeant une stricte fidélité textuelle contre la convivialité. Les équipes ayant besoin de dossiers exacts, comme les transcripteurs juridiques ou médicaux, peuvent toujours souhaiter les modes verbatim ; pour tous les autres, la différence pratique entre entendre quelqu’un et le comprendre continue de se rétrécir.
Avec Gemini 3.5 Transcribe désormais généralement disponible dans AI Studio et les outils d'entreprise, le premier test significatif sera les mesures d'adoption des développeurs d'agents vocaux - un segment de marché en croissance suffisamment rapide pour que même des gains de précision supplémentaires se traduisent par des décisions de changement importantes.
Pourquoi la latence est le véritable champ de bataille
Les taux d’erreur font la une des journaux, mais la latence détermine discrètement quels produits sont viables. Un moteur de transcription alimentant une superposition de sous-titres en direct doit suivre le rythme de la conversation, sinon les téléspectateurs se désengageront. Un agent vocal négociant un appel d’assistance client ne peut pas faire une pause gênante pendant que sa couche vocale rattrape son retard. Google a signalé une réduction de 70 % du délai par rapport à Chirp 3, ciblant précisément cet écart, en raccourcissant la distance entre un locuteur qui termine une phrase et les systèmes en aval qui agissent en conséquence.
Pour les applications agentiques, cela s'aggrave : chaque tour d'un dialogue parlé implique la reconnaissance, le raisonnement et la réponse. Réduire les millisecondes de l'étape de reconnaissance donne aux constructeurs une marge de manœuvre pour investir dans des modèles de raisonnement plus performants – et plus lents – sans dépasser les budgets de synchronisation des conversations.
Le compromis textuel
Un choix de conception mérite un examen minutieux. Par défaut, Gemini 3.5 Transcribe organise la sortie : les mots de remplissage disparaissent, les erreurs sont corrigées et le formatage est appliqué automatiquement. Pour la plupart des utilisations professionnelles (minutes, sous-titres, archives consultables), c'est exactement ce que souhaitent les utilisateurs.
Mais certains flux de travail dépendent d’enregistrements verbatim. Les dépositions juridiques, les contrôles de conformité et la vérification journalistique des faits nécessitent parfois de savoir précisément ce qui a été dit, hésitations comprises. Les organisations des secteurs réglementés voudront savoir clairement dans quelle mesure le lissage est facultatif et configurable avant de migrer les pipelines sensibles vers le nouveau modèle. La documentation de Google et les paramètres de l'API définiront efficacement où se situe la ligne entre le verbatim et le peaufiné pour l'industrie.
Une empreinte multilingue en tant que Moat
La couverture de plus de 85 langues avec détection automatique n’est pas seulement un élément de la liste de contrôle des fonctionnalités. La portée multilingue concentre la valeur sur les marchés où les concurrents sont historiquement à la traîne : les accents régionaux, le changement de code entre les langues au milieu d'une phrase et les langues à faibles ressources punissent tous les modèles formés étroitement sur des corpus à forte dominante anglais.
Pour les entreprises mondiales gérant des centres de support dans des dizaines de pays, un modèle unique gérant la détection du langage réduit de manière transparente la complexité de l'intégration : un pipeline au lieu de plusieurs configurations par marché. Combiné à la distribution via les milliards d'installations Android de Gboard, Google positionne le multilinguisme de qualité de transcription comme une infrastructure plutôt que comme une fonctionnalité premium.
Que regarder
Trois signaux montreront si Gemini 3.5 Transcribe modifie la part de marché ou augmente simplement les attentes : migration des développeurs vers des benchmarks tiers au cours des prochains mois ; la rapidité avec laquelle les concurrents correspondent aux chiffres de latence plutôt qu'aux affirmations en matière de précision ; et si les hooks d'appel de fonctions engendrent une vague d'agents vocaux construits nativement sur Gemini. Le lancement est désormais en ligne et les niveaux de tarification via AI Studio devraient rendre l'expérimentation suffisamment bon marché pour que les coûts de changement tombent presque à zéro.
---
Restez à la Pointe de l'IALes dernières actualités, analyses et percées en IA — au même endroit.
Lire plus d'actualités IA →