Google heeft Gemini 3.5 Transcribe gelanceerd, een nieuw spraak-naar-tekstmodel dat is gebouwd voor realtime transcriptie en dat meer dan 85 talen automatisch herkent – ​​en de uitvoer gaandeweg verbetert, waarbij opvulwoorden worden verwijderd en verbale struikelblokken worden gecorrigeerd zonder dat erom wordt gevraagd.

De lancering positioneert de spraakstack van Google als een directe uitdager in de snelgroeiende transcriptiemarkt, waar nauwkeurigheid en latentie steeds meer bepalen welke diensten ontwikkelaars gebruiken voor oproepen, vergaderingen, ondertiteling en spraakinterfaces. Voor meer context over dit verhaal, zie ons laatste AI-ontwikkelingen.

Wat het model kan doen

Volgens de aankondiging van Google, waarvan de berichtgeving is gepubliceerd door The Decoder, gaat Gemini 3.5 Transcribe veel verder dan het omzetten van gesproken woorden in tekst:

  • Automatische taaldetectie in meer dan 85 talen, zonder dat configuratie vereist is
  • Verwijdering van invulwoorden, opschonen van "eh", "uh" en soortgelijke onvloeiendheden
  • Correctie van versprekingen, waardoor leesbaar proza ontstaat in plaats van woordelijke ruis
  • Autonome tekstopmaak, inclusief interpunctie en structuur

Het bedrijf rapporteert een woordfoutenpercentage van 4,0 procent voor streaming audio en 2,6 procent voor opgenomen audio, naast latencyreducties van ongeveer 70 procent vergeleken met zijn voorganger, Chirp 3 – een aanzienlijke marge in scenario's met live ondertiteling waarbij vertraging gesprekken verbreekt.

Twee interfaces voor twee taken

Ontwikkelaars krijgen toegang via twee verschillende applicatie-programmeerinterfaces:

Live API — `gemini-3.5-transcribe-live`

Verwerkt realtime streaming met een zeer lage latentie, gericht op live ondertiteling, stemagenten en interactieve assistenten waar de responstijd het belangrijkst is.

Interacties API — `gemini-3.5-transcribe`

Verwerkt opgenomen audio en retourneert transcripties met toeschrijving van de spreker en tijdstempels – de workflow die typisch is voor vergaderingen, interviews, podcasts en postproductie van media.

Naast transcriptie ondersteunt het model ook function calling, wat betekent dat het vervolgtaken kan delegeren aan andere modellen in de Gemini-familie, bijvoorbeeld het activeren van een verzoek voor het genereren van afbeeldingen of een zoekopdracht op internet op basis van iets dat tijdens een sessie wordt gezegd. Dat verandert een transcriptie-engine in een bestuurbare interfacelaag voor spraakgestuurde toepassingen.

Wordt al verzonden via Google-producten

Het model is vandaag live in Google AI Studio en op het Gemini Enterprise Agent Platform voor ontwikkelaars. Google heeft het ook op consumentenoppervlakken aangesloten: Gboard op Android gebruikt het via een interne component genaamd Rambler voor dicteren, de Gemini-app op macOS past het toe op spraakinvoer, en de Chrome-integratie zal volgen.

Die verdeling is belangrijk. Spraakherkenning verdient zijn plaats op schaal, en door het model in te bedden in toetsenborden, desktop-apps en browsers wordt het dagelijks geconfronteerd met miljarden invoerinteracties – terwijl het de evaluatieloops voedt die nodig zijn om ervoor te zorgen dat de foutpercentages in accenten, dialecten en rumoerige omgevingen dalen.

Competitieve inzet in spraak-AI

Transcriptie is stilletjes een strijdtoneel geworden tussen grenslaboratoria en gespecialiseerde leveranciers. Nauwkeurig spraakverstaan ​​met lage latentie is het toegangsticket voor agentische producten die reageren op gesproken opdrachten, zakelijke vergaderinformatie, toegankelijkheidsfuncties en meertalige automatisering van de klantenservice.

Door agressieve verbeteringen in de latentie te combineren met zelfcorrigerende uitvoer, gokt Google erop dat ontwikkelaars de voorkeur geven aan transcripties die lezen als bewerkte tekst in plaats van ruwe fonetische weergave, waarbij strikte woordelijke betrouwbaarheid wordt ingeruild voor bruikbaarheid. Teams die exacte gegevens nodig hebben, zoals juridische of medische transcribenten, willen misschien nog steeds woordelijke modi; voor alle anderen wordt het praktische verschil tussen iemand horen en begrijpen steeds kleiner.

Nu Gemini 3.5 Transcribe nu algemeen beschikbaar is in AI Studio en enterprise-tools, zal de eerste zinvolle test de acceptatiestatistieken van voice-agent-ontwikkelaars zijn – een marktsegment dat snel genoeg groeit dat zelfs incrementele nauwkeurigheidswinst zich vertaalt in aanzienlijke overstapbeslissingen.

Waarom latentie het echte slagveld is

Foutpercentages halen de krantenkoppen, maar de latentie bepaalt stilletjes welke producten levensvatbaar zijn. Een transcriptie-engine die een overlay met live ondertiteling voedt, moet gelijke tred houden met het gesprek, anders haken kijkers af. Een stemagent die een klantondersteuningsgesprek onderhandelt, kan niet ongemakkelijk pauzeren terwijl zijn spraaklaag de achterstand inhaalt. De door Google gerapporteerde 70 procent vertragingsreductie ten opzichte van Chirp 3 richt zich precies op dat gat: het verkorten van de afstand tussen een spreker die een zin afmaakt en downstream-systemen die daarop ingrijpen.

Voor agentische toepassingen komt dit samen: elke wending in een gesproken dialoog impliceert herkenning, redenering en reactie. Het schrappen van milliseconden uit de herkenningsfase geeft bouwers ruimte om te besteden aan capabelere (en langzamere) redeneermodellen zonder de timingbudgetten voor gesprekken te schenden.

De letterlijke afweging

Eén ontwerpkeuze verdient aandacht. Standaard beheert Gemini 3.5 Transcribe de uitvoer: opvulwoorden verdwijnen, struikelblokken worden gecorrigeerd en de opmaak wordt automatisch toegepast. Voor de meeste zakelijke toepassingen (notulen, ondertiteling, doorzoekbare archieven) is dat precies wat gebruikers willen.

Maar bepaalde workflows zijn afhankelijk van letterlijke records. Juridische verklaringen, nalevingsbeoordelingen en journalistieke factchecking vereisen soms dat je precies weet wat er is gezegd, inclusief aarzelingen. Organisaties in gereguleerde sectoren zullen duidelijkheid willen over hoeveel van de afvlakking optioneel en configureerbaar is voordat gevoelige pijplijnen naar het nieuwe model worden gemigreerd. De documentatie en API-parameters van Google zullen effectief bepalen waar de letterlijke versus gepolijste grens voor de branche ligt.

Een meertalige voetafdruk als gracht

De dekking van meer dan 85 talen met automatische detectie is niet slechts een onderdeel van een checklist. Meertalig bereik concentreert waarde op markten waar concurrenten historisch gezien achterblijven: regionale accenten, het wisselen van code tussen talen halverwege een zin en talen met weinig hulpmiddelen straffen allemaal modellen af ​​die nauw zijn getraind op Engelstalige corpora.

Voor mondiale ondernemingen die ondersteuningscentra in tientallen landen runnen, vermindert één enkel model dat taaldetectie verwerkt op transparante wijze de complexiteit van de integratie: één pijplijn in plaats van vele configuraties per markt. Gecombineerd met distributie via de miljarden Android-installaties van Gboard positioneert Google meertaligheid van transcriptiekwaliteit als infrastructuur in plaats van als een premiummogelijkheid.

Wat te bekijken

Drie signalen zullen uitwijzen of Gemini 3.5 Transcribe het marktaandeel verandert of alleen maar de verwachtingen wekt: migratie van ontwikkelaars in benchmarks van derden in de komende maanden; hoe snel rivalen overeenkomen met de latentiecijfers in plaats van met de nauwkeurigheidsclaims; en of de function-calling hooks een golf van voice-first-agents voortbrengen die native op Gemini zijn gebouwd. De lancering is nu live en prijsniveaus via AI Studio zouden het experimenteren zo goedkoop moeten maken dat de overstapkosten tot bijna niets dalen.

---

Blijf Voorop met AI

Het laatste AI-nieuws, analyses en doorbraken — allemaal op één plek.

Lees meer AI-nieuws →