Google heeft deze week stilletjes binnen 48 uur twee belangrijke Gemini-modelupdates verzonden, en beide zijn volledig gericht op ontwikkelaars die productieapplicaties bouwen. Gemini 3.5 Transcribe, geïntroduceerd op 26 augustus, is volgens de officiële blog van Google het meest nauwkeurige spraak-naar-tekst-model van het bedrijf tot nu toe. Gemini Omni 1.1 Flash, aangekondigd op 27 augustus, biedt professionele bedieningselementen voor generatieve video, inclusief scèneverlenging tot 40 seconden en 4K-opschaling. Beide modellen zijn beschikbaar via de Gemini API in Google AI Studio en het Gemini Enterprise Agent Platform.

Gemini 3.5 Transcriberen: spraak-naar-tekst die zichzelf opruimt Voor meer context over dit verhaal, zie ons AI-trends.

Wat Gemini 3.5 Transcribe onderscheidt van conventionele spraakherkenning, zegt Google, is dat het onbewerkte audio rechtstreeks omzet in gepolijste, opgemaakte tekst in plaats van een onbewerkt transcript. Het model verwerkt achtergrondgeluiden, complex jargon en het opschonen van onvloeiendheden op natuurlijke wijze; het verwijdert opvulwoorden als 'ums' en 'ahs', lost zelfcorrecties op, zoals 'laten we dinsdag afspreken – nee, woensdag', en formatteert de uitvoer automatisch.

De benchmarkcijfers die Google noemt zijn opmerkelijk. Zoals gemeten door Artificial Analysis, behaalt het model een gemiddeld woordfoutpercentage (WER) van 4,0 procent voor gebruiksscenario's voor streaming en 2,6 procent voor niet-streaming audio. Op de meertalige benchmark van FLEURS voor de belangrijkste talen noteert het een WER van 5,50 procent in streamingmodus en 5,04 procent in niet-streaming, een verbetering ten opzichte van het vorige transcriptiemodel van Google, Chirp 3. De tijd tot de uiteindelijke transcriptie verbetert met 70 procent vergeleken met Chirp 3, opnieuw gemeten door kunstmatige analyse.

Het model wordt geleverd in twee varianten voor twee workflows. Voor live-toepassingen levert `gemini-3.5-transcribe-live` continue bidirectionele streaming met een latentie van minder dan een seconde via de Live API, gericht op stemagenten en realtime ondertiteling. Voor opgenomen audio (vergaderingen, gesprekslogboeken, archieven) biedt `gemini-3.5-transcribe` sprekertoewijzing voor maximaal drie sprekers (met ondersteuning voor meer in de experimentele modus) en tijdstempels op woordniveau via de Interactions API.

Andere mogelijkheden zijn onder meer automatische detectie en transcriptie in meer dan 85 talen met accent- en dialectverwerking, en ondersteuning voor aangepaste woordenschat, zodat het model zich aanpast aan gespecialiseerd jargon en unieke spellingen. Google heeft het model ook een soort ogen gegeven: via functieaanroepen kan het taken zoals het genereren van afbeeldingen of bestandsanalyse delegeren aan andere Gemini-modellen – een functie die momenteel beschikbaar is in de Gemini-app op macOS.

Gemini Omni 1.1 Flash: videogeneratie laat een tijdlijn groeien

De tweede lancering richt zich op de meest voorkomende klacht over AI-video: controle. Gemini Omni 1.1 Flash is een productiegerichte update die generatieve video bestuurbaar maakt op een manier die zijn voorgangers niet waren, waarbij Google DeepMind-productmanagers Anish Nangia en Alisa Fortin de release omschrijven als het maken van Omni 1.1 "productieklaar voor professioneel gebruik".

Scène-extensie is de hoofdfunctie. Ontwikkelaars kunnen nu naadloos beeldmateriaal blijven genereren uit een bestaande clip, waarbij het model tot 10 seconden aan eerdere context analyseert – een sprong voorwaarts ten opzichte van eerdere modellen die alleen naar de laatste seconde verwezen. Video's kunnen worden verlengd in stappen van 10 seconden tot een totale lengte van 40 seconden, waardoor de visuele consistentie en verhaalvastheid voor langere verhalen wordt verbeterd.

De update voegt ook interpolatie van het eerste en het laatste frame toe, waardoor ontwikkelaars begin- en eindframes kunnen specificeren om vloeiende, weloverwogen camerabewegingen en overgangen tussen opnames te creëren. Voor levering kunnen voltooide projecten worden opgeschaald naar 4K-resolutie, terwijl makers met een 360p-previewmodus snel en goedkoop de aanwijzingen kunnen herhalen voordat ze zich aan de definitieve weergave hechten.

Van API tot alledaagse oppervlakken

Google integreert beide modellen ook in zijn consumentenproducten, en dat is waar het distributievoordeel blijkt. Op Android gebruikt de nieuwe "Rambler"-functie in Gboard 3.5 Transcribe om gesproken gedachten om te zetten in goed opgemaakte tekst, terwijl opvulwoorden worden gefilterd. Gebruikers kunnen zelfs met hun stem bewerkingen uitvoeren. Het model maakt ook dicteren mogelijk in de Gemini-app op macOS, werkt naast schermcontext in Google Antigravity en wordt geïntegreerd in Chrome.

Voor ontwikkelaars lezen de twee lanceringen als één strategie: Google duwt Gemini van een chatbot waarmee je praat naar een infrastructuur die media ziet, hoort en produceert. Nu OpenAI, ElevenLabs en een hele reeks video-startups in hetzelfde gebied met elkaar concurreren, vormen het woordfoutenpercentage van 2,6 procent en de coherente scènes van 40 seconden Google's openingsbod voor de productieworkloads die daadwerkelijk inkomsten genereren: stemagenten, ondertitelingspijplijnen en creatieve tools. Ontwikkelaars kunnen vandaag beginnen met het bouwen met beide modellen in Google AI Studio.

Waarom het aantal woordfouten er nog steeds toe doet

Het aantal woordfouten klinkt als een academische statistiek, maar in de productie is het het verschil tussen een spraakproduct dat werkt en een spraakproduct dat frustreert. Elke verkeerd begrepen uitspraak van een stemagent verbreekt een taak: een verkeerd begrepen order-ID leidt tot een mislukte zoekopdracht, een onleesbaar adres stuurt een pakket naar de verkeerde stad. Dat is de reden waarom de kloof tussen een WER van 2,6 procent op niet-streaming audio en de hoge eencijferige tarieven die een generatie modellen geleden gangbaar waren, leidt tot een verschil in bruikbaarheid van de orde van grootte.

Het onderscheid tussen de twee modi die Google rapporteerde, is ook van belang voor architecten. Streamingtranscriptie – het WER-cijfer van 4,0 procent – ​​ruilt enige nauwkeurigheid in voor latentie van minder dan een seconde, wat interactieve gebruiksscenario’s zoals live stemagenten vereisen. Batchtranscriptie van opgenomen audio verloopt langzamer maar bereikt 2,6 procent. Daarom kunnen de analyses en archiefverwerking na een gesprek veeleisender zijn. Het besluit van Google om beide als afzonderlijke modeleindpunten beschikbaar te stellen in plaats van als één aanpasbare instelling, erkent dat ontwikkelaars aan weerszijden van die afweging verschillende producten bouwen.

Een gelaagde workflow voor videoproductie

De Omni 1.1 Flash-update is even pragmatisch over hoe creatief werk feitelijk gebeurt. Generatieve video was duur om mee te itereren: elk prompt-experiment betekende een volledige weergave. De nieuwe 360p preview-modus scheidt verkenning en levering, waardoor makers goedkoop door snelle variaties kunnen bladeren en alleen hoeven te betalen voor 4K-opschaling van de opnames die de beoordeling overleven.

De scène-uitbreidingsmechanismen pakken het coherentieprobleem aan dat AI-video in het getto van clipformaat heeft gehouden. Door 10 seconden eerdere context te analyseren in plaats van alleen het laatste frame, kan het model een scène verlengen in stappen van 10 seconden tot maximaal 40 seconden, terwijl karakters, belichting en visuele stijl consistent blijven. Gecombineerd met interpolatie van het eerste en het laatste frame – wat editors deterministische controlepunten geeft, de manier waarop in- en uitmarkeringen werken bij conventionele montage – beginnen AI-gegenereerde beelden in echte postproductiepijplijnen te passen in plaats van ze in het algemeen te vervangen.

Het competitieve beeld

Beide lanceringen positioneren Google als infrastructuur in plaats van als bestemming. In spraak neemt Google de strijd aan met gespecialiseerde transcriptieleveranciers en de voicestacks van zijn cloudrivalen door state-of-the-art nauwkeurigheid te bundelen in de Gemini API die de ontwikkelaars al gebruiken. In video concurreert het op een markt vol met goed gefinancierde startups door de nadruk te leggen op controle en workflow-integratie boven rauw spektakel.

Het distributievoordeel kan doorslaggevend zijn. Hetzelfde transcriptiemodel dat ontwikkelaars kunnen aanroepen vanuit de Gemini API is al de basis voor het Rambler-dictaat van Gboard op Android, de Gemini-app op macOS, Google Antigravity en Chrome. Dit betekent dat Google de modelontwikkeling voor miljarden gebruikersinteracties kan afschrijven en tegelijkertijd de diverse real-world audio kan verzamelen die deze blijft verbeteren. Voor ontwikkelaars die in 2026 een spraak- of videostack kiezen, maakt dat vliegwiel nu deel uit van het veld.

---

Blijf Voorop met AI

Het laatste AI-nieuws, analyses en doorbraken — allemaal op één plek.

Lees meer AI-nieuws →