Google heeft Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking gelanceerd, een paar live dialoogmodellen die het bedrijf beschrijft als de meest geavanceerde tot nu toe voor natuurlijke stemgesprekken. De modellen zijn op 15 september uitgerold in de Gemini API, Google AI Studio, Search Live, Gemini Live en Google Workspace, met zakelijke toegang in privé preview via Gemini Enterprise.

De aankondiging kwam van Tom Ouyang, een hoofdingenieur, en Malini Jaganathan, een lid van de technische staf, die namens het Gemini Audio Team schreven. Het breidt de Gemini 3.8-familie uit die eerder deze maand debuteerde met de Flash- en Flash Cyber-modellen, en het markeert Google's meest agressieve stap tot nu toe op het gebied van realtime, multimodale stemassistentie - een markt waar OpenAI's stemmodus en een golf van spraak-startups strijden om hetzelfde dagelijkse gebruik.

De lancering past in een opmerkelijk druk traject voor de modellenlijn van Google; Uit berichtgeving over [de nieuwste AI-ontwikkelingen] (https://aibuzzwire.news) blijkt dat het bedrijf nu in een tijdsbestek van een paar weken herhaaldelijk heeft verzonden terwijl het rivalen bestrijdt op het gebied van prijzen, codering en nu spraak.

Gebouwd voor realtime gesprekken

Wat de Live-modellen onderscheidt van een standaard chatmodel met een aangesloten microfoon is latentie en status. De Live API-documentatie van Google beschrijft een interface met lage latentie die continue stromen audio, afbeeldingen en tekst verwerkt via een stateful WebSocket-verbinding, waarbij onbewerkte 16 kHz PCM-audio, JPEG-afbeeldingen tot één frame per seconde en tekst worden geaccepteerd, en gesproken audio in realtime wordt geretourneerd.

De modellen verwerken visuele invoer vrijwel in realtime, waardoor de assistent kan zien wat de gebruiker ziet. De demonstratievideo's van Google laten zien dat Gemini 3.8 live de onboardingsessie van een medewerker begeleidt met behulp van visuele context, schaak speelt in bijna realtime en complete bedrijfsplannen en aangepaste marketingtoolkits opbouwt via natuurlijke spraak. De modellen kunnen ook automatisch midden in een gesprek 97 ondersteunde talen detecteren en er tussen schakelen, zonder dat de gebruiker van instelling hoeft te wisselen.

Misschien wel het belangrijkste voor praktisch gebruik: de modellen voeren tools en API-aanroepen uit op de achtergrond terwijl het gesprek doorgaat, waarbij verzoeken worden bevestigd en de dialoog gaande blijft terwijl de taken zijn voltooid. Dat verandert de assistent van een strikt turn-based respondent in iets dat dichter bij een agent staat die toevallig praat.

De cijfers die Google aanprijst

Google meldt dat Gemini 3.8 Live Extended Thinking de hoogste algemene positie veroverde op de Speech-to-Speech Quality Index van Artificial Analysis met een score van 82,6. Wat de voltooiing van agentische taken betreft, haalt het bedrijf 68,6% op de τ-Voice-benchmark en 35,1% op Sierra's τ-Voice-banking-evaluatie, naast een score van 97,7% op Big Bench Audio.

Dat zijn de door Google zelf gerapporteerde cijfers, en onafhankelijke verificatie zal enige tijd vergen – maar de claim op de top van de lijst van Artificial Analysis zou, als deze stand houdt, Google een voorsprong geven op het spraakgeoptimaliseerde aanbod van OpenAI en toegewijde spraak-AI-bedrijven op het gebied van de algehele gesprekskwaliteit. Google zegt ook dat Extended Thinking een zeer competitief prijsniveau handhaaft, een impliciete knipoog naar de prijsdruk die de 3.8-generatie heeft gedefinieerd.

Alle door de modellen gegenereerde audio is voorzien van een watermerk met SynthID, het onmerkbare watermerk van Google, zodat door AI gegenereerde spraak detecteerbaar blijft – een waarborg voor naleving en verkeerde informatie die standaard wordt in de generatieve producten van Google.

Waar je het kunt gebruiken

De beschikbaarheid verschilt tussen de twee modellen. Gemini 3.8 Live is voor iedereen beschikbaar binnen Search Live, de realtime visuele zoekmodus van Google. Extended Thinking is beschikbaar in Gemini Live, in Docs voor Google AI Pro- en Ultra-abonnees via Workspace, en in Gmail en Keep voor alle Google-gebruikers.

Ontwikkelaars krijgen de modellen via de Gemini API en Google AI Studio, en Google zegt dat de Live API al wordt gebruikt door platforms als Agora, Fishjam, LiveKit, Pipecat, Vercel en Vision Agents om spraakgestuurde interfaces te bouwen bovenop de realtime infrastructuur van Google. Salesforce, Genspark en Lumeris worden genoemd als lanceringspartners voor de nieuwe modellen.

Een drukke Voice AI-markt

Stem wordt het interface-slagveld van 2026, omdat AI daar eindelijk aan het toetsenbord ontsnapt. Een model dat kan zien, luisteren, van taal kan wisselen en tools kan gebruiken terwijl hij praat, concurreert niet met andere chatbots, maar met het telefoongesprek, de klantenondersteuningslijn en de persoonlijke assistent.

Het voordeel van Google is de distributie: Search, Android, Workspace en Chrome geven de Live-modellen een geïnstalleerde basis die geen enkele concurrent kan evenaren. Het bedrijf gokt erop dat aanwezig zijn op elke hoek van de dag van een gebruiker – nu met de beste stemmodellen – belangrijker zal zijn dan welke enkele benchmark dan ook. Rivalen krijgen de kans om te reageren, maar Google heeft duidelijk gemaakt dat voice, ooit een demofunctie, nu een eersteklas productlijn is.

Voor ontwikkelaars is de boodschap eveneens direct. Door exacte invoerformaten te publiceren, de uitvoering van achtergrondtools te documenteren en het ecosysteem te voorzien van Live API-platforms, probeert Google van zijn stapel het standaardsubstraat te maken voor iedereen die gesproken interfaces bouwt – van klantenondersteuningsbots tot draagbare assistenten. Of de kwaliteitsclaims van Gemini 3.8 Live stand houden bij onafhankelijke tests, het beschikbaarheidsspel is al in beweging.

---

Blijf AI een stap voor

Ontvang het laatste AI-nieuws, analyses en doorbraken – allemaal op één plek.

Lees meer AI-nieuws →