Google har lanserat Gemini 3.8 Live och Gemini 3.8 Live Extended Thinking, ett par levande dialogmodeller som företaget beskriver som de mest avancerade hittills för naturlig röstsamtal. Modellerna började rullas ut den 15 september över Gemini API, Google AI Studio, Search Live, Gemini Live och Google Workspace, med företagsåtkomst i privat förhandsvisning genom Gemini Enterprise.

Tillkännagivandet kom från Tom Ouyang, en chefsingenjör, och Malini Jaganathan, en medlem av teknisk personal, som skriver på uppdrag av Gemini Audio Team. Det utökar Gemini 3.8-familjen som debuterade tidigare denna månad med Flash- och Flash Cyber-modellerna, och det markerar Googles hittills mest aggressiva satsning på multimodal röstassistans i realtid – en marknad där OpenAI:s röstläge och en våg av talstarter konkurrerar om samma dagliga användningsfall.

Lanseringen passar in i en anmärkningsvärt trång sträcka för Googles modelllinje; täckning av den senaste AI-utvecklingen visar att företaget nu har skickat flera gånger under några veckors lopp när det bekämpar rivaler när det gäller prissättning, kodning och nu röst.

Byggd för realtidskonversation

Det som skiljer Live-modellerna från en vanlig chattmodell med en mikrofon ansluten är latens och tillstånd. Googles Live API-dokumentation beskriver ett gränssnitt med låg latens som bearbetar kontinuerliga strömmar av ljud, bilder och text över en tillståndsfull WebSocket-anslutning, accepterar rått 16kHz PCM-ljud, JPEG-bilder med upp till en bildruta per sekund och text och returnerar talat ljud i realtid.

Modellerna bearbetar visuell input i nästan realtid, vilket låter assistenten se vad användaren ser — Googles demonstrationsvideor visar Gemini 3.8 Live som guidar en anställds introduktionssession med hjälp av visuell kontext, spelar schack i nästan realtid och bygger kompletta affärsplaner och anpassade marknadsföringsverktyg genom naturligt tal. Modellerna kan också upptäcka och växla mellan 97 språk som stöds automatiskt, mitt i konversationen, utan att användaren byter inställningar.

Kanske viktigast för praktisk användning: modellerna kör verktyg och API-anrop i bakgrunden medan konversationen fortsätter, bekräftar förfrågningar och håller dialogen igång medan uppgifterna avslutas. Det gör assistenten från en strikt turbaserad respondent till något som är närmare en agent som råkar prata.

Siffrorna Google hyllar

Google rapporterar att Gemini 3.8 Live Extended Thinking tog den högsta totala positionen på Artificiell analyss tal-till-tal kvalitetsindex med en poäng på 82,6. När det gäller agentuppdragen citerar företaget 68,6 % på τ-Voice-riktmärket och 35,1 % på Sierras τ-Voice-banking-utvärdering, tillsammans med en poäng på 97,7 % på Big Bench Audio.

Det är Googles egna rapporterade siffror, och oberoende verifiering kommer att ta tid - men anspråket på toppen av artificiell analyss diagram, om det håller, skulle sätta Google före de taloptimerade erbjudandena från OpenAI och dedikerade röst AI-företag på övergripande konversationskvalitet. Google säger också att Extended Thinking upprätthåller ett mycket konkurrenskraftigt pris, en underförstådd nick till prispressen som har definierat 3,8-generationen.

Allt ljud som genereras av modellerna är vattenmärkt med SynthID, Googles omärkliga vattenstämpel, så AI-genererat tal förblir upptäckbart – ett skydd för efterlevnad och felaktig information som håller på att bli standard i Googles generativa produkter.

Var du kan använda den

Tillgängligheten skiljer sig åt mellan de två modellerna. Gemini 3.8 Live är tillgängligt för alla i Search Live, Googles visuella sökläge i realtid. Extended Thinking är tillgängligt i Gemini Live, i Docs för Google AI Pro och Ultra-prenumeranter via Workspace och i Gmail och Keep för alla Google-användare.

Utvecklare får modellerna genom Gemini API och Google AI Studio, och Google säger att Live API redan används av plattformar inklusive Agora, Fishjam, LiveKit, Pipecat, Vercel och Vision Agents för att bygga röststyrda gränssnitt ovanpå Googles realtidsinfrastruktur. Salesforce, Genspark och Lumeris utses som lanseringspartner för de nya modellerna.

A Crowded Voice AI Market

Voice håller på att bli gränssnittets slagfält 2026 eftersom det är där AI slutligen flyr från tangentbordet. En modell som kan se, lyssna, byta språk och köra verktyg medan du pratar konkurrerar inte med andra chatbots utan med telefonsamtalet, kundsupportlinjen och den personliga assistenten.

Googles fördel är distribution: Sök, Android, Workspace och Chrome ger Live-modellerna en installerad bas som ingen rival kan matcha. Företaget satsar på att vara närvarande i varje hörn av en användares dag – nu med sina bästa röstmodeller – kommer att betyda mer än någon enskild benchmarkvinst. Rivaler kommer att få sin chans att svara, men Google har klargjort att röst, en gång en demofunktion, nu är en förstklassig produktlinje.

För utvecklare är budskapet likadant direkt. Genom att publicera exakta inmatningsformat, dokumentera körning av bakgrundsverktyg och se ekosystemet med Live API-plattformar, försöker Google göra sin stack till standardsubstratet för alla som bygger talade gränssnitt – från kundsupportrobotar till bärbara assistenter. Huruvida Gemini 3.8 Lives kvalitetskrav håller under oberoende tester, är tillgänglighetsspelet redan i rörelse.

---

Stay ahead of AI

Få de senaste AI-nyheterna, analyserna och genombrotten – allt på ett ställe.

Läs mer AI-nyheter →