Google har lanserat Gemini 3.5 Transcribe, en ny tal-till-text-modell byggd för realtidstranskription som känner igen mer än 85 språk automatiskt - och polerar utdata längs vägen, tar bort utfyllnadsord och korrigerar verbala snubblar utan att bli tillfrågad.
Lanseringen positionerar Googles talstack som en direkt utmanare på den snabbt växande transkriptionsmarknaden, där noggrannhet och latens i allt högre grad avgör vilka tjänster utvecklare använder för samtal, möten, bildtexter och röstgränssnitt. For more context on this story, see our ongoing more AI stories.
Vad modellen kan göra
Enligt Googles tillkännagivande, vars täckning publicerades av The Decoder, går Gemini 3.5 Transcribe långt utöver att konvertera talade ord till text:
- Automatisk språkdetektering över 85-plus språk, utan konfiguration krävs
- Ta bort fyllnadsord, städa upp "um", "uh" och liknande problem
- Korrigering av tunghalsar, producerar läsbar prosa snarare än ordagrant brus
- Autonom textformatering, inklusive skiljetecken och struktur
Företaget rapporterar en ordfelfrekvens på 4,0 procent för strömmande ljud och 2,6 procent för inspelat ljud, tillsammans med fördröjningar på cirka 70 procent jämfört med sin föregångare, Chirp 3 – en betydande marginal i scenarier för livetextning där fördröjning bryter konversationer.
Två gränssnitt för två jobb
Utvecklare får åtkomst genom två distinkta gränssnitt för applikationsprogrammering:
Live API — `gemini-3.5-transcribe-live`
Hanterar streaming i realtid med mycket låg latens, riktar in sig på livetextning, röstagenter och interaktiva assistenter där svarstiden är viktigast.Interactions API — `gemini-3.5-transcribe`
Bearbetar inspelat ljud och returnerar utskrifter med tillskrivning av talare och tidsstämplar – arbetsflödet som är typiskt för möten, intervjuer, poddsändningar och mediepostproduktion.Utöver transkription stöder modellen funktionsanrop, vilket innebär att den kan delegera uppföljningsuppgifter till andra modeller i Gemini-familjen – till exempel att utlösa en bildgenereringsförfrågan eller en webbsökning baserad på något som sagts under en session. Det förvandlar en transkriptionsmotor till ett kontrollerbart gränssnittslager för röststyrda applikationer.
Levereras redan via Google-produkter
Modellen finns live i Google AI Studio och på Gemini Enterprise Agent Platform för utvecklare idag. Google har också kopplat den till konsumentytor: Gboard på Android använder den via en intern komponent som heter Rambler för diktering, Gemini-appen på macOS tillämpar den på röstinmatning och Chrome-integration är planerad att följa.
Den fördelningen spelar roll. Taligenkänning förtjänar sin skala, och inbäddning av modellen i tangentbord, stationära appar och webbläsare ställer den inför miljarder indatainteraktioner dagligen – samtidigt som den matar ut de utvärderingsslingor som behövs för att hålla felfrekvensen fallande över accenter, dialekter och bullriga miljöer.
Konkurrenskraftiga insatser i Speech AI
Transkription har i tysthet blivit en konkurrenskraftig slagfält bland både gränslaboratorier och specialistleverantörer. Exakt talförståelse med låg latens är inträdesbiljetten för agentprodukter som agerar på talade kommandon, företagsmötesintelligens, tillgänglighetsfunktioner och flerspråkig kundtjänstautomatisering.
Genom att para ihop aggressiva latensförbättringar med självkorrigerande utdata, satsar Google på att utvecklare föredrar transkriptioner som läses som redigerad text snarare än rå fonetisk infångning – byter strikt ordagrant trohet för användbarhet. Lag som behöver exakta uppgifter, såsom juridiska eller medicinska transkriberare, kanske fortfarande vill ordagranta; för alla andra fortsätter den praktiska skillnaden mellan att höra någon och att förstå dem att minska.
Med Gemini 3.5 Transcribe nu allmänt tillgängligt i AI Studio och företagsverktyg, kommer det första meningsfulla testet att vara användningsstatistik från röstagentutvecklare – ett marknadssegment som växer tillräckligt snabbt för att till och med ökande noggrannhetsvinster omvandlas till betydande växlingsbeslut.
Varför latens är den verkliga slagfältet
Felfrekvenser får rubrikerna, men latens avgör tyst vilka produkter som är lönsamma. En transkriptionsmotor som matar en överlagring av livetextning måste hålla jämna steg med konversationen, annars kopplas tittarna ur. En röstagent som förhandlar ett kundsupportsamtal kan inte pausa obekvämt medan dess tallager kommer ikapp. Googles rapporterade 70-procentiga minskning av fördröjningen i förhållande till Chirp 3-målen just det gapet – vilket förkortar avståndet mellan en talare som avslutar en mening och nedströms system som agerar på den.
För agentiska applikationer förenar detta: varje tur i en talad dialog involverar igenkänning, resonemang och respons. Att raka millisekunder från igenkänningsstadiet ger byggare utrymme att spendera på mer kapabla – och långsammare – resonemangsmodeller utan att bryta mot budgeten för samtalstid.
Den ordagranta avvägningen
Ett designval förtjänar granskning. Som standard kurerar Gemini 3.5 Transcribe utdata: utfyllnadsord försvinner, snubblar korrigeras och formatering tillämpas automatiskt. För de flesta affärsanvändningar – minuter, bildtexter, sökbara arkiv – är det precis vad användarna vill ha.
Men vissa arbetsflöden beror på ordagrant register. Rättsliga depositioner, granskning av efterlevnad och journalistisk faktagranskning kräver ibland att man vet exakt vad som sades, inklusive tvekan. Organisationer i reglerade branscher kommer att vilja ha klarhet i hur mycket av utjämningen som är valfri och konfigurerbar innan de migrerar känsliga pipelines till den nya modellen. Googles dokumentation och API-parametrar kommer effektivt att sätta var den ordagranta kontra polerade linjen ligger för branschen.
Ett flerspråkigt fotavtryck som vallgrav
Täckning av 85-plus språk med automatisk upptäckt är inte bara en funktionschecklista. Flerspråkig räckvidd koncentrerar värdet på marknader där konkurrenterna historiskt sett släpar efter: regionala accenter, kodväxling mellan språk i mitten av meningen och lågresursspråk alla straffar modeller som tränats snävt på engelska tunga korpus.
För globala företag som driver supportcenter i dussintals länder, minskar en enda modell som hanterar språkdetektering på ett transparent sätt integrationskomplexiteten – en pipeline istället för många konfigurationer per marknad. I kombination med distribution genom Gboards miljarder Android-installationer, positionerar Google transkribering av flerspråkighet som infrastruktur snarare än en premiumkapacitet.
Vad du ska titta på
Tre signaler kommer att visa om Gemini 3.5 Transcribe ändrar marknadsandel eller bara höjer förväntningarna: utvecklarmigrering i tredje parts benchmarks under de kommande månaderna; hur snabbt rivaler matchar latenssiffrorna snarare än exakthetskraven; och om de funktionskallande krokarna skapar en våg av röstförst-agenter byggda på Gemini. Lanseringen är live nu, och prisnivåer genom AI Studio bör göra experiment så pass billigt att byteskostnaderna sjunker till nästan ingenting.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →