Google skickade tyst två betydande Gemini-modelluppdateringar inom 48 timmar den här veckan, och båda är riktade till utvecklare som bygger produktionsapplikationer. Gemini 3.5 Transcribe, som introducerades 26 augusti, är företagets hittills mest exakta tal-till-text-modell, enligt Googles officiella blogg. Gemini Omni 1.1 Flash, tillkännagavs den 27 augusti, ger professionella kontroller till generativ video, inklusive scenförlängning upp till 40 sekunder och 4K-uppskalning. Båda modellerna är tillgängliga via Gemini API i Google AI Studio och Gemini Enterprise Agent Platform.

Gemini 3.5 Transkribera: tal-till-text som rensar upp efter sig For more context on this story, see our ongoing AI news.

Vad som skiljer Gemini 3.5 Transcribe från konventionell taligenkänning, säger Google, är att den konverterar råljud direkt till polerad, formaterad text snarare än en rå transkription. Modellen hanterar bakgrundsljud, komplex jargong och rensning av oväsenligheter – den tar bort fyllnadsord som "ums" och "ahs", löser självkorrigeringar som "låt oss träffas tisdag - nej, onsdag" och automatiskt formaterar utdata.

Benchmarksiffrorna som Google citerade är anmärkningsvärda. Som mätt med artificiell analys uppnår modellen en genomsnittlig ordfelfrekvens (WER) på 4,0 procent för strömmande användningsfall och 2,6 procent för icke-strömmande ljud. På det flerspråkiga riktmärket FLEURS över de främsta språken publicerar den 5,50 procent WER i streamingläge och 5,04 procent icke-streaming, vilket förbättrar Googles tidigare transkriptionsmodell, Chirp 3. Tiden till slutlig transkription förbättras med 70 procent jämfört med Chirp 3, återigen mätt med artificiell analys.

Modellen levereras i två varianter för två arbetsflöden. För liveapplikationer levererar "gemini-3.5-transcribe-live" kontinuerlig dubbelriktad strömning med fördröjning på under sekunder genom Live API, inriktad på röstagenter och textning i realtid. För inspelat ljud – möten, samtalsloggar, arkiv – erbjuder "gemini-3.5-transcribe" högtalarattribution för upp till tre talare (med stöd för fler i experimentläge) och tidsstämplar på ordnivå via Interactions API.

Andra funktioner inkluderar automatisk upptäckt och transkription över mer än 85 språk med accent- och dialekthantering, och anpassat ordförrådsstöd så att modellen anpassar sig till specialiserad jargong och unika stavningar. Google gav också modellens ögon av ett slag: genom funktionsanrop kan den delegera uppgifter som bildgenerering eller filanalys till andra Gemini-modeller - en funktion som för närvarande är tillgänglig i Gemini-appen på macOS.

Gemini Omni 1.1 Flash: videogenerering växer en tidslinje

Den andra lanseringen tar upp det vanligaste klagomålet om AI-video: kontroll. Gemini Omni 1.1 Flash är en produktionsfokuserad uppdatering som gör generativ video styrbar på ett sätt som dess föregångare inte var, där Google DeepMinds produktchefer Anish Nangia och Alisa Fortin beskriver releasen som att Omni 1.1 är "produktionsklar för professionell användning."

Scenförlängning är rubrikfunktionen. Utvecklare kan nu fortsätta att generera bilder sömlöst från ett befintligt klipp, med modellen som analyserar upp till 10 sekunder av tidigare sammanhang – ett språng från tidigare modeller som endast refererade till den sista sekunden. Videor kan förlängas i steg om 10 sekunder upp till en ackumulerad längd på 40 sekunder, vilket förbättrar den visuella konsekvensen och narrativa följsamheten för längre berättelser.

Uppdateringen lägger också till interpolering av första och sista bildruta, vilket låter utvecklare specificera start- och slutbilder för att skapa jämna, avsiktliga kamerarörelser och övergångar mellan bilder. För leverans kan färdiga projekt skalas upp till 4K-upplösning, medan ett 360p-förhandsgranskningsläge låter kreatörer upprepa uppmaningar snabbt och billigt innan de förbinder sig till slutlig rendering.

Från API till vardagliga ytor

Google kopplar också in båda modellerna till sina konsumentprodukter, vilket är där dess distributionsfördelar visar sig. På Android använder den nya "Rambler"-funktionen i Gboard 3.5 Transcribe för att omvandla talade tankar till välformaterad text samtidigt som utfyllnadsord filtreras – användare kan till och med göra redigeringar med rösten. Modellen driver också diktering i Gemini-appen på macOS, fungerar tillsammans med skärmkontext i Google Antigravity och integreras i Chrome.

För utvecklare läses de två lanseringarna som en strategi: Google driver Gemini från en chatbot du pratar med till en infrastruktur som ser, hör och producerar media. Med OpenAI, ElevenLabs och en kohort av videostartups som konkurrerar i samma territorium, är ordfelsfrekvensen på 2,6 procent och 40-sekunders sammanhängande scener Googles öppningsbud för de produktionsarbetsbelastningar som faktiskt genererar intäkter – röstagenter, textningspipelines och kreativa verktyg. Utvecklare kan börja bygga med båda modellerna i Google AI Studio idag.

Varför ordfelfrekvens fortfarande spelar roll

Ordfelfrekvens låter som en akademisk statistik, men i produktionen är det skillnaden mellan en röstprodukt som fungerar och en som frustrerar. Varje missförstått yttrande i en röstagent bryter en uppgift: ett felhört order-ID utlöser en misslyckad uppslagning, en förvrängd adress skickar ett paket till fel stad. Det är därför som klyftan mellan 2,6 procent WER på icke-strömmande ljud och de höga ensiffriga frekvenserna som var vanliga för en generation av modeller sedan förvärras till en storleksskillnad i användbarhet.

Skillnaden mellan de två lägena som Google rapporterade har också betydelse för arkitekter. Strömmande transkription – 4,0 procent WER-siffran – byter ut viss noggrannhet mot latens under en sekund, vilket interaktiva användningsfall som live-röstagenter kräver. Batchtranskription av inspelat ljud går långsammare men når 2,6 procent, vilket är anledningen till att analys och arkivbehandling efter samtal kan vara mer krävande. Googles beslut att exponera båda som separata modellslutpunkter snarare än en justerbar inställning erkänner att utvecklare bygger olika produkter på vardera sidan av den kompromissen.

Ett arbetsflöde i nivåer för videoproduktion

Omni 1.1 Flash-uppdateringen är lika pragmatisk om hur kreativt arbete faktiskt sker. Generativ video har varit dyr att repetera med: varje snabbexperiment innebar en fullständig rendering. Det nya 360p förhandsgranskningsläget skiljer utforskning från leverans, låter kreatörer cykla igenom snabba varianter billigt och bara betala för 4K-uppskalning på bilderna som överlever granskning.

Scenförlängningsmekaniken tar itu med koherensproblemet som har hållit AI-video kvar i gettot i klippstorlek. Genom att analysera 10 sekunder av föregående sammanhang istället för bara den sista bildrutan, kan modellen förlänga en scen i 10-sekunders steg upp till 40 sekunder samtidigt som karaktärer, ljussättning och visuell stil hålls konsekventa. Kombinerat med interpolering av första och sista bildruta – vilket ger redaktörer deterministiska kontrollpunkter, sättet in- och utmarkörer fungerar i konventionell redigering – börjar AI-genererade filmer att passa in i riktiga efterproduktionspipelines snarare än att ersätta dem i grossistledet.

Konkurrensbilden

Båda lanseringarna positionerar Google som infrastruktur snarare än destination. I tal tar Google sig an specialiserade transkriptionsleverantörer och röststackarna från sina molnrivaler genom att kombinera toppmodern precision i Gemini API som utvecklarna redan använder. Inom video tävlar det på en marknad full av välfinansierade startups genom att betona kontroll och arbetsflödesintegration framför rått spektakel.

Distributionsfördelen kan vara den avgörande faktorn. Samma transkriptionsmodell som utvecklare kan anropa från Gemini API driver redan Gboards Rambler-diktering på Android, Gemini-appen på macOS, Google Antigravity och Chrome – vilket innebär att Google kan amortera modellutvecklingen över miljarder användarinteraktioner samtidigt som den samlar in det mångsidiga verkliga ljudet som hela tiden förbättrar det. För utvecklare som väljer en tal- eller videostack 2026 är det svänghjulet nu en del av pitch.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →