Google tillkännagav på torsdagen Gemini Omni 1.1 Flash, en produktionsklar uppdatering av sin generativa videomodell som lägger till scenförlängning, filmiska kamerakontroller och 4K-utgång, enligt ett inlägg på den officiella Google-bloggen av DeepMind-produktcheferna Anish Nangia och Alisa Fortin.

Uppdateringen flyttar Omni från en experimentell modell till vad Google kallar produktionsberedskap för professionell användning via Gemini API i Google AI Studio, med tillgänglighet även listad via Gemini Enterprise Agent Platform. Google beskriver Gemini Omni som att ha fört verkliga resonemang till generativt skapande, och positionerar 1.1-versionen som den punkt där modellen blir tillräckligt pålitlig för utvecklare som bygger videoarbetsflöden, kreativa verktyg och medieredigeringsprogram.

Längre berättelser genom scenförlängning

Rubrikmöjligheten är scenförlängning, som låter utvecklare ta en befintlig genererad video och fortsätta generera bilder sömlöst där den slutade. Med Omni 1.1 säger Google att modellen kan analysera upp till 10 sekunder av tidigare sammanhang – ett språng från tidigare modeller som endast refererade till den sista sekunden. Resultatet, enligt företaget, är förbättrad visuell konsekvens och narrativ vidhäftning när man bygger längre berättelser eller förgrenar sig in i nya kreativa riktningar.

Videor kan förlängas i steg om 10 sekunder upp till en total kumulativ längd på 40 sekunder. Det är fortfarande korta än traditionella videolängder, men för innehåll i kort form, kreativt reklamarbete och förvisualisering, satsar Google på att kontroll och konsistens är viktigare än varaktigheten.

Demonstrationsmaterialet som publiceras vid sidan av tillkännagivandet visar hur arbetsflödet är tänkt att fungera i praktiken: varje ny prompt fortsätter den föregående scenen, med modellen som bär visuella sammanhang framåt medan prompten styr förändringar i kamerarörelser, inställning och jämn stämning – en sekvens går från ett nära samtal till ett långsamt utdrag genom dammiga katakomber och sedan in i ett stort flytande bibliotek. Att bygga en scen i lager, snarare än att skapa den i en bild, är närmare hur en redigerare sammanställer filmmaterial än hur tidiga text-till-video-verktyg fungerade.

Kamerakontroll och raminterpolation

Utgåvan lägger också till vad Google beskriver som videoproduktionsverktyg av studiokvalitet. Bland exemplen som visas i tillkännagivandeinlägget: en filmisk dolly-zoom som flyttar kameran framåt medan den zoomar ut, en mekanisk snap-zoom i en karaktärs ögon och en 360-graders rotation runt en frusen karaktär för att visa upp 3D-djup och parallax.

Utvecklare kan också specificera första och sista bildrutor för en bild, där modellen interpolerar mjuka övergångar mellan dem – en teknik som är bekant för professionella animatörer som ger finkornig kontroll över var en bild börjar och slutar. Följ den senaste AI-utvecklingen medan Google fortsätter sin snabba release-kadens.

Iterera i 360p, leverera i 4K

Omni 1.1 Flash introducerar ett kvalitetsarbetsflöde i två nivåer som syftar till kostnadskontroll. Utvecklare kan generera snabba 360p-förhandsvisningar för att iterera på idéer snabbare och billigare under den kreativa processen, och sedan uppskala det slutliga projektet till 4K-upplösning för ett polerat resultat. Google säger att uppskalningen ger skarpa, högupplösta utdata som är lämpliga för professionell användning.

Förhandsgranskningen-till-4K-pipelinen tar itu med ett av de ihållande ekonomiska problemen med generativ video: kostnaden för att återskapa fullupplösning varje gång en prompt ändras. Genom att frikoppla utforskning från leverans gör Google modellen mer praktisk för kommersiella pipelines där dussintals iterationer föregår en slutlig rendering.

Varför det är viktigt

Uppdateringen återspeglar ett branschskifte från rå generationskvalitet till kontrollerbarhet – förmågan att styra kamerarörelser, bibehålla karaktärskonsistens och träffa exakta bildrutor, på det sätt som en regissör eller redigerare skulle göra. För utvecklare som bygger kreativ mjukvara beror skillnaden mellan en demo och en utplacerbar produkt ofta på dessa kontroller snarare än rå trohet.

Googles inramning av releasen gör den avsedda publiken tydlig. Företaget namnger tre målkategorier – generativa videoarbetsflöden, kreativa verktyg och mediaredigeringsprogram – och beskriver uppdateringarna som att göra generativ video mer kontrollerbar, snabbare att upprepa och polerad för implementering i verkligheten. Snabbare prototyper visas tillsammans med 4K-uppskalning i releasesammanfattningen, vilket understryker att iterationshastigheten säljs som en egen funktion.

Med Omni 1.1 Flash tillgängligt i AI Studio och genom Gemini API, driver Google också modellen mot företagsanvändare via Gemini Enterprise Agent Platform, vilket signalerar att generativ video positioneras som affärsinfrastruktur snarare än en konsumentnyhet.

Vad du ska titta på

Prisdetaljer för 4K-utdata framhävdes inte i tillkännagivandet, och utvecklare kommer att titta på hur den kumulativa gränsen på 40 sekunder påverkar verkliga produktionsplaner. Konkurrensen inom AI-video är fortfarande intensiv, med rivaler som levererar sina egna kontrollerbarhetsfunktioner i snabb takt – en dynamik som upprepade gånger har förkortat hållbarheten för toppmoderna anspråk i år.

För närvarande är Googles budskap till utvecklarna direkt: generativ video som en gång krävde snabb alkemi och tur kan nu dirigeras, utökas och färdigställas i 4K genom ett enda API.

---

Stay ahead of AI

Få de senaste AI-nyheterna, analyserna och genombrotten – allt på ett ställe.

Läs mer AI-nyheter →