Google ve čtvrtek oznámil Gemini Omni 1.1 Flash, produkční aktualizaci svého generativního video modelu, která přidává rozšíření scény, ovládání filmové kamery a výstup 4K, podle příspěvku na oficiálním blogu Google od produktových manažerů DeepMind Anish Nangia a Alisa Fortin.
Aktualizace posouvá Omni z experimentálního modelu do toho, co Google nazývá produkční připravenost pro profesionální použití prostřednictvím Gemini API v Google AI Studio, přičemž dostupnost je také uvedena prostřednictvím platformy Gemini Enterprise Agent Platform. Google popisuje Gemini Omni jako společnost, která přinesla do generativní tvorby uvažování v reálném světě, a uvádí verzi 1.1 jako bod, kde se model stává dostatečně spolehlivým pro vývojáře vytvářející pracovní postupy pro video, kreativní nástroje a software pro úpravu médií.
Delší příběhy díky rozšíření scény
Hlavní funkcí je rozšíření scény, které vývojářům umožňuje vzít existující vygenerované video a plynule pokračovat ve vytváření záběrů tam, kde skončili. S Omni 1.1 Google říká, že model dokáže analyzovat až 10 sekund předchozího kontextu – skok od předchozích modelů, které odkazovaly pouze na poslední sekundu. Výsledkem je podle společnosti zlepšená vizuální konzistence a přilnavost vyprávění při budování delších příběhů nebo větvení do nových kreativních směrů.
Videa lze prodloužit v 10sekundových krocích až do celkové celkové délky 40 sekund. To zůstává krátké než tradiční délky videa, ale u krátkého obsahu, reklamní kreativy a práce před vizualizací Google sází na to, že na kontrole a konzistenci záleží více než na délce.
Demonstrační materiál zveřejněný spolu s oznámením ukazuje, jak má pracovní postup fungovat v praxi: každá nová výzva navazuje na předchozí scénu, přičemž model nese vizuální kontext vpřed, zatímco výzva řídí změny v pohybu kamery, nastavení a dokonce i nálady – jedna sekvence se přesune od úzké konverzace k pomalému vytahování přes zaprášené katakomby a poté do rozsáhlé plovoucí knihovny. Vytváření scény ve vrstvách, spíše než její generování v jednom záběru, je blíže tomu, jak editor sestavuje záběry, než jak fungovaly rané nástroje pro převod textu na video.
Ovládání kamery a interpolace snímků
Vydání také přidává to, co Google popisuje jako nástroje pro produkci videa ve studiové kvalitě. Mezi příklady uvedené v oznamovacím příspěvku: filmový panáček-zoom, který posouvá kameru dopředu a zároveň oddaluje, mechanické přiblížení do očí postavy a 360stupňová orbitální rotace kolem zamrzlé postavy pro předvedení 3D hloubky a paralaxy.
Vývojáři mohou také určit první a poslední snímek záběru, přičemž model mezi nimi interpoluje plynulé přechody – technika známá profesionálním animátorům, která poskytuje jemnou kontrolu nad tím, kde záběr začíná a končí. Sledujte [nejnovější vývoj umělé inteligence] (https://aibuzzwire.news), zatímco Google pokračuje v rychlém vydávání.
Iterujte v 360p, zobrazujte ve 4K
Omni 1.1 Flash zavádí dvouúrovňový pracovní postup zaměřený na kontrolu nákladů. Vývojáři mohou generovat rychlé 360p náhledy, aby mohli nápady rychleji a levněji opakovat během kreativního procesu, a poté převzorkovat finální projekt na rozlišení 4K pro dokonalý výsledek. Google říká, že upscaling vytváří ostrý výstup s vysokým rozlišením vhodný pro profesionální použití.
Potrubí náhledu do 4K řeší jeden z přetrvávajících ekonomických problémů generativního videa: náklady na regeneraci výstupu v plném rozlišení pokaždé, když se změní výzva. Oddělením průzkumu od doručování Google činí model praktičtějším pro komerční kanály, kde finálnímu vykreslení předcházejí desítky iterací.
Proč na tom záleží
Aktualizace odráží průmyslový posun od kvality surové generace směrem k ovladatelnosti – schopnosti řídit pohyb kamery, udržovat konzistenci postavy a trefovat přesné snímky, jak by to dělal režisér nebo střihač. Pro vývojáře, kteří vytvářejí kreativní software, je rozdíl mezi ukázkou a nasaditelným produktem často spíše v těchto ovládacích prvcích než v hrubé věrnosti.
Rámec vydání společnosti Google jasně určuje zamýšlené publikum. Společnost pojmenovává tři cílové kategorie – generativní pracovní postupy pro video, kreativní nástroje a software pro úpravu médií – a popisuje aktualizace tak, že umožňují lepší ovladatelnost generativního videa, rychlejší iteraci a vyladění pro nasazení v reálném světě. Rychlejší prototypování se objevuje vedle 4K upscalingu v souhrnu vydání, což zdůrazňuje, že rychlost iterace se prodává jako samostatná funkce.
S Omni 1.1 Flash dostupným v AI Studio a prostřednictvím Gemini API posouvá Google model také směrem k podnikovým uživatelům prostřednictvím platformy Gemini Enterprise Agent Platform, což signalizuje, že generativní video je umístěno spíše jako obchodní infrastruktura než jako spotřebitelská novinka.
Na co se dívat
Podrobnosti o cenách pro výstup 4K nebyly v oznámení zdůrazněny a vývojáři budou sledovat, jak 40sekundový kumulativní limit ovlivní plány skutečné produkce. Konkurence ve videu s umělou inteligencí zůstává intenzivní a soupeři dodávají své vlastní funkce ovládání rychlým tempem – dynamika, která letos opakovaně zkracovala životnost nejmodernějších reklamací.
Poselství Google vývojářům je prozatím přímé: generativní video, které dříve vyžadovalo okamžitou alchymii a štěstí, lze nyní řídit, rozšiřovat a dokončovat ve 4K prostřednictvím jediného rozhraní API.
---
Stay Ahead of AIZískejte nejnovější zprávy, analýzy a průlomové informace o umělé inteligenci – vše na jednom místě.
Přečtěte si další zprávy o AI →