Jak wynika z postu na oficjalnym blogu Google autorstwa menadżerów produktu DeepMind, Anisha Nangii i Alisy Fortin, Google ogłosiło w czwartek wprowadzenie Gemini Omni 1.1 Flash, gotową do produkcji aktualizację swojego generatywnego modelu wideo, która dodaje rozszerzenia scen, sterowanie kamerą kinową i wyjście 4K.

Aktualizacja przenosi Omni z modelu eksperymentalnego do tego, co Google nazywa gotowością produkcyjną do użytku profesjonalnego za pośrednictwem interfejsu Gemini API w Google AI Studio, a dostępność jest również wyświetlana na platformie Gemini Enterprise Agent Platform. Google opisuje Gemini Omni jako osobę, która wprowadziła rozumowanie w świecie rzeczywistym do tworzenia generatywnego i umieszcza wersję 1.1 jako punkt, w którym model staje się wystarczająco niezawodny dla programistów tworzących przepływy pracy wideo, narzędzia kreatywne i oprogramowanie do edycji multimediów.

Dłuższe historie dzięki rozszerzeniu scen

Główną funkcją nagłówka jest rozszerzanie scen, które pozwala programistom na wykorzystanie istniejącego wygenerowanego wideo i płynne generowanie materiału od miejsca, w którym zostało przerwane. Google twierdzi, że dzięki Omni 1.1 model może analizować do 10 sekund wcześniejszego kontekstu — to krok naprzód w porównaniu z poprzednimi modelami, które odwoływały się tylko do ostatniej sekundy. Zdaniem firmy efektem jest lepsza spójność wizualna i spójność narracji podczas tworzenia dłuższych historii lub obierania nowych kierunków twórczych.

Filmy można wydłużać co 10 sekund, aż do łącznej długości 40 sekund. To wciąż mało w porównaniu z tradycyjnymi długościami filmów, ale w przypadku krótkich treści, prac związanych z kreacją reklamową i wstępnymi wizualizacjami Google obstawia, że ​​kontrola i spójność mają większe znaczenie niż czas trwania.

Materiał demonstracyjny opublikowany wraz z ogłoszeniem pokazuje, jak przepływ pracy ma wyglądać w praktyce: każdy nowy monit stanowi kontynuację poprzedniej sceny, model przenosi kontekst wizualny do przodu, podczas gdy zachęta kieruje zmianami w ruchu kamery, ustawieniu, a nawet nastroju — jedna sekwencja przechodzi od bliskiej rozmowy do powolnego przeciągania się przez zakurzone katakumby, a następnie do ogromnej, pływającej biblioteki. Tworzenie sceny z warstw zamiast generowania jej w jednym ujęciu bardziej przypomina sposób, w jaki montażysta montuje materiał, niż działanie wczesnych narzędzi do zamiany tekstu na wideo.

Sterowanie kamerą i interpolacja klatek

W tej wersji dodano także narzędzia do produkcji wideo o jakości studyjnej, które Google określa. Wśród przykładów pokazanych w poście z ogłoszeniem znajdują się: kinowy zoom typu „dolly-zoom”, który przesuwa kamerę do przodu podczas oddalania, mechaniczny zoom typu snap-zoom w oczach postaci oraz obrót orbitalny o 360 stopni wokół zamrożonej postaci, aby pokazać głębię 3D i paralaksę.

Programiści mogą także określić pierwszą i ostatnią klatkę ujęcia, a model interpoluje płynne przejścia między nimi — jest to technika znana profesjonalnym animatorom, która zapewnia precyzyjną kontrolę nad tym, gdzie zaczyna się i kończy ujęcie. Śledź najnowsze osiągnięcia w dziedzinie sztucznej inteligencji, gdy Google kontynuuje szybkie wydawanie nowych rozwiązań.

Iteruj w rozdzielczości 360p, dostarczaj w rozdzielczości 4K

Omni 1.1 Flash wprowadza dwupoziomowy przepływ pracy mający na celu kontrolę kosztów. Programiści mogą generować szybkie podglądy 360p, aby szybciej i taniej wdrażać pomysły w procesie twórczym, a następnie skalować ostateczny projekt do rozdzielczości 4K, aby uzyskać dopracowany wynik. Google twierdzi, że skalowanie w górę zapewnia wyraźny obraz o wysokiej rozdzielczości, odpowiedni do użytku profesjonalnego.

Potok podglądu do 4K rozwiązuje jeden z utrzymujących się problemów ekonomicznych generatywnego wideo: koszt regeneracji sygnału wyjściowego w pełnej rozdzielczości za każdym razem, gdy zmienia się monit. Oddzielając eksplorację od dostarczania, Google czyni model bardziej praktycznym w przypadku komercyjnych potoków, w których dziesiątki iteracji poprzedzają ostateczne renderowanie.

Dlaczego to ma znaczenie

Aktualizacja odzwierciedla przejście w branży od jakości generowania obrazów w stronę sterowalności — możliwości kierowania ruchem kamery, utrzymywania spójności postaci i trafiania w dokładne klatki, tak jak zrobiłby to reżyser lub montażysta. W przypadku programistów tworzących kreatywne oprogramowanie różnica między wersją demonstracyjną a produktem do wdrożenia często sprowadza się do tych elementów sterujących, a nie do surowej wierności.

Sformułowanie komunikatu przez Google wyraźnie określa docelowych odbiorców. Firma wymienia trzy kategorie docelowe — generatywne przepływy pracy wideo, narzędzia kreatywne i oprogramowanie do edycji multimediów — i opisuje aktualizacje jako zwiększające kontrolę nad generatywnym wideo, szybsze w iteracji i dopracowane pod kątem wdrożenia w świecie rzeczywistym. W podsumowaniu wydania pojawia się informacja o szybszym prototypowaniu wraz ze skalowaniem do 4K, co podkreśla, że ​​prędkość iteracji jest sprzedawana jako funkcja sama w sobie.

Dzięki Omni 1.1 Flash dostępnemu w AI Studio i za pośrednictwem interfejsu API Gemini Google udostępnia ten model również użytkownikom korporacyjnym za pośrednictwem platformy Gemini Enterprise Agent Platform, sygnalizując, że generatywne wideo jest pozycjonowane jako infrastruktura biznesowa, a nie nowość dla konsumentów.

Co obejrzeć

W ogłoszeniu nie podano szczegółów cen sygnału wyjściowego 4K, a programiści będą obserwować, jak skumulowany limit 40 sekund wpłynie na rzeczywiste plany produkcyjne. Konkurencja w dziedzinie wideo opartego na sztucznej inteligencji pozostaje intensywna, a konkurenci w szybkim tempie dostarczają własne funkcje kontroli, a ta dynamika wielokrotnie skracała w tym roku okres przydatności do spożycia najnowocześniejszych produktów.

Na razie wiadomość Google do programistów jest bezpośrednia: generatywne wideo, które kiedyś wymagało szybkiej alchemii i szczęścia, można teraz reżyserować, rozszerzać i wykańczać w rozdzielczości 4K za pomocą jednego interfejsu API.

---

Wyprzedź sztuczną inteligencję

Otrzymuj najnowsze wiadomości, analizy i przełomowe informacje dotyczące sztucznej inteligencji — wszystko w jednym miejscu.

Przeczytaj więcej aktualności o sztucznej inteligencji →