Google у четвер анонсувала Gemini Omni 1.1 Flash, готове до виробництва оновлення своєї моделі генеративного відео, яке додає розширення сцени, елементи керування кінематографічною камерою та вихід 4K, згідно з повідомленням в офіційному блозі Google менеджерами з продуктів DeepMind Анішом Нангіа та Алісою Фортін.

Оновлення переміщує Omni з експериментальної моделі в те, що Google називає робочою готовністю до професійного використання через API Gemini в Google AI Studio, доступність також відображається через Gemini Enterprise Agent Platform. Google описує Gemini Omni як те, що привнесло міркування реального світу в генеративне створення, і позиціонує випуск 1.1 як точку, де модель стає достатньо надійною для розробників, які створюють робочі процеси відео, творчі інструменти та програмне забезпечення для редагування медіа.

Longer stories through scene extension

Можливістю заголовка є розширення сцени, яке дозволяє розробникам взяти наявне згенероване відео та безперешкодно продовжувати генерувати відзнятий матеріал з того місця, на якому воно зупинилося. За словами Google, модель Omni 1.1 може аналізувати до 10 секунд попереднього контексту — стрибок у порівнянні з попередніми моделями, які посилалися лише на останню секунду. Результатом, за словами компанії, є покращена візуальна послідовність і дотримання оповіді під час створення більш довгих історій або розгалуження в нових творчих напрямках.

Відео можна продовжувати з кроком у 10 секунд до загальної загальної тривалості 40 секунд. Це менше традиційної тривалості відео, але для короткого вмісту, рекламного креативу та попередньої візуалізації Google робить ставку на те, що контроль і послідовність важливіші, ніж тривалість.

Демонстраційний матеріал, опублікований разом із оголошенням, показує, як робочий процес повинен функціонувати на практиці: кожна нова підказка продовжує попередню сцену, при цьому модель переносить візуальний контекст вперед, тоді як підказка керує змінами в русі камери, налаштуваннях і навіть настрої — одна послідовність переходить від близької розмови до повільного виходу через запорошені катакомби, а потім у величезну плаваючу бібліотеку. Побудова сцени в шари, а не генерування її в одному кадрі, ближче до того, як монтажер збирає відзнятий матеріал, ніж до того, як працювали ранні інструменти перетворення тексту у відео.

Camera control and frame interpolation

Випуск також додає те, що Google описує як інструменти для створення відео студійної якості. Серед прикладів, показаних у дописі оголошення: кінематографічний долі-зум, який переміщує камеру вперед під час зменшення масштабу, механічне миттєве збільшення в очах персонажа та орбітальне обертання на 360 градусів навколо застиглого персонажа для демонстрації 3D-глибини та паралакса.

Розробники також можуть вказати перший і останній кадри для кадру, при цьому модель інтерполює плавні переходи між ними — техніка, знайома професійним аніматорам, яка дає точний контроль над тим, де починається і закінчується кадр. Слідкуйте за останніми розробками штучного інтелекту, оскільки Google продовжує стрімкий випуск.

Iterate in 360p, deliver in 4K

Omni 1.1 Flash представляє дворівневий робочий процес якості, спрямований на контроль витрат. Розробники можуть генерувати швидкі попередні перегляди 360p, щоб швидше та дешевше обробляти ідеї під час творчого процесу, а потім розширювати остаточний проект до роздільної здатності 4K для отримання відточеного результату. Google стверджує, що масштабування забезпечує чітке зображення з високою роздільною здатністю, придатне для професійного використання.

Конвеєр попереднього перегляду до 4K вирішує одну з постійних економічних проблем генеративного відео: вартість відновлення виходу з повною роздільною здатністю щоразу, коли змінюється підказка. Відокремлюючи дослідження від доставки, Google робить модель більш практичною для комерційних конвеєрів, де десятки ітерацій передують фінальній візуалізації.

Why it matters

Оновлення відображає перехід індустрії від якості генерації сировини до керованості — здатності керувати рухом камери, підтримувати узгодженість персонажів і точно відображати кадри, як це робив би режисер чи монтажер. Для розробників, які створюють креативне програмне забезпечення, різниця між демонстраційним продуктом і продуктом, який можна розгорнути, часто зводиться до цих елементів керування, а не до простої точності.

Google's framing of the release makes the intended audience explicit. Компанія називає три цільові категорії — робочі процеси генеративного відео, творчі інструменти та програмне забезпечення для редагування медіа — і описує оновлення як те, що робить генеративне відео більш керованим, швидшим для ітерації та відшліфованим для розгортання в реальному світі. Швидше створення прототипів з’являється разом із масштабуванням 4K у підсумку випуску, підкреслюючи, що швидкість ітерації продається як окрема функція.

Завдяки Omni 1.1 Flash, доступному в AI Studio та через Gemini API, Google також просуває модель до корпоративних користувачів через Gemini Enterprise Agent Platform, сигналізуючи про те, що генеративне відео позиціонується як бізнес-інфраструктура, а не як споживча новинка.

Що подивитися

Деталі ціни на вихід 4K не були виділені в оголошенні, і розробники будуть спостерігати, як 40-секундний кумулятивний ліміт впливає на реальні плани виробництва. Конкуренція у відео зі штучним інтелектом залишається інтенсивною, і конкуренти швидко постачають власні функції керування — ця динаміка цього року неодноразово скорочувала термін придатності найсучасніших заяв.

Наразі повідомлення Google розробникам є прямим: генеративне відео, яке колись вимагало швидкої алхімії та удачі, тепер можна спрямовувати, розширювати та закінчувати у 4K за допомогою єдиного API.

---

Будьте попереду ШІ

Отримуйте останні новини штучного інтелекту, аналіз і прориви — усе в одному місці.

Читати більше новин AI →