В четверг Google анонсировала Gemini Omni 1.1 Flash, готовое к производству обновление своей генеративной видеомодели, которое добавляет расширение сцены, кинематографические элементы управления камерой и вывод 4K, согласно сообщению в официальном блоге Google менеджеров по продуктам DeepMind Аниша Нангиа и Алисы Фортин.

Обновление переводит Omni из экспериментальной модели в то, что Google называет производственной готовностью для профессионального использования через Gemini API в Google AI Studio, причем доступность также указана на платформе Gemini Enterprise Agent. Google описывает Gemini Omni как привнесший реальные рассуждения в генеративное творчество, и позиционирует выпуск 1.1 как момент, когда модель станет достаточно надежной для разработчиков, создающих рабочие процессы видео, творческие инструменты и программное обеспечение для редактирования мультимедиа.

Более длинные истории за счет расширения сцен

Функция заголовка — это расширение сцены, которое позволяет разработчикам взять существующее сгенерированное видео и продолжить создание отснятого материала с того места, где оно было остановлено. Google утверждает, что с помощью Omni 1.1 модель может анализировать до 10 секунд предшествующего контекста — скачок по сравнению с предыдущими моделями, которые ссылались только на последнюю секунду. Результатом, по мнению компании, является улучшение визуальной последовательности и приверженности повествованию при создании более длинных историй или переходе к новым творческим направлениям.

Видео можно продлевать с шагом 10 секунд до общей совокупной продолжительности 40 секунд. Это все еще меньше, чем у традиционных видео, но для короткого контента, рекламных креативов и предварительной визуализации Google делает ставку на то, что контроль и последовательность имеют большее значение, чем продолжительность.

Демонстрационный материал, опубликованный вместе с анонсом, показывает, как рабочий процесс должен работать на практике: каждая новая подсказка продолжает предыдущую сцену, при этом модель переносит визуальный контекст вперед, а подсказка управляет изменениями в движении камеры, обстановке и даже настроении — одна сцена переходит от тесного разговора к медленному выходу через пыльные катакомбы, а затем в огромную летающую библиотеку. Построение сцены по слоям, а не создание ее за один кадр, ближе к тому, как монтажер собирает отснятый материал, чем к тому, как работали ранние инструменты преобразования текста в видео.

Управление камерой и интерполяция кадров

В релизе также добавлено то, что Google называет инструментами для производства видео студийного качества. Среди примеров, показанных в объявлении: кинематографический зум, который перемещает камеру вперед при уменьшении масштаба, механическое масштабирование глаз персонажа и вращение по орбите на 360 градусов вокруг замороженного персонажа для демонстрации трехмерной глубины и параллакса.

Разработчики также могут указать первый и последний кадры кадра, при этом модель интерполирует плавные переходы между ними — метод, знакомый профессиональным аниматорам, который обеспечивает детальный контроль над тем, где начинается и заканчивается кадр. Следите за последними разработками в области искусственного интеллекта, поскольку Google продолжает быстро выпускать новые версии.

Итерация в 360p, реализация в 4K

В Omni 1.1 Flash реализован двухуровневый рабочий процесс обеспечения качества, направленный на контроль затрат. Разработчики могут создавать быстрые предварительные просмотры в разрешении 360p, чтобы быстрее и дешевле воплощать идеи в ходе творческого процесса, а затем масштабировать окончательный проект до разрешения 4K для получения безупречного результата. Google утверждает, что масштабирование обеспечивает четкое изображение с высоким разрешением, подходящее для профессионального использования.

Конвейер преобразования предварительного просмотра в 4K решает одну из постоянных экономических проблем генеративного видео: стоимость восстановления вывода в полном разрешении каждый раз при изменении запроса. Отделяя исследование от доставки, Google делает модель более практичной для коммерческих конвейеров, где финальному рендерингу предшествуют десятки итераций.

Почему это важно

Обновление отражает переход отрасли от качества исходного изображения к управляемости — возможности управлять движением камеры, сохранять согласованность персонажей и попадать в точные кадры, как это сделал бы режиссер или монтажер. Для разработчиков, создающих креативное программное обеспечение, разница между демо-версией и готовым к развертыванию продуктом часто сводится к этим элементам управления, а не к чистой точности.

Оформление релиза Google четко определяет целевую аудиторию. Компания называет три целевые категории — рабочие процессы генеративного видео, творческие инструменты и программное обеспечение для редактирования мультимедиа — и описывает обновления, которые делают генеративное видео более управляемым, ускоряют итерацию и оттачивают его для реального внедрения. В сводке выпуска упоминается более быстрое прототипирование наряду с масштабированием до 4K, подчеркивая, что скорость итерации продается как отдельная функция.

Благодаря Omni 1.1 Flash, доступному в AI Studio и через Gemini API, Google также продвигает эту модель корпоративным пользователям через платформу Gemini Enterprise Agent, сигнализируя о том, что генеративное видео позиционируется как бизнес-инфраструктура, а не потребительская новинка.

Что посмотреть

Детали ценообразования для вывода 4K в объявлении не были освещены, и разработчики будут следить за тем, как совокупный лимит в 40 секунд повлияет на реальные производственные планы. Конкуренция в области видео с использованием искусственного интеллекта остается интенсивной: конкуренты быстрыми темпами поставляют свои собственные функции управления — динамика, которая неоднократно сокращала срок годности самых современных заявлений в этом году.

На данный момент послание Google разработчикам прямое: генеративное видео, которое когда-то требовало быстрой алхимии и удачи, теперь можно направлять, расширять и завершать в 4K с помощью единого API.

---

Будьте впереди ИИ

Получайте последние новости, анализ и открытия в области искусственного интеллекта — все в одном месте.

Подробнее новости AI →