Google anunció el jueves Gemini Omni 1.1 Flash, una actualización lista para producción de su modelo de video generativo que agrega extensión de escena, controles de cámara cinematográfica y salida 4K, según una publicación en el blog oficial de Google de los gerentes de producto de DeepMind, Anish Nangia y Alisa Fortin.
La actualización lleva a Omni de un modelo experimental a lo que Google llama preparación para producción para uso profesional a través de la API Gemini en Google AI Studio, con disponibilidad también incluida a través de Gemini Enterprise Agent Platform. Google describe a Gemini Omni como quien trajo el razonamiento del mundo real a la creación generativa y posiciona la versión 1.1 como el punto donde el modelo se vuelve lo suficientemente confiable para los desarrolladores que crean flujos de trabajo de video, herramientas creativas y software de edición de medios.
Historias más largas mediante extensión de escena.
La capacidad principal es la extensión de escena, que permite a los desarrolladores tomar un video generado existente y continuar generando imágenes sin problemas desde donde lo dejaron. Con Omni 1.1, Google dice que el modelo puede analizar hasta 10 segundos de contexto anterior, un salto con respecto a los modelos anteriores que hacían referencia solo al último segundo. El resultado, según la empresa, es una mayor coherencia visual y adherencia narrativa al construir historias más largas o diversificarse hacia nuevas direcciones creativas.
Los videos se pueden ampliar en incrementos de 10 segundos hasta una duración total acumulada de 40 segundos. Esto sigue siendo inferior a la duración de los vídeos tradicionales, pero para el contenido de formato corto, la creatividad publicitaria y el trabajo de visualización previa, Google apuesta a que el control y la coherencia importan más que la duración.
El material de demostración publicado junto con el anuncio muestra cómo debe funcionar el flujo de trabajo en la práctica: cada nuevo mensaje continúa la escena anterior, con el modelo llevando el contexto visual hacia adelante mientras el mensaje dirige los cambios en el movimiento de la cámara, la configuración e incluso el estado de ánimo: una secuencia pasa de una conversación cercana a una lenta salida a través de catacumbas polvorientas y luego a una vasta biblioteca flotante. Construir una escena en capas, en lugar de generarla en una sola toma, se parece más a cómo un editor ensambla metraje que a cómo funcionaban las primeras herramientas de conversión de texto a video.
Control de cámara e interpolación de cuadros.
El comunicado también agrega lo que Google describe como herramientas de producción de video con calidad de estudio. Entre los ejemplos que se muestran en la publicación del anuncio: un zoom cinematográfico que mueve la cámara hacia adelante mientras se aleja, un zoom instantáneo mecánico en los ojos de un personaje y una rotación orbital de 360 grados alrededor de un personaje congelado para mostrar profundidad y paralaje en 3D.
Los desarrolladores también pueden especificar el primer y último fotograma de una toma, y el modelo interpola transiciones suaves entre ellos, una técnica familiar para los animadores profesionales que brinda un control detallado sobre dónde comienza y termina una toma. Siga los últimos desarrollos de IA mientras Google continúa su rápida cadencia de lanzamiento.
Iterar en 360p, entregar en 4K
Omni 1.1 Flash presenta un flujo de trabajo de calidad de dos niveles destinado al control de costos. Los desarrolladores pueden generar vistas previas rápidas de 360p para iterar ideas de forma más rápida y económica durante el proceso creativo, y luego mejorar el proyecto final a una resolución de 4K para obtener un resultado pulido. Google dice que la mejora produce resultados nítidos y de alta resolución adecuados para uso profesional.
El proceso de vista previa a 4K aborda uno de los persistentes problemas económicos del video generativo: el costo de regenerar la salida de resolución completa cada vez que cambia un aviso. Al desacoplar la exploración de la entrega, Google está haciendo que el modelo sea más práctico para canales comerciales donde docenas de iteraciones preceden a una representación final.
Por qué es importante
La actualización refleja un cambio en la industria desde la calidad de generación bruta hacia la controlabilidad: la capacidad de dirigir el movimiento de la cámara, mantener la consistencia de los personajes y lograr fotogramas exactos, como lo haría un director o editor. Para los desarrolladores que crean software creativo, la diferencia entre una demostración y un producto implementable a menudo se reduce a estos controles más que a la fidelidad pura.
El encuadre de Google del comunicado hace explícito el público objetivo. La compañía nombra tres categorías objetivo (flujos de trabajo de video generativo, herramientas creativas y software de edición de medios) y describe las actualizaciones como hacer que el video generativo sea más controlable, más rápido de iterar y pulido para su implementación en el mundo real. La creación de prototipos más rápidos aparece junto con la mejora de 4K en el resumen del lanzamiento, lo que subraya que la velocidad de iteración se vende como una característica por derecho propio.
Con Omni 1.1 Flash disponible en AI Studio y a través de la API Gemini, Google también está impulsando el modelo hacia los usuarios empresariales a través de la plataforma Gemini Enterprise Agent, lo que indica que el vídeo generativo se está posicionando como una infraestructura empresarial en lugar de una novedad para el consumidor.
Qué mirar
Los detalles de precios para la producción 4K no se destacaron en el anuncio, y los desarrolladores estarán atentos a cómo el límite acumulativo de 40 segundos afecta los planes de producción del mundo real. La competencia en videos de IA sigue siendo intensa, y los rivales lanzan sus propias funciones de control a un ritmo rápido, una dinámica que ha acortado repetidamente la vida útil de las afirmaciones de última generación este año.
Por ahora, el mensaje de Google a los desarrolladores es directo: el vídeo generativo que antes requería alquimia y suerte ahora puede dirigirse, ampliarse y terminarse en 4K a través de una única API.
---
Manténgase a la vanguardia de la IAObtenga las últimas noticias, análisis y avances en IA, todo en un solo lugar.
Leer más noticias sobre IA →