Google a annoncé jeudi Gemini Omni 1.1 Flash, une mise à jour prête pour la production de son modèle vidéo génératif qui ajoute une extension de scène, des commandes de caméra cinématique et une sortie 4K, selon un article publié sur le blog officiel de Google par les chefs de produit DeepMind, Anish Nangia et Alisa Fortin.
La mise à jour fait passer Omni d'un modèle expérimental à ce que Google appelle la préparation à la production pour un usage professionnel via l'API Gemini dans Google AI Studio, avec une disponibilité également répertoriée via la plateforme d'agent Gemini Enterprise. Google décrit Gemini Omni comme ayant apporté le raisonnement du monde réel à la création générative et positionne la version 1.1 comme le point où le modèle devient suffisamment fiable pour les développeurs qui créent des flux de travail vidéo, des outils de création et des logiciels d'édition multimédia.
Des histoires plus longues grâce à l'extension de scène
La fonctionnalité principale est une extension de scène, qui permet aux développeurs de prendre une vidéo générée existante et de continuer à générer des séquences de manière transparente là où elles se sont arrêtées. Avec Omni 1.1, Google affirme que le modèle peut analyser jusqu'à 10 secondes de contexte antérieur – un bond par rapport aux modèles précédents qui ne faisaient référence qu'à la dernière seconde. Le résultat, selon l'entreprise, est une cohérence visuelle et une adhésion narrative améliorées lors de la construction d'histoires plus longues ou de l'orientation vers de nouvelles directions créatives.
Les vidéos peuvent être étendues par incréments de 10 secondes jusqu'à une durée totale cumulée de 40 secondes. Cela reste inférieur à la durée des vidéos traditionnelles, mais pour le contenu court, la création publicitaire et le travail de prévisualisation, Google parie que le contrôle et la cohérence comptent plus que la durée.
Le matériel de démonstration publié parallèlement à l'annonce montre comment le flux de travail est censé fonctionner dans la pratique : chaque nouvelle invite continue la scène précédente, le modèle faisant avancer le contexte visuel tandis que l'invite dirige les changements dans le mouvement de la caméra, le réglage et même l'ambiance - une séquence passe d'une conversation rapprochée à un retrait lent à travers des catacombes poussiéreuses, puis dans une vaste bibliothèque flottante. Construire une scène en couches, plutôt que de la générer en un seul plan, est plus proche de la façon dont un monteur assemble des séquences que du fonctionnement des premiers outils de conversion texte-vidéo.
Contrôle de la caméra et interpolation d'image
La version ajoute également ce que Google décrit comme des outils de production vidéo de qualité studio. Parmi les exemples présentés dans le message d'annonce : un zoom cinématique qui fait avancer la caméra lors d'un zoom arrière, un zoom mécanique dans les yeux d'un personnage et une rotation orbitale à 360 degrés autour d'un personnage figé pour mettre en valeur la profondeur et la parallaxe 3D.
Les développeurs peuvent également spécifier la première et la dernière image d’un plan, le modèle interpolant des transitions douces entre elles – une technique familière aux animateurs professionnels qui donne un contrôle précis sur le début et la fin d’un plan. Suivez les derniers développements de l'IA alors que Google poursuit sa cadence de publication rapide.
Itérer en 360p, livrer en 4K
Omni 1.1 Flash introduit un flux de travail de qualité à deux niveaux visant le contrôle des coûts. Les développeurs peuvent générer des aperçus rapides à 360p pour itérer sur les idées plus rapidement et à moindre coût pendant le processus de création, puis mettre à niveau le projet final vers une résolution 4K pour un résultat soigné. Google affirme que la mise à l'échelle produit une sortie nette et haute résolution adaptée à un usage professionnel.
Le pipeline de prévisualisation en 4K résout l'un des problèmes économiques persistants de la vidéo générative : le coût de régénération d'une sortie en pleine résolution à chaque fois qu'une invite change. En dissociant l'exploration de la livraison, Google rend le modèle plus pratique pour les pipelines commerciaux où des dizaines d'itérations précèdent un rendu final.
Pourquoi c'est important
La mise à jour reflète un changement de l'industrie de la qualité de génération brute vers la contrôlabilité – la capacité de diriger le mouvement de la caméra, de maintenir la cohérence des personnages et d'atteindre des images exactes, comme le ferait un réalisateur ou un monteur. Pour les développeurs qui créent des logiciels créatifs, la différence entre une démo et un produit déployable se résume souvent à ces contrôles plutôt qu'à la fidélité brute.
Le cadrage du communiqué par Google rend explicite le public visé. La société nomme trois catégories cibles – flux de travail vidéo génératifs, outils de création et logiciels d’édition multimédia – et décrit les mises à jour comme rendant la vidéo générative plus contrôlable, plus rapide à itérer et peaufinée pour un déploiement dans le monde réel. Un prototypage plus rapide apparaît aux côtés de la mise à l'échelle 4K dans le résumé de la version, soulignant que la vitesse d'itération est vendue comme une fonctionnalité à part entière.
Avec Omni 1.1 Flash disponible dans AI Studio et via l'API Gemini, Google propose également le modèle aux utilisateurs d'entreprise via la plateforme Gemini Enterprise Agent, signalant que la vidéo générative est positionnée comme une infrastructure commerciale plutôt que comme une nouveauté grand public.
Que regarder
Les détails des prix pour la sortie 4K n'ont pas été soulignés dans l'annonce, et les développeurs surveilleront comment la limite cumulée de 40 secondes affecte les plans de production réels. La concurrence dans le domaine de la vidéo IA reste intense, les concurrents proposant leurs propres fonctionnalités de contrôlabilité à un rythme rapide – une dynamique qui a raccourci à plusieurs reprises la durée de conservation des revendications de pointe cette année.
Pour l'instant, le message de Google aux développeurs est direct : la vidéo générative qui nécessitait autrefois une alchimie rapide et de la chance peut désormais être réalisée, étendue et terminée en 4K via une seule API.
---
Gardez une longueur d'avance sur l'IARecevez les dernières actualités, analyses et avancées en matière d'IA, le tout en un seul endroit.
Lire plus d'actualités sur l'IA →