Google a anunțat joi Gemini Omni 1.1 Flash, o actualizare gata de producție la modelul său video generativ care adaugă extensie de scenă, controale pentru camera cinematografică și ieșire 4K, potrivit unei postări pe blogul oficial Google a managerilor de produs DeepMind Anish Nangia și Alisa Fortin.
Actualizarea mută Omni de la un model experimental în ceea ce Google numește pregătirea pentru producție pentru utilizare profesională prin API-ul Gemini din Google AI Studio, disponibilitatea fiind listată și prin platforma Gemini Enterprise Agent. Google descrie Gemini Omni ca a adus raționamentul din lumea reală în creația generativă și poziționează versiunea 1.1 ca punctul în care modelul devine suficient de fiabil pentru dezvoltatorii care construiesc fluxuri de lucru video, instrumente creative și software de editare media.
Povești mai lungi prin extinderea scenei
Capacitatea de titlu este extensia scenei, care le permite dezvoltatorilor să ia un videoclip existent și să continue să genereze filmări fără întreruperi de unde a rămas. Cu Omni 1.1, Google spune că modelul poate analiza până la 10 secunde de context anterior - un salt față de modelele anterioare care făceau referire doar la ultima secundă. Rezultatul, potrivit companiei, este o consecvență vizuală îmbunătățită și aderență narativă atunci când construiesc povești mai lungi sau se ramifică în noi direcții creative.
Videoclipurile pot fi extinse în trepte de 10 secunde până la o durată totală cumulată de 40 de secunde. Aceasta rămâne mai mică decât duratele video tradiționale, dar pentru conținutul scurt, creația publicitară și munca de pre-vizualizare, Google pariază că controlul și consistența contează mai mult decât durata.
Materialul demonstrativ publicat alături de anunț arată modul în care fluxul de lucru este menit să funcționeze în practică: fiecare nou prompt continuă scena anterioară, modelul transportând contextul vizual înainte, în timp ce promptul direcționează schimbările în mișcarea camerei, decor și chiar starea de spirit - o secvență trece de la o conversație strânsă la o retragere lentă prin catacombe prăfuite și apoi într-o vastă bibliotecă plutitoare. Construirea unei scene în straturi, mai degrabă decât generarea ei într-o singură fotografie, este mai aproape de modul în care un editor asambla materialul filmat decât de modul în care au funcționat instrumentele timpurii text-to-video.
Controlul camerei și interpolarea cadrelor
Lansarea adaugă, de asemenea, ceea ce Google descrie ca instrumente de producție video de calitate studio. Printre exemplele prezentate în postarea anunțului: un dolly-zoom cinematografic care mișcă camera înainte în timp ce micșorează, un zoom mecanic snap-zoom în ochii unui personaj și o rotație orbitală de 360 de grade în jurul unui personaj înghețat pentru a prezenta profunzimea și paralaxa 3D.
Dezvoltatorii pot specifica, de asemenea, primul și ultimul cadre pentru o fotografie, modelul interpolând tranziții netede între ele - o tehnică familiară animatorilor profesioniști care oferă un control fin asupra locului în care începe și unde se termină fotografia. Urmăriți cele mai recente evoluții AI în timp ce Google își continuă cadența de lansare rapidă.
Repetați în 360p, livrați în 4K
Omni 1.1 Flash introduce un flux de lucru de calitate pe două niveluri care vizează controlul costurilor. Dezvoltatorii pot genera previzualizări rapide 360p pentru a repeta ideile mai rapid și mai ieftin în timpul procesului de creație, apoi pot mări proiectul final la rezoluție 4K pentru un rezultat șlefuit. Google spune că upscalingul produce rezultate clare, de înaltă rezoluție, potrivite pentru uz profesional.
Conducta de previzualizare la 4K abordează una dintre problemele economice persistente ale videoclipurilor generative: costul regenerării ieșirii cu rezoluție completă de fiecare dată când se schimbă un prompt. Prin decuplarea explorării de la livrare, Google face modelul mai practic pentru conductele comerciale în care zeci de iterații preced randarea finală.
De ce contează
Actualizarea reflectă o schimbare a industriei de la calitatea brută de generație la controlabilitate - capacitatea de a direcționa mișcarea camerei, de a menține consistența caracterului și de a atinge cadrele exacte, așa cum ar face un regizor sau un editor. Pentru dezvoltatorii care construiesc software creativ, diferența dintre un demo și un produs implementabil se reduce adesea la aceste controale, mai degrabă decât la fidelitatea brută.
Încadrarea Google a lansării explică publicul vizat. Compania numește trei categorii țintă — fluxuri de lucru video generative, instrumente creative și software de editare media — și descrie actualizările ca făcând video generativ mai controlabil, mai rapid de iterat și îmbunătățit pentru implementarea în lumea reală. O prototipare mai rapidă apare alături de upscaling 4K în rezumatul lansării, subliniind faptul că viteza de iterație este vândută ca o caracteristică în sine.
Cu Omni 1.1 Flash disponibil în AI Studio și prin API-ul Gemini, Google împinge, de asemenea, modelul către utilizatorii întreprinderilor prin intermediul platformei Gemini Enterprise Agent, semnalând că videoclipul generativ este poziționat ca infrastructură de afaceri, mai degrabă decât o noutate pentru consumatori.
Ce să urmărești
Detaliile de preț pentru producția 4K nu au fost evidențiate în anunț, iar dezvoltatorii vor urmări modul în care limita cumulativă de 40 de secunde afectează planurile de producție din lumea reală. Concurența în videoclipurile cu inteligență artificială rămâne intensă, rivalii care își livrează propriile funcții de controlabilitate într-un ritm rapid – o dinamică care a scurtat în mod repetat perioada de valabilitate a revendicărilor de ultimă generație în acest an.
Deocamdată, mesajul Google către dezvoltatori este direct: videoclipul generativ care odinioară necesita alchimie promptă și noroc poate fi acum direcționat, extins și finalizat în 4K printr-un singur API.
---
Rămâneți înaintea AIObțineți cele mai recente știri, analize și descoperiri despre AI - toate într-un singur loc.
Citiți mai multe știri AI →