Google pada hari Khamis mengumumkan Gemini Omni 1.1 Flash, kemas kini sedia pengeluaran untuk model video generatifnya yang menambah sambungan pemandangan, kawalan kamera sinematik dan output 4K, menurut catatan di blog Google rasmi oleh pengurus produk DeepMind Anish Nangia dan Alisa Fortin.

Kemas kini memindahkan Omni daripada model eksperimen kepada apa yang dipanggil Google sebagai kesediaan pengeluaran untuk kegunaan profesional melalui API Gemini dalam Google AI Studio, dengan ketersediaan turut disenaraikan melalui Platform Ejen Perusahaan Gemini. Google menerangkan Gemini Omni sebagai telah membawa penaakulan dunia sebenar kepada penciptaan generatif, dan meletakkan keluaran 1.1 sebagai titik di mana model menjadi cukup dipercayai untuk pembangun membina aliran kerja video, alat kreatif dan perisian penyuntingan media.

Cerita yang lebih panjang melalui sambungan adegan

Keupayaan tajuk ialah sambungan adegan, yang membolehkan pembangun mengambil video yang dijana sedia ada dan terus menjana rakaman dengan lancar dari tempat ia berhenti. Dengan Omni 1.1, Google mengatakan model itu boleh menganalisis sehingga 10 saat konteks sebelumnya — lonjakan daripada model sebelumnya yang hanya merujuk saat akhir. Hasilnya, menurut syarikat itu, dipertingkatkan ketekalan visual dan pematuhan naratif apabila membina cerita yang lebih panjang atau bercabang ke arah kreatif baharu.

Video boleh dilanjutkan dalam kenaikan 10 saat sehingga jumlah panjang kumulatif 40 saat. Itu masih pendek daripada panjang video tradisional, tetapi untuk kandungan bentuk pendek, kerja kreatif pengiklanan dan pra-visualisasi, Google bertaruh bahawa kawalan dan konsistensi lebih penting daripada tempoh.

Bahan demonstrasi yang diterbitkan bersama pengumuman menunjukkan cara aliran kerja dimaksudkan untuk berfungsi dalam amalan: setiap gesaan baharu meneruskan adegan sebelumnya, dengan model membawa konteks visual ke hadapan manakala gesaan mengarahkan perubahan dalam pergerakan kamera, tetapan dan juga mood — satu urutan bergerak daripada perbualan rapat kepada penarikan keluar perlahan melalui katakombe berdebu dan kemudian ke perpustakaan terapung yang luas. Membina pemandangan dalam lapisan, dan bukannya menjananya dalam satu tangkapan, lebih dekat dengan cara editor memasang rakaman berbanding cara alat teks ke video awal berfungsi.

Kawalan kamera dan interpolasi bingkai

Keluaran ini juga menambah perkara yang diterangkan oleh Google sebagai alat pengeluaran video berkualiti studio. Antara contoh yang ditunjukkan pada siaran pengumuman: zum dolly sinematik yang menggerakkan kamera ke hadapan semasa mengezum keluar, zum snap mekanikal ke dalam mata watak dan putaran orbit 360 darjah mengelilingi watak beku untuk mempamerkan kedalaman dan paralaks 3D.

Pembangun juga boleh menentukan bingkai pertama dan terakhir untuk tangkapan, dengan model menginterpolasi peralihan lancar di antara mereka — teknik yang biasa kepada animator profesional yang memberikan kawalan terperinci ke atas tempat syot bermula dan berakhir. Ikuti perkembangan AI terkini sambil Google meneruskan irama keluaran pantasnya.

Lelaran dalam 360p, hantar dalam 4K

Omni 1.1 Flash memperkenalkan aliran kerja kualiti dua peringkat yang bertujuan untuk mengawal kos. Pembangun boleh menjana pratonton 360p pantas untuk mengulang idea dengan lebih pantas dan lebih murah semasa proses kreatif, kemudian meningkatkan projek akhir kepada resolusi 4K untuk hasil yang digilap. Google mengatakan peningkatan itu menghasilkan keluaran resolusi tinggi yang tajam sesuai untuk kegunaan profesional.

Saluran paip pratonton-ke-4K menangani salah satu masalah ekonomi berterusan video generatif: kos penjanaan semula output resolusi penuh setiap kali perubahan segera. Dengan mengasingkan penerokaan daripada penghantaran, Google menjadikan model itu lebih praktikal untuk saluran paip komersial di mana berpuluh-puluh lelaran mendahului pemaparan akhir.

Mengapa ia penting

Kemas kini mencerminkan peralihan industri daripada kualiti penjanaan mentah ke arah kebolehkawalan — keupayaan untuk mengarahkan pergerakan kamera, mengekalkan konsistensi watak dan memukul bingkai yang tepat, seperti yang dilakukan oleh pengarah atau editor. Bagi pembangun yang membina perisian kreatif, perbezaan antara tunjuk cara dan produk boleh pakai selalunya terletak pada kawalan ini dan bukannya kesetiaan mentah.

Pembingkaian keluaran Google menjadikan khalayak yang dimaksudkan jelas. Syarikat itu menamakan tiga kategori sasaran — aliran kerja video generatif, alat kreatif dan perisian penyuntingan media — dan menerangkan kemas kini sebagai menjadikan video generatif lebih terkawal, lebih pantas untuk diulang dan digilap untuk penggunaan dunia sebenar. Prototaip yang lebih pantas muncul bersama peningkatan 4K dalam ringkasan keluaran, menekankan bahawa kelajuan lelaran dijual sebagai ciri tersendiri.

Dengan Omni 1.1 Flash tersedia dalam AI Studio dan melalui API Gemini, Google juga mendorong model tersebut ke arah pengguna perusahaan melalui Platform Ejen Perusahaan Gemini, menandakan bahawa video generatif diletakkan sebagai infrastruktur perniagaan dan bukannya kebaharuan pengguna.

Apa yang perlu ditonton

Butiran harga untuk keluaran 4K tidak diserlahkan dalam pengumuman itu dan pembangun akan melihat bagaimana had kumulatif 40 saat mempengaruhi rancangan pengeluaran dunia sebenar. Persaingan dalam video AI kekal sengit, dengan pesaing menghantar ciri kebolehkawalan mereka sendiri pada kadar yang pantas — dinamik yang telah berulang kali memendekkan jangka hayat tuntutan terkini tahun ini.

Buat masa ini, mesej Google kepada pembangun adalah langsung: video generatif yang pernah memerlukan alkimia dan nasib segera kini boleh diarahkan, dilanjutkan dan diselesaikan dalam 4K melalui satu API.

---

Kekal Mendahului AI

Dapatkan berita, analisis dan penemuan terkini AI — semuanya di satu tempat.

Baca lebih banyak berita AI →