بر اساس پستی که در وبلاگ رسمی گوگل توسط آنیش نانگیا و آلیسا فورتین در وبلاگ رسمی گوگل منتشر شد، گوگل روز پنجشنبه Gemini Omni 1.1 Flash را معرفی کرد، به‌روزرسانی آماده تولید برای مدل ویدیویی تولیدی خود که افزونه صحنه، کنترل‌های دوربین سینمایی و خروجی 4K را اضافه می‌کند.

این به‌روزرسانی Omni را از یک مدل آزمایشی به چیزی که Google آن را آمادگی تولید برای استفاده حرفه‌ای از طریق Gemini API در استودیوی هوش مصنوعی گوگل می‌نامد، منتقل می‌کند، که در دسترس بودن از طریق پلتفرم نماینده سازمانی Gemini نیز فهرست شده است. گوگل Gemini Omni را به‌عنوان استدلال دنیای واقعی برای ایجاد مولد توصیف می‌کند و نسخه 1.1 را به عنوان نقطه‌ای قرار می‌دهد که در آن مدل به اندازه کافی برای توسعه‌دهندگانی که جریان‌های کاری ویدیویی، ابزارهای خلاقانه و نرم‌افزار ویرایش رسانه را ایجاد می‌کنند قابل اعتماد می‌شود.

داستان های طولانی تر از طریق گسترش صحنه

قابلیت سرفصل، گسترش صحنه است، که به توسعه دهندگان اجازه می دهد یک ویدیوی تولید شده موجود را بگیرند و به تولید یکپارچه فیلم از جایی که متوقف شده است ادامه دهند. با Omni 1.1، گوگل می‌گوید این مدل می‌تواند تا 10 ثانیه از زمینه قبلی را تجزیه و تحلیل کند - یک جهش نسبت به مدل‌های قبلی که فقط به ثانیه آخر اشاره می‌کردند. به گفته این شرکت، نتیجه، سازگاری بصری و پایبندی به روایت در هنگام ساختن داستان‌های طولانی‌تر یا انشعاب به مسیرهای خلاقانه جدید بهبود یافته است.

ویدئوها را می‌توان در 10 ثانیه تا مجموع 40 ثانیه افزایش داد. این مدت زمان کمتر از ویدیوهای سنتی است، اما برای محتوای کوتاه، تبلیغات خلاقانه و کارهای پیش از تجسم، گوگل شرط می‌بندد که کنترل و ثبات بیشتر از مدت زمان اهمیت دارد.

مطالب نمایشی منتشر شده در کنار اعلامیه نشان می‌دهد که جریان کار در عمل چگونه عمل می‌کند: هر دستور جدید صحنه قبلی را ادامه می‌دهد، با مدلی که زمینه بصری را به جلو می‌برد در حالی که فرمان تغییرات در حرکت دوربین، تنظیمات و حتی حالت را هدایت می‌کند - یک سکانس از یک مکالمه نزدیک به بیرون کشیدن آهسته از دخمه‌های غبارآلود و سپس به یک کتابخانه بزرگ شناور حرکت می‌کند. ساختن یک صحنه در لایه ها، به جای تولید آن در یک شات، به نحوه مونتاژ فیلم توسط ویرایشگر نزدیک تر است تا نحوه کار ابزارهای اولیه متن به ویدیو.

کنترل دوربین و درون یابی فریم

این نسخه همچنین چیزی را اضافه می کند که گوگل به عنوان ابزار تولید ویدئو با کیفیت استودیو توصیف می کند. از جمله نمونه‌هایی که در پست اعلامیه نشان داده شده است: یک دالی-زوم سینمایی که دوربین را در حین بزرگنمایی به جلو حرکت می‌دهد، یک زوم مکانیکی به چشمان یک شخصیت و یک چرخش مداری 360 درجه به دور یک شخصیت ثابت برای نمایش عمق سه بعدی و اختلاف منظر.

توسعه‌دهندگان همچنین می‌توانند اولین و آخرین فریم‌ها را برای یک عکس مشخص کنند، با مدلی که انتقال‌های صاف بین آن‌ها را درون‌یابی می‌کند - تکنیکی آشنا برای انیماتورهای حرفه‌ای که کنترل دقیقی بر محل شروع و پایان یک عکس می‌دهد. [آخرین پیشرفت‌های هوش مصنوعی] (https://aibuzzwire.news) را دنبال کنید زیرا Google به سرعت انتشار سریع خود ادامه می‌دهد.

تکرار در 360p، ارائه در 4K

Omni 1.1 Flash یک گردش کار با کیفیت دو لایه را با هدف کنترل هزینه معرفی می کند. توسعه‌دهندگان می‌توانند پیش‌نمایش‌های سریع 360p را برای تکرار سریع‌تر و ارزان‌تر ایده‌ها در طول فرآیند خلاق ایجاد کنند، سپس پروژه نهایی را به وضوح 4K ارتقا دهند تا نتیجه‌ای صیقلی به دست آید. گوگل می گوید که ارتقاء مقیاس خروجی واضح و با وضوح بالا مناسب برای استفاده حرفه ای ایجاد می کند.

خط لوله پیش‌نمایش به 4K به یکی از مشکلات اقتصادی پایدار ویدیوی مولد می‌پردازد: هزینه بازسازی خروجی با وضوح کامل هر بار که درخواست تغییر می‌کند. با جدا کردن اکتشاف از تحویل، گوگل این مدل را برای خطوط لوله تجاری که در آن ده ها تکرار قبل از رندر نهایی انجام می شود، کاربردی تر می کند.

چرا مهم است

این به‌روزرسانی نشان‌دهنده تغییر صنعت از کیفیت تولید خام به سمت کنترل‌پذیری است - توانایی هدایت حرکت دوربین، حفظ ثبات کاراکترها و ضربه زدن به فریم‌های دقیق، به روشی که یک کارگردان یا ویرایشگر انجام می‌دهد. برای توسعه‌دهندگانی که نرم‌افزار خلاق می‌سازند، تفاوت بین یک نسخه آزمایشی و یک محصول قابل استقرار اغلب به این کنترل‌ها مربوط می‌شود تا وفاداری خام.

چارچوب‌بندی Google از انتشار، مخاطبان مورد نظر را واضح می‌سازد. این شرکت سه دسته هدف را نام می‌برد - جریان‌های کاری ویدیویی تولیدی، ابزارهای خلاقانه و نرم‌افزار ویرایش رسانه - و به‌روزرسانی‌ها را به‌عنوان قابل کنترل‌تر کردن ویدیوهای تولیدی، تکرار سریع‌تر و صیقل‌دادن برای استقرار در دنیای واقعی توصیف می‌کند. نمونه سازی سریعتر در کنار ارتقاء مقیاس 4K در خلاصه انتشار ظاهر می شود و تاکید می کند که سرعت تکرار به تنهایی به عنوان یک ویژگی فروخته می شود.

با Omni 1.1 Flash که در استودیوی هوش مصنوعی و از طریق Gemini API در دسترس است، گوگل همچنین از طریق پلتفرم Gemini Enterprise Agent این مدل را به سمت کاربران سازمانی سوق می‌دهد و نشان می‌دهد که ویدیوی مولد به‌عنوان زیرساخت کسب‌وکار به جای یک محصول جدید مصرف‌کننده قرار می‌گیرد.

چه چیزی را تماشا کنیم

جزئیات قیمت برای خروجی 4K در این اطلاعیه مشخص نشده است و توسعه دهندگان خواهند دید که محدودیت تجمعی 40 ثانیه چگونه بر برنامه های تولید در دنیای واقعی تأثیر می گذارد. رقابت در ویدیوهای هوش مصنوعی همچنان شدید است و رقبا ویژگی‌های کنترل‌پذیری خود را با سرعتی سریع ارسال می‌کنند - پویایی که به‌طور مکرر عمر مفید ادعاهای پیشرفته را در سال جاری کوتاه کرده است.

در حال حاضر، پیام گوگل به توسعه‌دهندگان مستقیم است: ویدیوی تولیدی که زمانی نیاز به کیمیاگری سریع و شانس داشت، اکنون می‌توان آن را با کیفیت 4K از طریق یک API منفرد هدایت، گسترش داد و به پایان رساند.

---

از هوش مصنوعی جلوتر بمانید

آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.

بیشتر بخوانید اخبار هوش مصنوعی →