بر اساس پستی که در وبلاگ رسمی گوگل توسط آنیش نانگیا و آلیسا فورتین در وبلاگ رسمی گوگل منتشر شد، گوگل روز پنجشنبه Gemini Omni 1.1 Flash را معرفی کرد، بهروزرسانی آماده تولید برای مدل ویدیویی تولیدی خود که افزونه صحنه، کنترلهای دوربین سینمایی و خروجی 4K را اضافه میکند.
این بهروزرسانی Omni را از یک مدل آزمایشی به چیزی که Google آن را آمادگی تولید برای استفاده حرفهای از طریق Gemini API در استودیوی هوش مصنوعی گوگل مینامد، منتقل میکند، که در دسترس بودن از طریق پلتفرم نماینده سازمانی Gemini نیز فهرست شده است. گوگل Gemini Omni را بهعنوان استدلال دنیای واقعی برای ایجاد مولد توصیف میکند و نسخه 1.1 را به عنوان نقطهای قرار میدهد که در آن مدل به اندازه کافی برای توسعهدهندگانی که جریانهای کاری ویدیویی، ابزارهای خلاقانه و نرمافزار ویرایش رسانه را ایجاد میکنند قابل اعتماد میشود.
داستان های طولانی تر از طریق گسترش صحنه
قابلیت سرفصل، گسترش صحنه است، که به توسعه دهندگان اجازه می دهد یک ویدیوی تولید شده موجود را بگیرند و به تولید یکپارچه فیلم از جایی که متوقف شده است ادامه دهند. با Omni 1.1، گوگل میگوید این مدل میتواند تا 10 ثانیه از زمینه قبلی را تجزیه و تحلیل کند - یک جهش نسبت به مدلهای قبلی که فقط به ثانیه آخر اشاره میکردند. به گفته این شرکت، نتیجه، سازگاری بصری و پایبندی به روایت در هنگام ساختن داستانهای طولانیتر یا انشعاب به مسیرهای خلاقانه جدید بهبود یافته است.
ویدئوها را میتوان در 10 ثانیه تا مجموع 40 ثانیه افزایش داد. این مدت زمان کمتر از ویدیوهای سنتی است، اما برای محتوای کوتاه، تبلیغات خلاقانه و کارهای پیش از تجسم، گوگل شرط میبندد که کنترل و ثبات بیشتر از مدت زمان اهمیت دارد.
مطالب نمایشی منتشر شده در کنار اعلامیه نشان میدهد که جریان کار در عمل چگونه عمل میکند: هر دستور جدید صحنه قبلی را ادامه میدهد، با مدلی که زمینه بصری را به جلو میبرد در حالی که فرمان تغییرات در حرکت دوربین، تنظیمات و حتی حالت را هدایت میکند - یک سکانس از یک مکالمه نزدیک به بیرون کشیدن آهسته از دخمههای غبارآلود و سپس به یک کتابخانه بزرگ شناور حرکت میکند. ساختن یک صحنه در لایه ها، به جای تولید آن در یک شات، به نحوه مونتاژ فیلم توسط ویرایشگر نزدیک تر است تا نحوه کار ابزارهای اولیه متن به ویدیو.
کنترل دوربین و درون یابی فریم
این نسخه همچنین چیزی را اضافه می کند که گوگل به عنوان ابزار تولید ویدئو با کیفیت استودیو توصیف می کند. از جمله نمونههایی که در پست اعلامیه نشان داده شده است: یک دالی-زوم سینمایی که دوربین را در حین بزرگنمایی به جلو حرکت میدهد، یک زوم مکانیکی به چشمان یک شخصیت و یک چرخش مداری 360 درجه به دور یک شخصیت ثابت برای نمایش عمق سه بعدی و اختلاف منظر.
توسعهدهندگان همچنین میتوانند اولین و آخرین فریمها را برای یک عکس مشخص کنند، با مدلی که انتقالهای صاف بین آنها را درونیابی میکند - تکنیکی آشنا برای انیماتورهای حرفهای که کنترل دقیقی بر محل شروع و پایان یک عکس میدهد. [آخرین پیشرفتهای هوش مصنوعی] (https://aibuzzwire.news) را دنبال کنید زیرا Google به سرعت انتشار سریع خود ادامه میدهد.
تکرار در 360p، ارائه در 4K
Omni 1.1 Flash یک گردش کار با کیفیت دو لایه را با هدف کنترل هزینه معرفی می کند. توسعهدهندگان میتوانند پیشنمایشهای سریع 360p را برای تکرار سریعتر و ارزانتر ایدهها در طول فرآیند خلاق ایجاد کنند، سپس پروژه نهایی را به وضوح 4K ارتقا دهند تا نتیجهای صیقلی به دست آید. گوگل می گوید که ارتقاء مقیاس خروجی واضح و با وضوح بالا مناسب برای استفاده حرفه ای ایجاد می کند.
خط لوله پیشنمایش به 4K به یکی از مشکلات اقتصادی پایدار ویدیوی مولد میپردازد: هزینه بازسازی خروجی با وضوح کامل هر بار که درخواست تغییر میکند. با جدا کردن اکتشاف از تحویل، گوگل این مدل را برای خطوط لوله تجاری که در آن ده ها تکرار قبل از رندر نهایی انجام می شود، کاربردی تر می کند.
چرا مهم است
این بهروزرسانی نشاندهنده تغییر صنعت از کیفیت تولید خام به سمت کنترلپذیری است - توانایی هدایت حرکت دوربین، حفظ ثبات کاراکترها و ضربه زدن به فریمهای دقیق، به روشی که یک کارگردان یا ویرایشگر انجام میدهد. برای توسعهدهندگانی که نرمافزار خلاق میسازند، تفاوت بین یک نسخه آزمایشی و یک محصول قابل استقرار اغلب به این کنترلها مربوط میشود تا وفاداری خام.
چارچوببندی Google از انتشار، مخاطبان مورد نظر را واضح میسازد. این شرکت سه دسته هدف را نام میبرد - جریانهای کاری ویدیویی تولیدی، ابزارهای خلاقانه و نرمافزار ویرایش رسانه - و بهروزرسانیها را بهعنوان قابل کنترلتر کردن ویدیوهای تولیدی، تکرار سریعتر و صیقلدادن برای استقرار در دنیای واقعی توصیف میکند. نمونه سازی سریعتر در کنار ارتقاء مقیاس 4K در خلاصه انتشار ظاهر می شود و تاکید می کند که سرعت تکرار به تنهایی به عنوان یک ویژگی فروخته می شود.
با Omni 1.1 Flash که در استودیوی هوش مصنوعی و از طریق Gemini API در دسترس است، گوگل همچنین از طریق پلتفرم Gemini Enterprise Agent این مدل را به سمت کاربران سازمانی سوق میدهد و نشان میدهد که ویدیوی مولد بهعنوان زیرساخت کسبوکار به جای یک محصول جدید مصرفکننده قرار میگیرد.
چه چیزی را تماشا کنیم
جزئیات قیمت برای خروجی 4K در این اطلاعیه مشخص نشده است و توسعه دهندگان خواهند دید که محدودیت تجمعی 40 ثانیه چگونه بر برنامه های تولید در دنیای واقعی تأثیر می گذارد. رقابت در ویدیوهای هوش مصنوعی همچنان شدید است و رقبا ویژگیهای کنترلپذیری خود را با سرعتی سریع ارسال میکنند - پویایی که بهطور مکرر عمر مفید ادعاهای پیشرفته را در سال جاری کوتاه کرده است.
در حال حاضر، پیام گوگل به توسعهدهندگان مستقیم است: ویدیوی تولیدی که زمانی نیاز به کیمیاگری سریع و شانس داشت، اکنون میتوان آن را با کیفیت 4K از طریق یک API منفرد هدایت، گسترش داد و به پایان رساند.
---
از هوش مصنوعی جلوتر بمانیدآخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.
بیشتر بخوانید اخبار هوش مصنوعی →