أعلنت Google يوم الخميس عن Gemini Omni 1.1 Flash، وهو تحديث جاهز للإنتاج لنموذج الفيديو التوليدي الذي يضيف امتداد المشهد وعناصر التحكم في الكاميرا السينمائية وإخراج 4K، وفقًا لما نشر على مدونة Google الرسمية بواسطة مديري منتجات DeepMind Anish Nangia وAlisa Fortin.

ينقل التحديث Omni من نموذج تجريبي إلى ما تسميه Google جاهزية الإنتاج للاستخدام الاحترافي عبر Gemini API في Google AI Studio، مع إدراج التوفر أيضًا من خلال Gemini Enterprise Agent Platform. تصف Google برنامج Gemini Omni بأنه جلب التفكير الواقعي إلى الإبداع التوليدي، وتضع الإصدار 1.1 باعتباره النقطة التي يصبح فيها النموذج موثوقًا بدرجة كافية للمطورين الذين يقومون ببناء سير عمل الفيديو والأدوات الإبداعية وبرامج تحرير الوسائط.

قصص أطول من خلال امتداد المشهد

القدرة على العنوان الرئيسي هي امتداد المشهد، مما يتيح للمطورين التقاط مقطع فيديو موجود ومواصلة إنشاء اللقطات بسلاسة من حيث توقفت. مع Omni 1.1، تقول Google إن النموذج يمكنه تحليل ما يصل إلى 10 ثوانٍ من السياق السابق، وهي قفزة من النماذج السابقة التي تشير إلى الثانية الأخيرة فقط. والنتيجة، وفقًا للشركة، هي تحسين الاتساق البصري والالتزام السردي عند إنشاء قصص أطول أو التفرع إلى اتجاهات إبداعية جديدة.

يمكن تمديد مقاطع الفيديو بزيادات مدتها 10 ثوانٍ حتى يصل إجمالي الطول التراكمي إلى 40 ثانية. لا يزال هذا أقل من أطوال مقاطع الفيديو التقليدية، ولكن بالنسبة للمحتوى القصير والإعلانات الإبداعية وأعمال التصور المسبق، تراهن Google على أن التحكم والاتساق مهمان أكثر من المدة.

تُظهر المادة التوضيحية المنشورة جنبًا إلى جنب مع الإعلان كيف من المفترض أن يعمل سير العمل عمليًا: كل موجه جديد يكمل المشهد السابق، حيث يحمل النموذج السياق البصري للأمام بينما يوجه الموجه التغييرات في حركة الكاميرا والإعدادات وحتى الحالة المزاجية - ينتقل تسلسل واحد من محادثة قريبة إلى انسحاب بطيء عبر سراديب الموتى المتربة ثم إلى مكتبة عائمة واسعة. يعد إنشاء مشهد في طبقات، بدلاً من إنشائه في لقطة واحدة، أقرب إلى كيفية قيام المحرر بتجميع اللقطات من كيفية عمل أدوات تحويل النص إلى فيديو المبكرة.

التحكم في الكاميرا واستيفاء الإطار

يضيف الإصدار أيضًا ما تصفه Google بأدوات إنتاج الفيديو بجودة الاستوديو. من بين الأمثلة المعروضة في منشور الإعلان: التكبير السينمائي الذي يحرك الكاميرا للأمام أثناء التصغير، والتكبير الميكانيكي السريع في عيون الشخصية، والدوران المداري بزاوية 360 درجة حول الشخصية المجمدة لعرض العمق ثلاثي الأبعاد والمنظر.

يمكن للمطورين أيضًا تحديد الإطارات الأولى والأخيرة للقطة ما، حيث يقوم النموذج بإدخال انتقالات سلسة بينهما - وهي تقنية مألوفة لدى رسامي الرسوم المتحركة المحترفين والتي توفر تحكمًا دقيقًا في مكان بداية اللقطة وانتهائها. تابع آخر تطورات الذكاء الاصطناعي بينما تواصل Google إيقاع الإصدار السريع.

التكرار بدقة 360 بكسل، والتسليم بدقة 4K

يقدم Omni 1.1 Flash سير عمل عالي الجودة من مستويين يهدف إلى التحكم في التكاليف. يمكن للمطورين إنشاء معاينات سريعة بدقة 360 بكسل لتكرار الأفكار بشكل أسرع وبتكلفة أقل أثناء العملية الإبداعية، ثم ترقية المشروع النهائي إلى دقة 4K للحصول على نتيجة مصقولة. تقول Google إن الترقية تنتج مخرجات واضحة وعالية الدقة ومناسبة للاستخدام الاحترافي.

يعالج خط أنابيب المعاينة إلى 4K إحدى المشكلات الاقتصادية المستمرة للفيديو التوليدي: تكلفة إعادة إنشاء مخرجات كاملة الدقة في كل مرة يتغير فيها الطلب. ومن خلال فصل الاستكشاف عن التسليم، تعمل Google على جعل النموذج أكثر عملية بالنسبة للخطوط التجارية حيث تسبق العشرات من التكرارات العرض النهائي.

لماذا يهم

يعكس التحديث تحولًا في الصناعة من جودة الإنتاج الخام إلى إمكانية التحكم - القدرة على توجيه حركة الكاميرا والحفاظ على تناسق الشخصية والوصول إلى الإطارات الدقيقة، بالطريقة التي يفعلها المخرج أو المحرر. بالنسبة للمطورين الذين يقومون ببناء برامج إبداعية، فإن الفرق بين العرض التوضيحي والمنتج القابل للنشر غالبًا ما يرجع إلى عناصر التحكم هذه بدلاً من الدقة الأولية.

إن صياغة Google للإصدار تجعل الجمهور المستهدف واضحًا. تحدد الشركة ثلاث فئات مستهدفة - سير عمل الفيديو التوليدي، والأدوات الإبداعية وبرامج تحرير الوسائط - وتصف التحديثات بأنها تجعل الفيديو التوليدي أكثر قابلية للتحكم، وأسرع في التكرار، وصقله للنشر في العالم الحقيقي. تظهر النماذج الأولية الأسرع جنبًا إلى جنب مع ترقية 4K في ملخص الإصدار، مما يؤكد أن سرعة التكرار يتم بيعها كميزة في حد ذاتها.

مع توفر Omni 1.1 Flash في AI Studio ومن خلال Gemini API، تعمل Google أيضًا على دفع النموذج نحو مستخدمي المؤسسات عبر Gemini Enterprise Agent Platform، مما يشير إلى أنه يتم وضع الفيديو التوليدي كبنية تحتية للأعمال بدلاً من كونه حداثة للمستهلك.

ما يجب مشاهدته

لم يتم تسليط الضوء على تفاصيل الأسعار لإخراج 4K في الإعلان، وسيراقب المطورون كيف يؤثر الحد التراكمي البالغ 40 ثانية على خطط الإنتاج في العالم الحقيقي. لا تزال المنافسة في فيديو الذكاء الاصطناعي شديدة، حيث يقوم المنافسون بشحن ميزات التحكم الخاصة بهم بوتيرة سريعة - وهي ديناميكية أدت بشكل متكرر إلى تقصير العمر الافتراضي للمطالبات الحديثة هذا العام.

في الوقت الحالي، رسالة Google للمطورين مباشرة: الفيديو الإنتاجي الذي كان يتطلب كيمياء سريعة وحظًا يمكن الآن توجيهه وتوسيعه وإنهاؤه بدقة 4K من خلال واجهة برمجة تطبيقات واحدة.

---

ابقَ في طليعة الذكاء الاصطناعي

احصل على آخر الأخبار والتحليلات والإنجازات في مجال الذكاء الاصطناعي — كل ذلك في مكان واحد.

اقرأ المزيد من أخبار الذكاء الاصطناعي →