أصدرت Black Forest Labs FLUX 3، وهو نموذج أساسي متعدد الوسائط تقول الشركة إنه يتعلم بشكل مشترك من الصور والفيديو والصوت لبناء تمثيل واحد للعالم المادي. تم الإعلان عن FLUX 3 في 23 يوليو 2026، وهو متاح الآن للوصول المبكر، ويمثل خروجًا معماريًا كبيرًا عن نهج النموذج حسب الطريقة الذي سيطر على الذكاء الاصطناعي التوليدي، وإنشاء الصور المتداعية، وتوليد الفيديو بصوت أصلي، وحتى التحكم في الروبوت في نظام واحد موحد.

يأتي الإطلاق في وقت تشتد فيه المنافسة في مجال الوسائط التوليدية، حيث يتسابق اللاعبون بما في ذلك Runway وOpenAI's Sora وVeo من Google لإنتاج نماذج فيديو ذات جودة أعلى وأكثر قدرة. يدخل FLUX 3 في هذه المسابقة بفرضية مختلفة تمامًا: أن النماذج المنفصلة لكل نوع من أنواع الوسائط تمثل قيودًا مصطنعة. تتم مراقبة التقدم المحرز كجزء من [تغطية صناعة الذكاء الاصطناعي] (https://aibuzzwire.news) المستمرة للمشهد الإعلامي التوليدي.

نموذج موحد للواقع

في منشور مدونة مصاحب للإصدار، أوضحت Black Forest Labs الحافز النظري لتدريب نموذج واحد عبر طرائق متعددة. وقالت الشركة إنه لا توجد طريقة واحدة - سواء كانت صورة أو فيديو أو صوت - توفر وصفًا كاملاً للواقع. كل منها عبارة عن إسقاط لنفس العالم المادي الأساسي، يتم التقاطه بواسطة أجهزة استشعار مختلفة، ويفقد كل منها المعلومات في هذه العملية.

تلتقط الصور الهياكل المكانية في نقطة زمنية محددة. تستعيد مقاطع الفيديو بُعد الزمن وتكشف عن الديناميكيات الزمنية والقوانين الفيزيائية. يكشف الصوت عن علاقات سببية بين الظواهر الميكانيكية والصوتيات التي لا تستطيع الرؤية وحدها اكتشافها. وكتبت الشركة أن اللغة تربط هذه التصورات بالأهداف والتجريدات والتعليمات.

ومن خلال التعلم من كل هذه الأمور في وقت واحد، توفر القيود المتبادلة للنموذج معلومات أكثر من أي طريقة منفردة. يجب أن يتناسب الصوت مع التأثير، ويجب أن تخضع الحركة للكتلة، ويجب أن يتبع المستقبل الماضي. تتوقف الطرائق عن كونها منفصلة وتبدأ في كونها دليلاً على حقيقة واحدة أساسية.

يعد FLUX 3 هو النموذج الأول للشركة المبني بالكامل على هذا المبدأ، والذي تسميه Black Forest Labs "التدفق الذاتي" - وهو نهج لمواءمة إنشاء الوسائط المتعددة والفهم بكفاءة ضمن نفس البنية الأساسية.

إنشاء الفيديو بالصوت الأصلي

إن القدرة الأكثر إثارة للدهشة في FLUX 3 هي قدرته على إنشاء مقاطع فيديو يصل طولها إلى 20 ثانية مع صوت أصلي متزامن في تمريرة جيل واحدة. وهذا ما يميزه عن معظم نماذج الفيديو الموجودة، والتي تنتج لقطات صامتة يجب إقرانها بصوت تم إنشاؤه بشكل منفصل.

وفقًا للشركة، فإن إخراج الفيديو الخاص بـ FLUX 3 قوي بشكل خاص في التقاط تعبيرات الوجه البشري، وربط الأصوات بالأحداث المادية، ودعم القدرات المتعددة اللغات. يمكن دمج هذه الإمكانات لإنشاء تسلسلات تدوم عدة دقائق، حيث تساعد المراجع المرئية على ضمان بقاء الشخصيات متسقة عبر جميع المشاهد.

في التقييم البشري الأولي الذي تم إجراؤه أثناء التدريب، تم تفضيل FLUX 3 على Runway Gen-4.5 في 77% من المقارنات وعلى Luma Ray 3.2 في 93% من المقارنات. بالمقارنة مع المنافسين الأحدث، تم تفضيله على Grok Imagine Video في ما يصل إلى 69% من المقارنات، وKling v3 Pro في 60%، وSeedance 2.0 وGemini Omni Flash في 52%.

ونبهت الشركة إلى أن هذه النتائج أولية وأنه من المتوقع إجراء المزيد من التحسينات خلال مرحلة الوصول المبكر.

عرض الصور والنص

بالإضافة إلى الفيديو، يمكن لـ FLUX 3 تجميع الصور وتحريرها عبر مجموعة واسعة من الأنماط ونسب العرض إلى الارتفاع ودرجات الدقة. أبلغت Black Forest Labs عن تحسينات كبيرة مقارنة بإصدارات FLUX السابقة في التعامل مع المطالبات المعقدة وإنشاء نص دقيق داخل الصور - وهو تحدٍ مستمر لنماذج الصور التوليدية.

وقالت الشركة إن مرحلة الوصول المبكر لقدرات FLUX 3 Image ستفتح في الأسابيع التالية لإصدار الفيديو.

جسر إلى الذكاء الاصطناعي المادي

ولعل الجانب الأكثر غير تقليدية في FLUX 3 هو امتداده إلى الروبوتات. أوضحت الشركة أن الفهم العالمي للنموذج يمتد إلى التنبؤ بالعمل، متخذًا طريقين للذكاء الاصطناعي المادي: دمج تنبؤ الإجراء الأصلي مباشرة في FLUX 3، واستخدام العمود الفقري للفيديو المُدرب مسبقًا كأساس لنماذج العمل المتخصصة المضبوطة بدقة ببيانات محدودة خاصة بالمهمة.

دخلت Black Forest Labs في شراكة مع mimic robotics، والتي كانت من بين الشركات الأولى التي حصلت على وصول مبكر إلى FLUX 3. وقد طوروا معًا FLUX-mimic، وهو نموذج لحركة الفيديو يجمع بين العمود الفقري لـ FLUX 3 وخبرة mimic في تعلم الروبوت من أجل التلاعب الماهر. ووفقا للشركة، يتم بالفعل اختبار النظام على مهام الإنتاج الحقيقية في أودي.

ويمثل هذا تقاربًا ملحوظًا: حيث يتم تطبيق نفس التكنولوجيا الأساسية المستخدمة لإنشاء محتوى ترفيهي للتحكم في الروبوتات المادية في بيئات التصنيع. تتمثل أطروحة الشركة في أن الذكاء الاصطناعي المادي وإنشاء المحتوى يعملان على نفس الأساس، لأن كلاهما يتطلب نموذجًا يفهم كيفية تماسك الأشياء معًا، وكيف تتحرك الأشياء، وكيف تنتج الأحداث المادية الصوت.

المنافسة ومكانة السوق

يضع هذا الإطلاق شركة Black Forest Labs - الشركة الناشئة التي يقع مقرها في برلين والتي تقف وراء نماذج توليد الصور FLUX المستخدمة على نطاق واسع - كمنافس أكثر طموحًا في مجال الذكاء الاصطناعي التوليدي. في حين ركزت شركات مثل Runway بشكل ضيق على الفيديو وOpenAI على روبوتات الدردشة النصية ومتعددة الوسائط، تراهن شركة Black Forest Labs على أن النموذج الموحد حقًا عبر المجالات المرئية والسمعية والمادية سوف يثبت أنه أكثر قدرة من البدائل المتخصصة.

وقالت الشركة إنها تعمل بالفعل على الجيل التالي من النماذج، بهدف توحيد الإدراك الحسي والتنبؤ بالحركة واللغة في نفس النموذج. خلال الأسابيع والأشهر المقبلة، سيتم طرح إمكانات إضافية مبنية على نفس بنية مطابقة التدفق متعدد الوسائط الأساسية، كل منها يتبع مرحلة الوصول المبكر للحصول على التعليقات واختبار السلامة.

يتوفر FLUX 3 الآن في الوصول المبكر لإنشاء الفيديو، مع نشر الصور والإمكانات الإضافية بشكل تدريجي.

ابق في صدارة الذكاء الاصطناعي

يمثل النهج الموحد لـ FLUX 3 تجاه الصور والفيديو والصوت والروبوتات تحولًا ملحوظًا في كيفية تصميم نماذج الذكاء الاصطناعي التوليدية. لمزيد من المعلومات حول سباق وسائل الإعلام التوليدية وآخر التطورات عبر الذكاء الاصطناعي، تابع تغطيتنا أخبار الذكاء الاصطناعي العاجلة.

اقرأ المزيد من أخبار الذكاء الاصطناعي →