Black Forest Labs نے FLUX 3 جاری کیا ہے، جو ایک ملٹی موڈل فاؤنڈیشن ماڈل ہے جس کے بارے میں کمپنی کا کہنا ہے کہ مشترکہ طور پر تصاویر، ویڈیو اور آڈیو سے سیکھتی ہے تاکہ جسمانی دنیا کی واحد نمائندگی کی جا سکے۔ 23 جولائی 2026 کو اعلان کیا گیا، اور اب ابتدائی رسائی میں دستیاب ہے، FLUX 3 ماڈل کے لحاظ سے طریقہ کار سے ایک اہم آرکیٹیکچرل رخصتی کی نمائندگی کرتا ہے جس نے جنریٹو AI، تصویری تخلیق، مقامی آواز کے ساتھ ویڈیو جنریشن، اور یہاں تک کہ روبوٹ کنٹرول کو ایک متحد نظام میں حاوی کیا ہے۔

یہ لانچ جنریٹیو میڈیا اسپیس میں مسابقت کو تیز کرنے کے ایک لمحے پر پہنچا ہے، جہاں کھلاڑی بشمول Runway، OpenAI's Sora، اور Google's Veo اعلیٰ کوالٹی اور زیادہ قابل ویڈیو ماڈل تیار کرنے کی دوڑ میں لگے ہوئے ہیں۔ FLUX 3 اس مقابلے میں ایک بنیادی طور پر مختلف بنیادوں کے ساتھ داخل ہوتا ہے: کہ ہر میڈیا قسم کے لیے الگ الگ ماڈلز ایک مصنوعی حد ہے۔ اس کی پیشرفت پر ہماری جاری AI انڈسٹری کوریج کے جنریٹیو میڈیا لینڈ سکیپ کے حصے کے طور پر نگرانی کی جا رہی ہے۔

حقیقت کا ایک متحد ماڈل

ریلیز کے ساتھ ایک بلاگ پوسٹ میں، بلیک فاریسٹ لیبز نے ایک ہی ماڈل کو متعدد طریقوں میں تربیت دینے کے لیے نظریاتی محرکات کو پیش کیا۔ کمپنی نے استدلال کیا کہ کوئی ایک طریقہ - چاہے تصویر، ویڈیو، یا آڈیو - حقیقت کی مکمل وضاحت فراہم نہیں کرتا ہے۔ ہر ایک ایک ہی بنیادی جسمانی دنیا کا ایک پروجیکشن ہے، جو مختلف سینسروں کے ذریعے پکڑا جاتا ہے، ہر ایک اس عمل میں معلومات کھو دیتا ہے۔

تصاویر وقت کے ایک خاص مقام پر مقامی ڈھانچے کی گرفت کرتی ہیں۔ ویڈیوز وقت کے طول و عرض کو بحال کرتے ہیں اور وقتی حرکیات اور جسمانی قوانین کو ظاہر کرتے ہیں۔ آڈیو مکینیکل مظاہر اور صوتیات کے درمیان کارآمد تعلقات کو ظاہر کرتا ہے جن کا صرف وژن ہی پتہ نہیں لگا سکتا۔ کمپنی نے لکھا کہ زبان ان تصورات کو اہداف، تجریدات اور ہدایات سے جوڑتی ہے۔

ان سب سے بیک وقت سیکھنے سے، ماڈل کی باہمی مجبوریاں کسی ایک طریقہ کار سے زیادہ معلومات فراہم کرتی ہیں۔ آواز کو اثر سے مماثل ہونا پڑتا ہے، حرکت کو بڑے پیمانے پر ماننا پڑتا ہے، مستقبل کو ماضی سے چلنا پڑتا ہے۔ طریقہ کار الگ ہونا چھوڑ دیتے ہیں اور ایک بنیادی حقیقت کے بارے میں ثبوت بننا شروع کر دیتے ہیں۔

FLUX 3 کمپنی کا پہلا ماڈل ہے جو مکمل طور پر اس اصول پر بنایا گیا ہے، جسے بلیک فارسٹ لیبز سیلف فلو کہتے ہیں - ملٹی موڈل جنریشن کو مؤثر طریقے سے ترتیب دینے اور اسی بنیادی فن تعمیر کے اندر سمجھنے کے لیے ایک نقطہ نظر۔

مقامی آڈیو کے ساتھ ویڈیو جنریشن

FLUX 3 کی سب سے زیادہ نمایاں صلاحیت یہ ہے کہ وہ ایک ہی نسل کے پاس میں مطابقت پذیر مقامی آڈیو کے ساتھ 20 سیکنڈ تک کی ویڈیوز بنانے کی صلاحیت ہے۔ یہ اسے زیادہ تر موجودہ ویڈیو ماڈلز سے ممتاز کرتا ہے، جو خاموش فوٹیج تیار کرتے ہیں جنہیں الگ سے تیار کردہ آڈیو کے ساتھ جوڑنا ضروری ہے۔

کمپنی کے مطابق، FLUX 3 کا ویڈیو آؤٹ پٹ خاص طور پر انسانی چہرے کے تاثرات کو پکڑنے، آوازوں کو جسمانی واقعات کے ساتھ منسلک کرنے، اور کثیر لسانی صلاحیتوں کی حمایت کرنے میں خاصا مضبوط ہے۔ ان صلاحیتوں کو جوڑ کر کئی منٹ تک جاری رہنے والے سلسلے تخلیق کیے جا سکتے ہیں، جہاں بصری حوالہ جات اس بات کو یقینی بنانے میں مدد کرتے ہیں کہ کردار تمام مناظر میں ایک جیسے رہیں۔

تربیت کے دوران کی گئی ابتدائی انسانی تشخیص میں، FLUX 3 کو 77% موازنوں میں Runway Gen-4.5 پر اور Luma Ray 3.2 کو 93% مقابلے میں ترجیح دی گئی۔ نئے حریفوں کے مقابلے میں، اسے 69% تک مقابلے میں Grok Imagine Video، 60% میں Kling v3 Pro، اور Seedance 2.0 اور Gemini Omni Flash کو 52% میں ترجیح دی گئی۔

کمپنی نے خبردار کیا کہ یہ نتائج ابتدائی ہیں اور ابتدائی رسائی کے مرحلے کے دوران مزید بہتری کی توقع ہے۔

امیجز اور ٹیکسٹ رینڈرنگ

ویڈیو کے علاوہ، FLUX 3 مختلف قسم کے اندازوں، پہلوؤں کے تناسب، اور ریزولوشنز میں تصاویر کی ترکیب اور ترمیم کر سکتا ہے۔ بلیک فاریسٹ لیبز نے پیچیدہ اشارے سے نمٹنے اور امیجز کے اندر درست متن بنانے میں پہلے کے FLUX ورژنز کے مقابلے میں نمایاں بہتری کی اطلاع دی ہے - جنریٹیو امیج ماڈلز کے لیے ایک مستقل چیلنج۔

کمپنی نے کہا کہ FLUX 3 امیج کی صلاحیتوں کے لیے ابتدائی رسائی کا مرحلہ ویڈیو ریلیز کے بعد کے ہفتوں میں کھل جائے گا۔

فزیکل AI کا ایک پل

شاید FLUX 3 کا سب سے غیر روایتی پہلو روبوٹکس میں اس کی توسیع ہے۔ ماڈل کی عالمی سمجھ ایکشن پیشین گوئی تک پھیلی ہوئی ہے، کمپنی نے وضاحت کی، فزیکل AI کے لیے دو راستے اختیار کرتے ہوئے: مقامی ایکشن کی پیشین گوئی کو براہ راست FLUX 3 میں ضم کرنا، اور پہلے سے تربیت یافتہ ویڈیو بیک بون کو خصوصی ایکشن ماڈلز کے لیے بنیاد کے طور پر استعمال کرنا جو محدود کام کے مخصوص ڈیٹا کے ساتھ ٹھیک ٹیون ہیں۔

بلیک فارسٹ لیبز نے مِمِک روبوٹکس کے ساتھ شراکت کی، جو کہ FLUX 3 تک جلد رسائی حاصل کرنے والی پہلی کمپنیوں میں شامل تھی۔ انہوں نے مل کر FLUX-mimic تیار کیا، جو FLUX 3 ریڑھ کی ہڈی کو جوڑتا ہوا ایک ویڈیو ایکشن ماڈل ہے جس میں روبوٹ سیکھنے میں مہارت کی مہارت کے ساتھ FLUX 3 کو ملایا گیا ہے۔ کمپنی کے مطابق، سسٹم کو پہلے ہی آڈی میں حقیقی پیداواری کاموں پر آزمایا جا رہا ہے۔

یہ ایک قابل ذکر کنورجنسی کی نمائندگی کرتا ہے: تفریحی مواد تیار کرنے کے لیے استعمال ہونے والی بنیادی ٹیکنالوجی کو مینوفیکچرنگ ماحول میں جسمانی روبوٹس کو کنٹرول کرنے کے لیے لاگو کیا جا رہا ہے۔ کمپنی کا مقالہ یہ ہے کہ فزیکل اے آئی اور مواد کی تخلیق ایک ہی بنیاد پر چلتی ہے، کیونکہ دونوں کو ایک ایسے ماڈل کی ضرورت ہوتی ہے جو سمجھے کہ اشیاء کیسے ایک ساتھ رہتی ہیں، چیزیں کیسے حرکت کرتی ہیں، اور جسمانی واقعات کیسے آواز پیدا کرتے ہیں۔

مقابلہ اور مارکیٹ پوزیشن

لانچ کی پوزیشن بلیک فاریسٹ لیبز — بڑے پیمانے پر استعمال ہونے والے FLUX امیج جنریشن ماڈلز کے پیچھے برلن میں قائم اسٹارٹ اپ — تخلیقی AI اسپیس میں ایک زیادہ پرجوش حریف کے طور پر۔ جبکہ رن وے جیسی کمپنیوں نے متن اور ملٹی موڈل چیٹ بوٹس پر ویڈیو اور اوپن اے آئی پر توجہ مرکوز کی ہے، بلیک فاریسٹ لیبز شرط لگا رہی ہے کہ بصری، سمعی اور جسمانی ڈومینز میں ایک حقیقی متحد ماڈل خصوصی متبادلات سے زیادہ قابل ثابت ہوگا۔

کمپنی نے کہا کہ وہ پہلے ہی ماڈلز کی اگلی نسل پر کام کر رہی ہے، جس کا مقصد ایک ہی ماڈل میں ادراک، عمل اور زبان کی پیشن گوئی کو یکجا کرنا ہے۔ آنے والے ہفتوں اور مہینوں میں، یہ ایک ہی بنیادی ملٹی موڈل فلو میچنگ فن تعمیر سے تیار کردہ اضافی صلاحیتوں کو تیار کرے گا، ہر ایک فیڈ بیک اور حفاظتی جانچ کے لیے ابتدائی رسائی کے مرحلے کے بعد۔

FLUX 3 اب ویڈیو جنریشن کے لیے ابتدائی رسائی میں دستیاب ہے، جس میں تصویر اور اضافی صلاحیتیں بتدریج تیار ہو رہی ہیں۔

AI سے آگے رہیں

تصاویر، ویڈیو، آڈیو، اور روبوٹکس کے لیے FLUX 3 کا متحد نقطہ نظر اس بات میں ایک قابل ذکر تبدیلی کی نشاندہی کرتا ہے کہ کس طرح تخلیقی AI ماڈلز کو ڈیزائن کیا جا رہا ہے۔ تخلیقی میڈیا کی دوڑ اور مصنوعی ذہانت میں تازہ ترین پیش رفت کے بارے میں مزید جاننے کے لیے، ہماری بریکنگ AI نیوز کوریج کو فالو کریں۔

مزید AI خبریں پڑھیں →