ब्लैक फॉरेस्ट लैब्स ने FLUX 3 जारी किया है, जो एक मल्टीमॉडल फाउंडेशन मॉडल है, जिसके बारे में कंपनी का कहना है कि यह भौतिक दुनिया का एकल प्रतिनिधित्व बनाने के लिए छवियों, वीडियो और ऑडियो से संयुक्त रूप से सीखता है। 23 जुलाई, 2026 को घोषित, और अब शुरुआती पहुंच में उपलब्ध, फ्लक्स 3 मॉडल-दर-मोडैलिटी दृष्टिकोण से एक महत्वपूर्ण वास्तुशिल्प प्रस्थान का प्रतिनिधित्व करता है जिसने जेनेरिक एआई, ध्वस्त छवि निर्माण, देशी ध्वनि के साथ वीडियो पीढ़ी और यहां तक कि एक एकीकृत प्रणाली में रोबोट नियंत्रण पर हावी हो गया है।
यह लॉन्च जनरेटिव मीडिया स्पेस में तीव्र प्रतिस्पर्धा के क्षण में आया है, जहां रनवे, ओपनएआई के सोरा और Google के वीओ सहित खिलाड़ी उच्च-गुणवत्ता और अधिक सक्षम वीडियो मॉडल बनाने के लिए दौड़ रहे हैं। FLUX 3 इस प्रतियोगिता में मौलिक रूप से भिन्न आधार के साथ प्रवेश करता है: प्रत्येक मीडिया प्रकार के लिए अलग-अलग मॉडल एक कृत्रिम सीमा है। इसकी प्रगति की निगरानी जनरेटिव मीडिया परिदृश्य के हमारे चल रहे [एआई उद्योग कवरेज] (https://aibuzzwire.news) के हिस्से के रूप में की जा रही है।
वास्तविकता का एक एकीकृत मॉडल
रिलीज़ के साथ एक ब्लॉग पोस्ट में, ब्लैक फ़ॉरेस्ट लैब्स ने एक ही मॉडल को कई तौर-तरीकों में प्रशिक्षित करने के लिए सैद्धांतिक प्रेरणा दी। कंपनी ने तर्क दिया कि कोई भी एक तरीका - चाहे छवि, वीडियो, या ऑडियो - वास्तविकता का संपूर्ण विवरण प्रदान नहीं करता है। प्रत्येक एक ही अंतर्निहित भौतिक दुनिया का प्रक्षेपण है, जिसे विभिन्न सेंसरों द्वारा कैप्चर किया गया है, प्रत्येक प्रक्रिया में जानकारी खो रहा है।
छवियां समय में एक विशिष्ट बिंदु पर स्थानिक संरचनाओं को कैप्चर करती हैं। वीडियो समय के आयाम को पुनर्स्थापित करते हैं और अस्थायी गतिशीलता और भौतिक नियमों को प्रकट करते हैं। ऑडियो यांत्रिक घटनाओं और ध्वनिकी के बीच कारण संबंधों को प्रकट करता है जिसे अकेले दृष्टि से नहीं पहचाना जा सकता है। कंपनी ने लिखा, भाषा इन धारणाओं को लक्ष्यों, अमूर्तताओं और निर्देशों से जोड़ती है।
इन सभी से एक साथ सीखने से, मॉडल की पारस्परिक बाधाएँ अकेले किसी एक पद्धति की तुलना में अधिक जानकारी प्रदान करती हैं। ध्वनि को प्रभाव से मेल खाना चाहिए, गति को द्रव्यमान का पालन करना चाहिए, भविष्य को अतीत से अनुसरण करना चाहिए। तौर-तरीके अलग-अलग होना बंद कर देते हैं और एक अंतर्निहित वास्तविकता के बारे में सबूत बनना शुरू कर देते हैं।
FLUX 3 कंपनी का पहला मॉडल है जो पूरी तरह से इस सिद्धांत पर बनाया गया है, जिसे ब्लैक फॉरेस्ट लैब्स सेल्फ-फ्लो कहता है - एक ही अंतर्निहित वास्तुकला के भीतर मल्टीमॉडल पीढ़ी और समझ को कुशलतापूर्वक संरेखित करने के लिए एक दृष्टिकोण।
देशी ऑडियो के साथ वीडियो निर्माण
FLUX 3 की सबसे तत्काल उल्लेखनीय क्षमता एक ही पीढ़ी के पास में सिंक्रनाइज़ देशी ऑडियो के साथ 20 सेकंड तक की लंबाई के वीडियो उत्पन्न करने की क्षमता है। यह इसे अधिकांश मौजूदा वीडियो मॉडलों से अलग करता है, जो मूक फुटेज उत्पन्न करते हैं जिन्हें अलग से उत्पन्न ऑडियो के साथ जोड़ा जाना चाहिए।
कंपनी के अनुसार, FLUX 3 का वीडियो आउटपुट विशेष रूप से मानव चेहरे के भावों को पकड़ने, भौतिक घटनाओं के साथ ध्वनियों को जोड़ने और बहुभाषी क्षमताओं का समर्थन करने में मजबूत है। इन क्षमताओं को कई मिनटों तक चलने वाले अनुक्रम बनाने के लिए जोड़ा जा सकता है, जहां दृश्य संदर्भ यह सुनिश्चित करने में मदद करते हैं कि पात्र सभी दृश्यों में सुसंगत रहें।
प्रशिक्षण के दौरान किए गए प्रारंभिक मानव मूल्यांकन में, 77% तुलनाओं में फ्लक्स 3 को रनवे जेन-4.5 से अधिक और 93% तुलनाओं में लूमा रे 3.2 से अधिक प्राथमिकता दी गई। नए प्रतिस्पर्धियों के मुकाबले, 69% तुलनाओं में इसे ग्रोक इमेजिन वीडियो, 60% में क्लिंग वी3 प्रो, और 52% में सीडांस 2.0 और जेमिनी ओमनी फ्लैश पर प्राथमिकता दी गई।
कंपनी ने आगाह किया कि ये परिणाम प्रारंभिक हैं और प्रारंभिक पहुंच चरण के दौरान और सुधार की उम्मीद है।
छवियाँ और पाठ प्रतिपादन
वीडियो से परे, FLUX 3 विभिन्न प्रकार की शैलियों, पहलू अनुपात और रिज़ॉल्यूशन में छवियों को संश्लेषित और संपादित कर सकता है। ब्लैक फ़ॉरेस्ट लैब्स ने जटिल संकेतों को संभालने और छवियों के भीतर सटीक पाठ उत्पन्न करने में पिछले FLUX संस्करणों की तुलना में महत्वपूर्ण सुधार की सूचना दी - जो जेनरेटर इमेज मॉडल के लिए एक लगातार चुनौती है।
कंपनी ने कहा कि FLUX 3 छवि क्षमताओं के लिए प्रारंभिक पहुंच चरण वीडियो रिलीज के बाद के हफ्तों में खुल जाएगा।
भौतिक एआई के लिए एक पुल
शायद FLUX 3 का सबसे अपरंपरागत पहलू रोबोटिक्स में इसका विस्तार है। कंपनी ने बताया कि मॉडल की दुनिया की समझ एक्शन भविष्यवाणी तक फैली हुई है, भौतिक एआई के लिए दो मार्ग अपनाए जा रहे हैं: मूल एक्शन भविष्यवाणी को सीधे FLUX 3 में एकीकृत करना, और सीमित कार्य-विशिष्ट डेटा के साथ ठीक-ठाक किए गए विशेष एक्शन मॉडल की नींव के रूप में पूर्व-प्रशिक्षित वीडियो बैकबोन का उपयोग करना।
ब्लैक फॉरेस्ट लैब्स ने मिमिक रोबोटिक्स के साथ साझेदारी की, जो FLUX 3 तक शुरुआती पहुंच हासिल करने वाली पहली कंपनियों में से एक थी। साथ में उन्होंने FLUX-मिमिक विकसित किया, जो एक वीडियो-एक्शन मॉडल है, जो FLUX 3 बैकबोन को कुशल हेरफेर के लिए रोबोट सीखने में मिमिक की विशेषज्ञता के साथ जोड़ता है। कंपनी के अनुसार, ऑडी में वास्तविक उत्पादन कार्यों पर सिस्टम का परीक्षण पहले से ही किया जा रहा है।
यह एक उल्लेखनीय अभिसरण का प्रतिनिधित्व करता है: मनोरंजन सामग्री उत्पन्न करने के लिए उपयोग की जाने वाली वही अंतर्निहित तकनीक विनिर्माण वातावरण में भौतिक रोबोट को नियंत्रित करने के लिए लागू की जा रही है। कंपनी की थीसिस यह है कि भौतिक एआई और सामग्री निर्माण एक ही आधार पर चलते हैं, क्योंकि दोनों को एक ऐसे मॉडल की आवश्यकता होती है जो समझता हो कि वस्तुएं एक साथ कैसे रहती हैं, चीजें कैसे चलती हैं, और भौतिक घटनाएं कैसे ध्वनि उत्पन्न करती हैं।
प्रतिस्पर्धा और बाज़ार की स्थिति
लॉन्च ने ब्लैक फॉरेस्ट लैब्स - व्यापक रूप से उपयोग किए जाने वाले FLUX इमेज जेनरेशन मॉडल के पीछे बर्लिन स्थित स्टार्टअप - को जेनरेटिव एआई स्पेस में एक अधिक महत्वाकांक्षी प्रतियोगी के रूप में स्थान दिया है। जबकि रनवे जैसी कंपनियों ने वीडियो और ओपनएआई पर टेक्स्ट और मल्टीमॉडल चैटबॉट्स पर ध्यान केंद्रित किया है, ब्लैक फॉरेस्ट लैब्स शर्त लगा रही है कि दृश्य, श्रवण और भौतिक डोमेन में वास्तव में एकीकृत मॉडल विशेष विकल्पों की तुलना में अधिक सक्षम साबित होगा।
कंपनी ने कहा कि वह पहले से ही अगली पीढ़ी के मॉडल पर काम कर रही है, जिसका लक्ष्य अवधारणात्मक, क्रिया और भाषा की भविष्यवाणी को एक ही मॉडल में एकीकृत करना है। आने वाले हफ्तों और महीनों में, यह उसी अंतर्निहित मल्टीमॉडल फ्लो मैचिंग आर्किटेक्चर से निर्मित अतिरिक्त क्षमताओं को पेश करेगा, जिनमें से प्रत्येक फीडबैक और सुरक्षा परीक्षण के लिए प्रारंभिक पहुंच चरण के बाद होगा।
FLUX 3 अब वीडियो निर्माण के लिए प्रारंभिक पहुंच में उपलब्ध है, जिसमें छवि और अतिरिक्त क्षमताएं क्रमिक रूप से उपलब्ध हैं।
एआई से आगे रहें
छवियों, वीडियो, ऑडियो और रोबोटिक्स के लिए FLUX 3 का एकीकृत दृष्टिकोण जेनरेटिव एआई मॉडल को डिजाइन करने के तरीके में एक उल्लेखनीय बदलाव का प्रतीक है। जनरेटिव मीडिया रेस और आर्टिफिशियल इंटेलिजेंस में नवीनतम विकास के बारे में अधिक जानकारी के लिए, हमारे [ब्रेकिंग एआई न्यूज़] (https://aibuzzwire.news) कवरेज का अनुसरण करें।
अधिक AI समाचार पढ़ें →
