क्रिएटिव एआई टूल बनाने वाले स्टार्टअप क्रेया ने ओपन-वेट टेक्स्ट-टू-इमेज फाउंडेशन मॉडल का एक परिवार क्रेआ 2 (के2) जारी किया है, जिसके बारे में कंपनी का कहना है कि यह आर्टिफिशियल एनालिसिस लीडरबोर्ड पर शीर्ष 10 छवि जनरेटर में से एक है और स्वतंत्र प्रयोगशालाओं के मॉडलों में दूसरे स्थान पर है। रिलीज़, 23 जून, 2026 को प्रकाशित एक तकनीकी रिपोर्ट में विस्तृत है, दो मॉडल चौकियों और एक अनुमेय लाइसेंस के साथ जहाज जो समुदाय को बेहतर बनाने और इसके शीर्ष पर निर्माण करने के लिए आमंत्रित करता है।
कई हालिया छवि मॉडलों के विपरीत, जो एकल पॉलिश डिफ़ॉल्ट आउटपुट के लिए अनुकूलित होते हैं, Krea ने Krea 2 को रचनात्मक अन्वेषण के विचार के आसपास डिज़ाइन किया है, जो एक व्यापक दृश्य वितरण को उजागर करता है जिसे उपयोगकर्ता एक संकीर्ण सौंदर्यशास्त्र को मजबूर करने के बजाय नेविगेट कर सकते हैं। For more context on this story, see our ongoing more AI stories.
विभिन्न आवश्यकताओं के लिए दो चेकप्वाइंट
Krea 2 रिलीज़ में दो अलग-अलग चौकियाँ शामिल हैं। पहला, K2 रॉ, एक अनडिस्टिल्ड बेस मॉडल है जिसका उद्देश्य फाइन-ट्यूनिंग और प्रशिक्षण के बाद के शोध के लिए है, जो डेवलपर्स को अनुकूलन के लिए एक साफ आधार प्रदान करता है। दूसरा, K2 टर्बो, एक मार्गदर्शन- और टाइमस्टेप-डिस्टिल्ड मॉडल है जिसे तेज, कुछ-चरणीय पीढ़ी के लिए इंजीनियर किया गया है, जिस तरह की त्वरित पुनरावृत्ति रचनात्मक वर्कफ़्लो की मांग होती है।
अनुसंधान-अनुकूल आधार और गति-अनुकूलित संस्करण दोनों की पेशकश एक व्यावहारिक विभाजन को दर्शाती है। शोधकर्ताओं और टिंकरर्स को प्रयोग करने के लिए कच्चा मॉडल मिलता है, जबकि उत्पादन उपयोगकर्ताओं को एक तेज़ चेकपॉइंट मिलता है जो गति के लिए गुणवत्ता के मामले में बहुत कम त्याग करता है।
एआई-जनित प्रशिक्षण डेटा के खिलाफ एक जानबूझकर रुख
क्रेया की तकनीकी रिपोर्ट में सबसे महत्वपूर्ण दावों में से एक प्रशिक्षण डेटा से संबंधित है। टीम का कहना है कि उसने अपने प्रीट्रेनिंग मिश्रण में एआई-जनरेटेड छवियों का उपयोग नहीं किया। जबकि सिंथेटिक डेटा और आसवन मॉडल क्षमताओं को प्राप्त करने के लिए लोकप्रिय शॉर्टकट बन गए हैं, क्रेया ने पाया कि एआई-जनरेटेड छवियों के एक छोटे से अनुपात ने भी मॉडल के आउटपुट वितरण में पूर्वाग्रह पैदा किए हैं।
तर्क सीधा है: किसी मॉडल के लिए सिंथेटिक छवियां सीखना आसान होता है, जो प्रभावी रूप से गुणवत्ता पर एक कृत्रिम सीमा लगाता है। नीति को लागू करने के लिए, Krea ने विशेष रूप से ऑफ-द-शेल्फ फ़िल्टर पर भरोसा करने के बजाय, अपने डेटासेट से AI-जनरेटेड छवियों को फ़िल्टर करने के लिए इन-हाउस क्लासिफायर का निर्माण किया।
कंपनी ने डेटा गुणवत्ता पर भी विपरीत दृष्टिकोण अपनाया। उच्च सौंदर्य स्कोर के लिए आक्रामक रूप से फ़िल्टर करने के बजाय, जो जानबूझकर धुंधली, दानेदार या अपरंपरागत छवियों को हटा सकता है जो वैध कलात्मक विकल्पों का प्रतिनिधित्व करते हैं, क्रेया ने विविधता और व्यापक डोमेन कवरेज के लिए तर्क दिया। परिणाम, यह कहता है, केवल पारंपरिक रूप से सुंदर छवियों पर प्रशिक्षित प्रणालियों की तुलना में व्यापक अभिव्यंजक रेंज वाला एक मॉडल है।
वास्तुकला और प्रशिक्षण पाइपलाइन
Krea 2 एक ट्रांसफॉर्मर आर्किटेक्चर पर बनाया गया है जिसका अंतिम डिज़ाइन रिपोर्ट में प्रलेखित व्यापक एब्लेशन अध्ययनों के माध्यम से चुना गया था। विकल्पों का परीक्षण करने के बाद, टीम ने गेटेड सिग्मॉइड ध्यान, एक स्विग्लू एमएलपी और क्यूवेन 3 वीएल को टेक्स्ट एनकोडर के साथ समूहीकृत-क्वेरी ध्यान (जीक्यूए) पर चुना। पोजिशनल एन्कोडिंग 3डी अक्षीय रोटरी एम्बेडिंग का उपयोग करता है, और ऑटोएनकोडर क्वेन इमेज वीएई और फ्लक्स 2 एई को जोड़ता है।
प्रशिक्षण में बहुस्तरीय पाठ्यक्रम का पालन किया गया। प्रीट्रेनिंग 256px, 512px और 1024px रिज़ॉल्यूशन चरणों के माध्यम से आगे बढ़ी, उच्च रिज़ॉल्यूशन पर उच्च-निष्ठा पीढ़ी को तेज करने से पहले मुख्य क्षमताओं को कुशलतापूर्वक बनाने के लिए कम-रिज़ॉल्यूशन कार्य के लिए गणना का बड़ा हिस्सा समर्पित किया। एक मध्य प्रशिक्षण चरण ने दुर्लभ और लंबी-पूंछ अवधारणाओं के कवरेज को संरक्षित करने के लिए सिमेंटिक क्लस्टरिंग और पुनर्प्राप्ति-आधारित रणनीतियों का उपयोग करके व्यापक प्रीट्रेनिंग वितरण और उच्च गुणवत्ता वाले पर्यवेक्षित फाइन-ट्यूनिंग वितरण को पाट दिया।
पीढ़ी को खोजपूर्ण और संचालन योग्य बनाना
Krea ने मॉडलों को कैसे प्रशिक्षित किया जाता है और उपयोगकर्ता वास्तव में अपने इरादे कैसे व्यक्त करते हैं, के बीच एक निरंतर अंतर की पहचान की। प्रशिक्षण के दौरान, मॉडल समृद्ध, सघन कैप्शन से सीखते हैं। अनुमान के समय, उपयोगकर्ता अक्सर किसी दृश्य का सटीक वर्णन करने के बजाय छोटे, अस्पष्ट संकेत टाइप करते हैं, या मूड या संदर्भ छवि की ओर इशारा करते हैं।
उस अंतर को पाटने के लिए, Krea 2 दो प्रणालियों के साथ आता है। पहला एक त्वरित विस्तारक है, जिसे ओपन-सोर्स बड़े भाषा मॉडल के शीर्ष पर दो-चरण पर्यवेक्षित फाइन-ट्यूनिंग और सुदृढीकरण सीखने की पाइपलाइन के माध्यम से प्रशिक्षित किया जाता है, जो उपयोगकर्ता के इरादे को अधिलेखित किए बिना सरल संकेतों को समृद्ध दृश्य दिशाओं में मैप करता है। दूसरा एक शैली-संदर्भ प्रणाली है जो उपयोगकर्ताओं को न्यूनतम सामग्री रिसाव के साथ एक या अधिक संदर्भ छवियों की शैली या मनोदशा को इंजेक्ट करने की सुविधा देती है, जो शैली की ताकत और भारित मिश्रण पर बारीक नियंत्रण प्रदान करती है।
साथ में, ये घटक Krea 2 को एक खोजपूर्ण माध्यम के रूप में पुनः परिभाषित करते हैं। एकल उत्तर देने के बजाय, मॉडल को संभावनाओं के एक स्थान को उजागर करने और उपयोगकर्ताओं को पाठ और छवि-आधारित नियंत्रण दोनों का उपयोग करके इसके माध्यम से आगे बढ़ने के व्यावहारिक तरीके देने के लिए डिज़ाइन किया गया है।
वास्तविक संस्थाओं के ज्ञान का संरक्षण
किसी भी छवि जनरेटर के लिए एक सूक्ष्म लेकिन महत्वपूर्ण क्षमता ज्ञात संस्थाओं, लोगों, स्थानों और वस्तुओं का ईमानदारी से प्रतिनिधित्व करने की क्षमता है, जिन्हें उपयोगकर्ता केवल नाम से संदर्भित कर सकते हैं। क्रेआ को चिंता थी कि मानक नमूनाकरण विधियाँ डेटा क्यूरेशन के दौरान गलती से दुर्लभ या महत्वपूर्ण अवधारणाओं को छोड़ सकती हैं।
इसे रोकने के लिए, टीम ने अंग्रेजी विकिपीडिया पर पेजरैंक चलाया, रैंक के आधार पर शीर्ष 90 प्रतिशत लेखों को बरकरार रखा, उन अवधारणाओं को फ़िल्टर किया जिन्हें सार्थक रूप से चित्रित नहीं किया जा सकता है, और फिर इसके कैप्शन डेटासेट में कवरेज को सत्यापित किया, उन छवियों को प्राथमिकता दी जिनके कैप्शन दुर्लभ अवधारणाओं को संदर्भित करते हैं। टीम ने बाद में पुष्टि की कि प्रारंभिक डेटासेट में मौजूद किसी भी अवधारणा को अंतिम प्रशिक्षण नमूने से पूरी तरह से हटा नहीं दिया गया था।
इमेज एआई के लिए एक प्रतिस्पर्धी ओपन फ्रंटियर
Krea 2 का आगमन एक भीड़-भाड़ वाले ओपन-वेट छवि निर्माण परिदृश्य को तीव्र करता है। कंपनी अपने मॉडल को आर्टिफिशियल एनालिसिस टेक्स्ट-टू-इमेज लीडरबोर्ड पर "शीर्ष 10 में" और "स्वतंत्र प्रयोगशालाओं के मॉडल के बीच दूसरे स्थान पर" रखती है, एक दावा है कि, अगर यह व्यापक सामुदायिक जांच के तहत आता है, तो K2 सबसे मजबूत खुले तौर पर उपलब्ध छवि जनरेटर में से एक बन जाएगा।
तकनीकी रिपोर्ट, जो लगभग 12,000 शब्दों की है और डेटा क्यूरेशन सिद्धांतों से लेकर वितरित प्रशिक्षण बुनियादी ढांचे तक सब कुछ का विवरण देती है, एक रणनीतिक उद्देश्य भी पूरा करती है। एक प्रतिस्पर्धी मॉडल के पीछे की कार्यप्रणाली को प्रकाशित करके, Krea खुले अनुसंधान समुदाय में विश्वसनीयता की मुद्रा, जांच, पुनरुत्पादन और सुधार को आमंत्रित कर रहा है।
रचनाकारों और डेवलपर्स के लिए, अपशॉट एक सक्षम, खुले तौर पर लाइसेंस प्राप्त छवि मॉडल है जो एकल सुरक्षित डिफ़ॉल्ट पर रचनात्मक सीमा को प्राथमिकता देता है। हगिंग फेस पर उपलब्ध वेट और गिटहब पर कोड के साथ, Krea 2 उन लोगों के लिए बाधा को कम करता है जो अपनी शर्तों पर अत्याधुनिक छवि जनरेटर का निर्माण, फाइन-ट्यून, या बस प्रयोग करना चाहते हैं।
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →
