जर्मन संशोधन संस्था आणि AI कंपन्यांच्या एका संघाने Soofi S 30B-A3B हे ओपन लँग्वेज मॉडेल रिलीझ केले आहे, ज्याचा प्रकल्प पूर्णपणे ओपन मॉडेल्समध्ये इंग्रजी आणि जर्मन बेंचमार्क दोन्हीवर सर्वाधिक गुण मिळवतो. KI Bundesverband, जर्मनीच्या राष्ट्रीय AI असोसिएशनने समन्वित केलेले, रिलीज हे म्युनिकमधील ड्यूश टेलिकॉमच्या इंडस्ट्रियल AI क्लाउडवर पूर्णपणे प्रशिक्षित केलेल्या पहिल्या मोठ्या भाषेच्या मॉडेल्सपैकी एक आहे आणि प्रबळ युनायटेड स्टेट्स आणि चीनी ओपन-वेट रिलीझसाठी एक सार्वभौम युरोपीय पर्याय म्हणून स्थित आहे. नवीनतम AI घडामोडी ट्रॅक करणाऱ्या विकासकांसाठी, आर्किटेक्चरमध्ये बेक केलेल्या असामान्य कार्यक्षमता आणि भाषा फोकसपेक्षा कच्च्या प्रमाणासाठी लाँच कमी लक्षणीय आहे.
केवळ 3.2 अब्ज सक्रिय पॅरामीटर्ससह संकरित डिझाइन
Soofi S हे तज्ञांचे मिश्रण (MoE) मॉडेल आहे ज्यामध्ये एकूण 31.6 अब्ज पॅरामीटर्स आहेत, परंतु ते केवळ 3.2 अब्ज प्रति जनरेट टोकन सक्रिय करते. हे त्याची गणना खर्च पारंपारिक 30-अब्ज-पॅरामीटर दाट मॉडेलपेक्षा 3-अब्ज-पॅरामीटर मॉडेलच्या जवळ ठेवते, परदेशातील क्लाउड प्रदात्यांवर अवलंबून न राहता युरोपियन पायाभूत सुविधांवर चालण्यासाठी अंदाजे स्वस्त ठेवण्याच्या उद्देशाने डिझाइन निवड.
आर्किटेक्चर Nvidia च्या Nemotron 3 Nano कडून घेतलेले आहे, ज्यामध्ये Mamba-2 लेयर्सना संकरित लेआउटमध्ये स्टँडर्ड अटेन्शन लेयर्ससह एकत्र केले आहे. प्रकल्पाच्या पूर्व-प्रशिक्षण अहवालानुसार, मॉडेलच्या 52 लेयर्सपैकी फक्त 6 एक की-व्हॅल्यू (KV) कॅशे राखतात - मेमरी स्ट्रक्चर जी लक्ष गणनेसाठी मागील टोकन संग्रहित करते. पारंपारिक ट्रान्सफॉर्मरमध्ये, ते कॅशे संदर्भ लांबीसह रेषीयपणे वाढते आणि दीर्घ-संदर्भ निष्कर्षादरम्यान एक प्रमुख अडचण बनते.
व्यावहारिक मोबदला थ्रूपुटमध्ये दिसून येतो. 32 समांतर विनंत्यांसह 40,000 टोकन्सच्या संदर्भ लांबीवर, Soofi S 14-ते-24-अब्ज-पॅरामीटर श्रेणीतील घन मॉडेल्सपेक्षा प्रति सेकंद प्रति GPU अंदाजे आठ पट अधिक टोकन व्युत्पन्न करते. पारंपारिक मॉडेल्सच्या निर्मितीचा वेग जसजसा संदर्भ वाढतो तसतसा कमी होत असताना, Soofi S 4,000 टोकन्सवरून 256,000 टोकन्सपर्यंत जवळजवळ सपाट राहते. कंसोर्टियमच्या मोजमापांमधील एकमेव तुलनात्मक मॉडेल अलीबाबाचे Qwen3.5 35B-A3B आहे, जे संकरित आर्किटेक्चर देखील वापरते.
इंग्रजीचा त्याग न करता जर्मनसाठी प्रशिक्षित
जर्मनवर मुद्दाम लक्ष केंद्रित करणे हा प्रकल्पाचा केंद्रबिंदू आहे. पहिल्या प्रशिक्षण टप्प्यात, जर्मन डेटा मिश्रणाच्या 7.2 टक्के बनवते; दुसऱ्या टप्प्यात, तो वाटा 15.3 टक्क्यांपर्यंत वाढला आहे. तुलनात्मकदृष्ट्या, Nvidia च्या Nemotron संदर्भ रेसिपीमध्ये सर्व गैर-इंग्रजी भाषा एकत्रितपणे प्रशिक्षण मिश्रणाच्या फक्त 5 टक्के आहेत.
डेटा स्रोतांमध्ये HPLT कॉर्पसमधील जर्मन वेब मजकूर, मुक्तपणे परवानाकृत जर्मन कॉमन्स कॉर्पस, FinePDFs आणि FineWiki चे जर्मन भाग आणि 916 जर्मन प्रकाशनांमधून काढलेल्या 193 दशलक्ष वृत्तपत्र लेखांचे व्यावसायिकरित्या परवानाकृत Genios संग्रहण यांचा समावेश आहे. मशीन-अनुवादित आणि कृत्रिमरित्या व्युत्पन्न केलेले जर्मन मजकूर संपूर्ण मिश्रणात आहे.
मॉडेलने तीन प्रशिक्षण टप्प्यांमध्ये अंदाजे 27 ट्रिलियन टोकन्सची प्रक्रिया केली: पहिल्या टप्प्यात ब्रॉड वेब, कोड, गणित आणि डोमेन-विशिष्ट मजकूराचे सुमारे 20 ट्रिलियन टोकन; दुसऱ्यामध्ये सुमारे 6 ट्रिलियन उच्च-गुणवत्तेचे टोकन; आणि एक लहान तिसरा टप्पा दहा लाख टोकन पर्यंत लांब दस्तऐवज वापरून संदर्भ विंडोचा विस्तार करतो.
बेंचमार्क निकाल: जर्मन आणि इंग्रजीवर पुढे, गणितात कमकुवत
इतर 16 ओपन मॉडेल्सच्या विरूद्ध मूल्यांकनात, Soofi S सर्व पूर्णपणे खुल्या मॉडेल्समध्ये जर्मन आणि इंग्रजी दोन्हीसाठी एकत्रित स्कोअरवर आघाडीवर आहे, कन्सोर्टियमनुसार. त्यामध्ये AI साठी ऍलन इन्स्टिट्यूटचे OLMo 3 32B आणि ETH झुरिच आणि EPFL मधील Apertus 70B यांचा समावेश आहे. प्रत्येक युरोपियन सार्वभौम बेसलाइनच्या विरूद्ध, मॉडेल सूटमधील सर्व जर्मन बेंचमार्कवर पुढे येते, कधीकधी दुहेरी-अंकी फरकाने.
कोड टास्कवर, Soofi S ला HumanEval वर 73.8 टक्के, MBPP वर 70.2 आणि जर्मन MBPP व्हेरियंटवर 84.2 स्कोअर मिळाले - हे ओपन-सोर्स समवयस्कांमध्ये सर्वोत्तम परिणाम आहेत. INCLUDE-DE वर, जर्मनी-विशिष्ट प्रादेशिक ज्ञानाची चाचणी, Soofi S मोठ्या Qwen3.5 35B-A3B सह 61.2 गुणांवर प्रथम स्थानावर आहे. निमोट्रॉन बेसलाइनशी तुलना करता, जर्मन-वेटेड डेटा रेसिपी इंग्रजी कार्यक्षमतेला धक्का न लावता भाषा प्राविण्य 15.1 गुणांनी आणि GPQA-डायमंड सायन्स बेंचमार्क 9.6 गुणांनी सुधारते.
स्पष्ट कमजोरी आहेत. जर्मन स्पर्धा गणितावर (मिनर्व्हा MATH-DE), Soofi S ने 56 गुण मिळवले, 76.5 वर Qwen3.5 35B-A3B आणि 65.6 वर Gemma 3 27B च्या मागे. हे NaturalQuestions मधील खुल्या तथ्यात्मक पुनर्प्राप्तीवर देखील माग काढते, ज्याचे श्रेय संघाने केवळ 3 अब्ज सक्रिय पॅरामीटर्स आणि म्हणून कमी संग्रहित जागतिक ज्ञान दाट 27B मॉडेलपेक्षा दिले आहे. RULER लाँग-कॉन्टेक्स्ट चाचणी आणखी एक अंतर दर्शवते: जेव्हा मॉडेलला लांबलचक मजकूरातून वारंवार येणारे शब्द काढावे लागतात, तेव्हा त्याचा हिट दर 32,000 टोकनच्या पुढे 3 टक्क्यांपर्यंत घसरतो, तर तुलनात्मक निमोट्रॉन मॉडेल अजूनही 60 ते 64 टक्के व्यवस्थापित करते.
म्युनिकमध्ये 512 Nvidia B200 GPU वर प्रशिक्षित
मार्च ते मे 2026 दरम्यान म्युनिकमधील ड्यूश टेलिकॉमच्या इंडस्ट्रियल एआय क्लाउडवर सुमारे 512 Nvidia B200 GPU वर प्रशिक्षण रन झाले, एकूण सुमारे 253,000 GPU-तास. ही सुविधा पूर्णपणे अक्षय ऊर्जेवर चालते, Eisbach कालव्याच्या पाण्याने ती थंड केली जाते आणि आसपासच्या Tucherpark परिसरात कचरा उष्मा घालते, अहवालानुसार. सूफी एस हे या पायाभूत सुविधांवर चालवलेले पहिले मोठे प्रशिक्षण होते.
मॉडेलच्या मागे असलेल्या संघाला युरोपियन IPCEI-CIS कार्यक्रमाचा भाग म्हणून जर्मन फेडरल आर्थिक व्यवहार आणि ऊर्जा मंत्रालयाने निधी दिला आहे. सहभागींमध्ये Fraunhofer Institutes IAIS आणि IIS, जर्मन संशोधन केंद्र कृत्रिम बुद्धिमत्ता (DFKI), TU Darmstadt, Würzburg विद्यापीठ, L3S संशोधन केंद्र, बर्लिन युनिव्हर्सिटी ऑफ अप्लाइड सायन्सेस आणि AI कंपन्या Ellamind आणि Merantix Momentum यांचा समावेश आहे.
'ओव्हरट्रेनिंग' वर वाद
लाँच झाल्यानंतर लगेचच, समीक्षकांनी असा युक्तिवाद केला की Soofi S 2022 मध्ये Google DeepMind द्वारे प्रकाशित क्लासिक चिनचिला स्केलिंग कायद्यांच्या मानकांनुसार खूप जास्त प्रशिक्षित होते, ज्याने प्रति पॅरामीटर 20 टोकन्सचा एक उग्र गोड स्पॉट सुचवला होता. 27 ट्रिलियन टोकन्स आणि अंदाजे 30 अब्ज पॅरामीटर्ससह, Soofi S प्रति पॅरामीटर्सवर शंभर टोकन्सवर उतरतो; केवळ 3.2 अब्ज सक्रिय पॅरामीटर्सची मोजणी केल्याने प्रमाण हजारोंमध्ये ढकलले जाते.
प्रकल्पाच्या तांत्रिक नेतृत्वाचा एक भाग असलेल्या मायकेल फ्रॉमने त्या टीकेला मागे ढकलले आणि असा युक्तिवाद केला की ते नियम MoE आर्किटेक्चरला लागू होत नाहीत. "नवीन संशोधनात असे दिसून आले आहे की दाट मॉडेल्सचे जुने स्केलिंग कायदे यापुढे MoE आर्किटेक्चरवर लागू होत नाहीत," फ्रॉम म्हणाले की, वैयक्तिक तज्ञांना मोठ्या, उच्च-गुणवत्तेच्या डेटासेटमध्ये समान कागदपत्रे वारंवार पाहण्याचा फायदा होतो. तुलनेचा मुद्दा म्हणून, त्याने Nvidia कडे लक्ष वेधले, ज्याने 25 ट्रिलियन टोकन्सवर स्वतःचे मॉडेल प्रशिक्षित केले आहे.
काय सुटते आणि काय नाही
संशोधक निवडक इंटरमीडिएट चेकपॉईंट्स, संपूर्ण प्रशिक्षण आणि मूल्यमापन कोड आणि रॉ टोकन संख्या, युग क्रमांक आणि प्रति स्त्रोत प्रभावी योगदान सूचीबद्ध करणारी तपशीलवार डेटा इन्व्हेंटरीसह मॉडेल वेट्स जारी करत आहेत. टीमच्या मते, याचा अर्थ Soofi S ओपन सोर्स इनिशिएटिव्हच्या ओपन सोर्स एआय डेफिनिशन 1.0 ला पूर्ण करतो.
युरोपियन ओपन-डेटा व्याख्येसाठी एक कठोर प्रस्ताव, ज्यासाठी प्रत्येक प्रशिक्षण टोकन मुक्तपणे वितरीत करणे आवश्यक आहे, ते पूर्ण केले गेले नाही कारण 1.3 टक्के मिश्रण व्यावसायिकरित्या परवानाधारक Genios कॉर्पसमधून येते. अहवालात असे म्हटले आहे की सुमारे 99 टक्के प्रशिक्षण डेटा अद्याप स्वतंत्रपणे पुनर्रचना केला जाऊ शकतो. प्रकाशनाच्या वेळी मॉडेलच्या प्रकाशनासाठी अचूक परवाना निश्चित केला गेला नव्हता.
तांत्रिक दस्तऐवज, कोड जनरेशन आणि एजंट-आधारित प्रणालींचा समावेश असलेल्या अनुप्रयोगांमध्ये Soofi S ची चाचणी करण्यासाठी संघ आता पुढील टप्प्यासाठी उद्योग भागीदार शोधत आहे. ओपन-वेट मॉडेल रिलीझ, सार्वभौम AI इन्फ्रास्ट्रक्चर आणि युरोपियन AI इकोसिस्टमबद्दल अधिक माहितीसाठी, येथे प्रकाशित AI उद्योग कव्हरेज सोबत रहा.
मुक्त-स्रोत AI वर पुढे रहा
युनायटेड स्टेट्स, चीन आणि आता युरोपमधील लॅबमधून ओपन-वेट रिलीझ जवळजवळ साप्ताहिक येत आहेत आणि सर्वात मोठे मालकीचे मॉडेल आणि सर्वोत्तम मुक्त पर्यायांमधील अंतर कमी होत आहे. संपूर्ण चित्रासाठी येथे ब्रेकिंग एआय न्यूज आणि बेंचमार्क विश्लेषणाचे अनुसरण करा.
अधिक एआय मॉडेल कव्हरेज वाचा →



