जर्मन AI कंपनी Aleph Alpha ने Kolibri, एक ओपन-वेट मिक्स्चर-ऑफ-Experts भाषेचे मॉडेल जारी केले आहे, जे जर्मन आणि इंग्रजीसाठी तयार केले गेले आहे. मॉडेल 78.1 अब्ज एकूण पॅरामीटर्स पॅक करते परंतु त्यापैकी फक्त 3.46 अब्ज प्रति टोकन सक्रिय करते — सुमारे 4.4 टक्के — आणि हगिंग फेसवर अनुज्ञेय Apache 2.0 परवान्या अंतर्गत जहाजे. हे संदर्भाचे 1,048,576 टोकन स्वीकारते आणि वापरकर्त्यांना प्रति विनंती तर्क करण्याचा प्रयत्न सेट करू देते. ओपन-वेट इकोसिस्टमचा मागोवा घेणाऱ्या वाचकांसाठी, हे आमच्या नवीनतम AI घडामोडी च्या बाजूने आहे.

अलेफ अल्फाला त्याची बाजारपेठ कोठे दिसते याविषयी हे प्रकाशन एक मुद्दाम विधान आहे: सार्वजनिक प्रशासन, उद्योग आणि एरोस्पेस यासारख्या नियमन केलेल्या क्षेत्रांमध्ये सार्वभौम तैनाती, मॉडेल कोठे प्रशिक्षित केले गेले हे जाणून घेणे, कोणत्या डेटावर आणि कोणत्या कायदेशीर चौकटीच्या अंतर्गत असणे ही चांगली नसून खरेदीची आवश्यकता आहे.

कोलिब्री म्हणजे नेमकं काय

कोलिब्री, ज्याला तांत्रिक सामग्रीमध्ये कोलिब्री-1 असे संबोधले जाते, हा द्विभाषिक इंग्रजी-जर्मन एमओई ट्रान्सफॉर्मर आहे जो अलेफ अल्फा म्हणतो की जर्मनीमधील संघांनी शेवटपर्यंत विकसित केला आहे. कंपनीच्या तांत्रिक संशोधन अहवालानुसार, टीमने संपूर्ण पाइपलाइन नियंत्रित केली — डेटा, आर्किटेक्चर, प्रशिक्षण पायाभूत सुविधा, पोस्ट-ट्रेनिंग आणि मूल्यांकन — दुसऱ्या लॅबच्या चेकपॉईंटपासून सुरू होण्याऐवजी.

प्रशिक्षण जर्मनी आणि फिनलंडमध्ये असलेल्या पायाभूत सुविधांवर चालले. डिझाईन प्रक्रिया स्पष्टपणे EU जनरल-पर्पज AI कोड ऑफ प्रॅक्टिस, EU AI कायदा आणि GDPR आणि अलेफ अल्फा हे त्या संहितेचे स्वाक्षरी करणारे आहे. कंपनीचे म्हणणे आहे की तिची डेटा पाइपलाइन प्रशिक्षणापूर्वी वैयक्तिक डेटा सुधारित करते, एक तपशील थेट सार्वजनिक क्षेत्रातील खरेदीदारांसाठी आहे जे कायदेशीररित्या अस्पष्ट मूळ मॉडेलमध्ये नागरिक डेटा फीड करू शकत नाहीत.

हे एकाच GPU वर चालते

उपयोजनता स्पष्टपणे डिझाइनची मर्यादा होती, नंतरचा विचार नाही. FP8 चेकपॉईंटचे वजन अंदाजे 78GB आहे आणि ते एकाच NVIDIA B200, B300, किंवा H200 वर चालते — किंवा दोन H100 SXM5 GPU वर — समर्पित कोलिब्री तर्क आणि टूल-कॉल पार्सरसह vLLM द्वारे सर्व्ह केले जाते. 78-अब्ज-पॅरामीटर मॉडेलसाठी, ते एक माफक हार्डवेअर फूटप्रिंट आहे, आणि हे विरळ MoE डिझाइनचे थेट मोबदला आहे: प्रति टोकन केवळ 3.46 अब्ज पॅरामीटर्ससह, अनुमान खर्च एकूण ऐवजी सक्रिय पॅरामीटर गणनाचा मागोवा घेतो.

विरळ तज्ञ आणि संकरित लक्ष

हुड अंतर्गत, कोलिब्री 2,560 च्या मॉडेल रुंदीसह 50 ट्रान्सफॉर्मर ब्लॉक्स स्टॅक करते. प्रत्येक MoE लेयर सर्व 384 राउटेड तज्ञांना सिग्मॉइड राउटरने स्कोअर करतो, प्रत्येक टोकन टॉप 6 ला पाठवतो आणि नेहमी 1 सामायिक तज्ञ त्यांच्यासोबत चालवतो. एक्स्पर्ट क्वांटाइल बॅलन्सिंग आणि लोड-एरर इंजेक्शन — या दोन तंत्रांचा वापर करून एक्सपर्ट लोड संतुलित केला जातो ज्यामध्ये अक्षर-सूप नाव आहेत - जे राउटरला मूठभर तज्ञांवर सर्व ट्रॅफिक कोसळण्यापासून रोखतात.

आर्किटेक्चर अधिक मनोरंजक बनते त्याकडे लक्ष द्या. कोलिब्री 48 क्वेरी हेड आणि 4 KV हेडसह गटबद्ध-क्वेरी लक्ष वापरते, परंतु स्तर एकसमान नाहीत: प्रत्येक पाचवा ब्लॉक पोझिशनल एन्कोडिंगशिवाय पूर्ण लक्ष वापरतो, तर इतर 40 ब्लॉक्स RoPE सह, 512 पूर्वीच्या टोकनवर स्लाइडिंग-विंडो लक्ष वापरतात. व्यावहारिक परिणाम म्हणजे मेमरी कार्यक्षमता — स्लाइडिंग-विंडो लेयर्समध्ये एक निश्चित-आकाराचा KV कॅशे असतो, म्हणून 50 पैकी फक्त 10 स्तर संदर्भ लांबीसह वाढतात. जुळलेल्या गणनेवर, अलेफ अल्फा अहवाल देतो की संकरित डिझाइन समतुल्य पूर्ण-लक्ष मॉडेलपेक्षा चारपट लांब अनुक्रमांना समर्थन देते. अशाप्रकारे या आकाराचे मॉडेल विदेशी पायाभूत सुविधांशिवाय एक-दशलक्ष-टोकन संदर्भ विंडोचा दावा करते.

जर्मनसाठी बनवलेले टोकनायझर

बऱ्याच फ्रंटियर टोकनायझर्सने जर्मन भाषेला एक विचार म्हणून हाताळले आहे, त्याचे लांब कंपाउंड शब्द तुकड्यांमध्ये विभाजित करतात जे टोकन संख्या आणि प्रभावी खर्च वाढवतात. Aleph Alpha ने UniBPE सोबत थेट हल्ला केला, 128,000-टोकन शब्दसंग्रह जो BPE प्रमाणे विलीनीकरण बनवतो परंतु प्रत्येक विलीनीकरणाला Unigram तोटा करून स्कोअर करतो.

संख्या केस बनवतात. जर्मन मजकूरावर, कोलिब्रीचा टोकनायझर 4.90 बाइट्स प्रति टोकन, विरुद्ध GPT-5 टोकनायझरसाठी 4.35 पर्यंत पोहोचतो — म्हणजे जर्मन वेब मजकुरावर 11.2 टक्के कमी टोकन्स. इंग्रजीवर, कोलिब्री प्रत्यक्षातही पुढे येते, जीपीटी-५ च्या ४.६७ विरुद्ध ४.५८ बाइट्स प्रति टोकन. टोकनद्वारे पैसे देणाऱ्या एंटरप्राइझ ग्राहकांसाठी, प्रत्येक जर्मन-भाषेच्या वर्कलोडवर ही थेट सूट आहे.

सीमावर्ती स्तरावर प्रशिक्षित

कोलिब्रीच्या मागे चाललेले प्रशिक्षण भरीव आहे. प्री-ट्रेनिंगमध्ये 768 NVIDIA B200 GPU वर 20 ट्रिलियन टोकन्स समाविष्ट आहेत, त्यानंतर 65,536-टोकन अनुक्रम लांबीवर 3.44 ट्रिलियन मिड-ट्रेनिंग टोकन्स आहेत. पाइपलाइन नंतर पर्यवेक्षित फाइन-ट्यूनिंग आणि मजबुतीकरण शिक्षण टप्प्यांतून अंतिम सूचना-अनुसरण, तर्क-सक्षम मॉडेल तयार करण्यासाठी पुढे सरकली. कंपनीने प्रक्रिया कव्हर करणारा एक तांत्रिक संशोधन अहवाल प्रकाशित केला आहे, युरोपियन लॅबसाठी प्रकटीकरणाची एक असामान्य पातळी आणि एक स्पष्टपणे नियमन केलेल्या ग्राहकांसह विश्वास निर्माण करण्याच्या उद्देशाने आहे.

युरोपच्या एआय पुशसाठी याचा अर्थ काय आहे

कोलिब्री अशा मार्केटमध्ये प्रवेश करते जिथे अमेरिकन आणि चिनी प्रयोगशाळेतील ओपन-वेट रिलीझ संभाषणावर वर्चस्व गाजवतात आणि जिथे युरोपियन सरकारे डिजिटल सार्वभौमत्वाबद्दल अधिकाधिक आवाज उठवत आहेत. Aleph Alpha चा पैज असा आहे की त्या बाजाराचा एक तुकडा — मंत्रालये, संरक्षण-लगतचा उद्योग, गंभीर पायाभूत सुविधा — अशा मॉडेलसाठी पैसे देतील जे केवळ ओपन-वेट नसून डेटा हाताळणी, प्रशिक्षण स्थान आणि कायदेशीर पवित्रा यामध्ये युरोपियन आहे.

ती पैज फेडते की नाही हे प्रकाशन अद्याप उत्तर देत नसलेल्या प्रश्नांवर अवलंबून आहे: मानक मूल्यमापनांवरील फ्रंटियर ओपन मॉडेल्सच्या विरूद्ध कोलिब्री बेंचमार्क कसा बनतो आणि त्याच्या आसपास टूलिंगची परिसंस्था किती लवकर तयार होते. रिलीझने काय स्थापित केले आहे की एक पूर्ण-स्टॅक, फ्रंटियर-समीप प्रशिक्षण क्षमता आता EU मध्ये अस्तित्त्वात आहे, ज्यामध्ये कागदपत्रे जुळतील. GDPR आणि AI कायद्याने बांधील असलेल्या संस्थांसाठी, ते संयोजन लीडरबोर्ड स्थानांपेक्षा अधिक महत्त्वाचे असू शकते.

---

एआयच्या पुढे राहा

नवीनतम AI बातम्या, विश्लेषण आणि यश मिळवा — सर्व एकाच ठिकाणी.

अधिक AI बातम्या वाचा →