जर्मन एआई कंपनी एलेफ अल्फा ने कोलिब्री जारी किया है, जो जर्मन और अंग्रेजी के लिए शुरू से निर्मित एक ओपन-वेट मिक्सचर-ऑफ-एक्सपर्ट्स भाषा मॉडल है। मॉडल कुल 78.1 बिलियन मापदंडों को पैक करता है, लेकिन प्रति टोकन उनमें से केवल 3.46 बिलियन को सक्रिय करता है - लगभग 4.4 प्रतिशत - और हगिंग फेस पर अनुमेय अपाचे 2.0 लाइसेंस के तहत भेजा जाता है। यह संदर्भ के 1,048,576 टोकन तक स्वीकार करता है और उपयोगकर्ताओं को प्रति अनुरोध तर्क प्रयास सेट करने देता है। ओपन-वेट इकोसिस्टम पर नज़र रखने वाले पाठकों के लिए, यह हमारे नवीनतम एआई विकास के साथ आता है।

यह रिलीज़ इस बारे में एक जानबूझकर दिया गया बयान है कि एलेफ़ अल्फ़ा अपने बाज़ार को कहाँ देखता है: सार्वजनिक प्रशासन, उद्योग और एयरोस्पेस जैसे विनियमित क्षेत्रों में संप्रभु तैनाती, जहाँ यह जानना कि वास्तव में एक मॉडल को कहाँ प्रशिक्षित किया गया था, किस डेटा पर और किस कानूनी ढांचे के तहत एक अच्छी बात नहीं है बल्कि एक खरीद की आवश्यकता है।

वास्तव में कोलिब्री क्या है

कोलिब्री, जिसे तकनीकी सामग्रियों में कोलिब्री-1 कहा जाता है, एक द्विभाषी अंग्रेजी-जर्मन एमओई ट्रांसफार्मर है जिसके बारे में एलेफ अल्फा का कहना है कि इसे जर्मनी में टीमों द्वारा शुरू से अंत तक विकसित किया गया था। कंपनी की तकनीकी अनुसंधान रिपोर्ट के अनुसार, टीम ने किसी अन्य प्रयोगशाला के चेकपॉइंट से शुरू करने के बजाय पूरी पाइपलाइन - डेटा, वास्तुकला, प्रशिक्षण बुनियादी ढांचे, प्रशिक्षण के बाद और मूल्यांकन को नियंत्रित किया।

प्रशिक्षण जर्मनी और फिनलैंड में स्थित बुनियादी ढांचे पर चला। डिज़ाइन प्रक्रिया ने स्पष्ट रूप से ईयू सामान्य प्रयोजन एआई अभ्यास संहिता, ईयू एआई अधिनियम और जीडीपीआर के अनुपालन को लक्षित किया है, और एलेफ अल्फा उस कोड का एक हस्ताक्षरकर्ता है। कंपनी का कहना है कि उसकी डेटा पाइपलाइन प्रशिक्षण से पहले व्यक्तिगत डेटा को संशोधित करती है, यह विवरण सीधे सार्वजनिक क्षेत्र के खरीदारों पर केंद्रित है जो कानूनी तौर पर नागरिक डेटा को अस्पष्ट उत्पत्ति के मॉडल में फीड नहीं कर सकते हैं।

यह एक ही GPU पर चलता है

तैनाती स्पष्ट रूप से एक डिज़ाइन बाधा थी, कोई बाद का विचार नहीं। FP8 चेकपॉइंट का वजन लगभग 78GB है और यह एकल NVIDIA B200, B300, या H200 - या दो H100 SXM5 GPU पर चलता है - जो समर्पित कोलिब्री रीजनिंग और टूल-कॉल पार्सर्स के साथ vLLM के माध्यम से परोसा जाता है। 78-बिलियन-पैरामीटर मॉडल के लिए, यह एक मामूली हार्डवेयर पदचिह्न है, और यह विरल एमओई डिज़ाइन का प्रत्यक्ष भुगतान है: प्रति टोकन केवल 3.46 बिलियन पैरामीटर सक्रिय होने के साथ, अनुमान लागत कुल के बजाय सक्रिय पैरामीटर गिनती को ट्रैक करती है।

विरल विशेषज्ञ और मिश्रित ध्यान

हुड के नीचे, कोलिब्री 2,560 की मॉडल चौड़ाई के साथ 50 ट्रांसफार्मर ब्लॉकों को ढेर करता है। प्रत्येक MoE परत सिग्मॉइड राउटर के साथ सभी 384 रूट किए गए विशेषज्ञों को स्कोर करती है, प्रत्येक टोकन को शीर्ष 6 में भेजती है, और हमेशा उनके साथ 1 साझा विशेषज्ञ को चलाती है। विशेषज्ञ लोड को वर्णमाला-सूप नामों के साथ दो तकनीकों का उपयोग करके संतुलित किया जाता है - सटीक क्वांटाइल बैलेंसिंग और लोड-त्रुटि इंजेक्शन - जो राउटर को मुट्ठी भर विशेषज्ञों पर सभी ट्रैफ़िक को ढहने से रोकता है।

ध्यान वहाँ है जहाँ वास्तुकला अधिक दिलचस्प हो जाती है। कोलिब्री 48 क्वेरी हेड्स और 4 केवी हेड्स के साथ समूहीकृत-क्वेरी ध्यान का उपयोग करता है, लेकिन परतें एक समान नहीं हैं: प्रत्येक पांचवां ब्लॉक स्थितीय एन्कोडिंग के बिना पूर्ण ध्यान का उपयोग करता है, जबकि अन्य 40 ब्लॉक RoPE के साथ 512 पूर्ववर्ती टोकन पर स्लाइडिंग-विंडो ध्यान का उपयोग करते हैं। व्यावहारिक परिणाम मेमोरी दक्षता है - स्लाइडिंग-विंडो परतें एक निश्चित आकार के केवी कैश रखती हैं, इसलिए 50 में से केवल 10 परतें संदर्भ लंबाई के साथ बढ़ती हैं। मिलान की गई गणना पर, एलेफ़ अल्फा रिपोर्ट करता है कि हाइब्रिड डिज़ाइन समतुल्य पूर्ण-ध्यान मॉडल की तुलना में चार गुना लंबे अनुक्रमों का समर्थन करता है। इस प्रकार इस आकार का एक मॉडल विदेशी बुनियादी ढांचे के बिना दस लाख-टोकन संदर्भ विंडो का दावा करता है।

जर्मन के लिए बनाया गया एक टोकनाइज़र

अधिकांश फ्रंटियर टोकनाइज़र जर्मन को बाद के विचार के रूप में मानते हैं, इसके लंबे यौगिक शब्दों को टुकड़ों में विभाजित करते हैं जो टोकन गिनती और प्रभावी लागत को बढ़ाते हैं। एलेफ अल्फा ने इस पर सीधे यूनीबीपीई के साथ हमला किया, एक 128,000-टोकन शब्दावली जो बीपीई की तरह मर्ज बनाती है लेकिन प्रत्येक मर्ज को यूनीग्राम हानि से स्कोर करती है।

संख्याएँ मामला बनाती हैं। जर्मन टेक्स्ट पर, कोलिब्री का टोकनाइज़र प्रति टोकन 4.90 बाइट्स तक पहुँच जाता है, जबकि जीपीटी-5 टोकनाइज़र के लिए 4.35 - यानी जर्मन वेब टेक्स्ट पर 11.2 प्रतिशत कम टोकन। अंग्रेजी में, कोलिब्री वास्तव में GPT-5 के 4.67 के मुकाबले 4.58 बाइट्स प्रति टोकन पर आगे आता है। टोकन द्वारा भुगतान करने वाले उद्यम ग्राहकों के लिए, यह प्रत्येक जर्मन भाषा के कार्यभार पर सीधी छूट है।

सीमांत पैमाने पर प्रशिक्षित

कोलिब्री के पीछे चलने वाला प्रशिक्षण पर्याप्त है। प्री-ट्रेनिंग में 768 NVIDIA B200 GPU पर 20 ट्रिलियन टोकन शामिल थे, इसके बाद 65,536-टोकन अनुक्रम लंबाई पर 3.44 ट्रिलियन मिड-ट्रेनिंग टोकन शामिल थे। इसके बाद पाइपलाइन अंतिम निर्देश-पालन, तर्क-सक्षम मॉडल का निर्माण करने के लिए पर्यवेक्षित फाइन-ट्यूनिंग और सुदृढीकरण सीखने के चरणों से गुजरी। कंपनी ने इस प्रक्रिया को कवर करते हुए एक तकनीकी अनुसंधान रिपोर्ट प्रकाशित की है, जो एक यूरोपीय प्रयोगशाला के लिए असामान्य स्तर का खुलासा है और इसका उद्देश्य स्पष्ट रूप से विनियमित ग्राहकों के साथ विश्वास बनाना है।

यूरोप के एआई पुश के लिए इसका क्या मतलब है

कोलिब्री एक ऐसे बाजार में प्रवेश कर रहा है जहां अमेरिकी और चीनी प्रयोगशालाओं से ओपन-वेट रिलीज बातचीत पर हावी है, और जहां यूरोपीय सरकारें डिजिटल संप्रभुता के बारे में तेजी से मुखर हो गई हैं। एलेफ़ अल्फ़ा की शर्त यह है कि उस बाज़ार का एक हिस्सा - मंत्रालय, रक्षा-आसन्न उद्योग, महत्वपूर्ण बुनियादी ढाँचा - एक ऐसे मॉडल के लिए भुगतान करेगा जो न केवल ओपन-वेट है बल्कि अपने डेटा हैंडलिंग, प्रशिक्षण स्थान और कानूनी मुद्रा में यूरोपीय रूप से यूरोपीय है।

वह दांव सफल होता है या नहीं, यह उन सवालों पर निर्भर करता है जिनका रिलीज ने अभी तक उत्तर नहीं दिया है: कोलिब्री मानक मूल्यांकन पर फ्रंटियर ओपन मॉडल के मुकाबले कैसे बेंचमार्क करता है, और इसके चारों ओर टूलींग का एक पारिस्थितिकी तंत्र कितनी जल्दी बनता है। विज्ञप्ति यह स्थापित करती है कि एक पूर्ण-स्टैक, सीमांत-आसन्न प्रशिक्षण क्षमता अब यूरोपीय संघ के अंदर मौजूद है, जिसका मिलान करने के लिए कागजी कार्रवाई है। जीडीपीआर और एआई अधिनियम से बंधे संगठनों के लिए, वह संयोजन लीडरबोर्ड पदों से अधिक मायने रख सकता है।

---

एआई से आगे रहें

नवीनतम एआई समाचार, विश्लेषण और सफलताएँ प्राप्त करें - सभी एक ही स्थान पर।

अधिक AI समाचार पढ़ें →