AMD ने Instella-MoE-16B-A3B जारी किया है, जो पूरी तरह से खुला मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) भाषा मॉडल है, जो अपने स्वयं के इंस्टिंक्ट MI300X और MI325X GPU पर शुरू से प्रशिक्षित है। यह रिलीज सिलिकॉन के बारे में उतना ही बयान है जितना कि यह सॉफ्टवेयर के बारे में है: प्रत्येक प्रशिक्षण चरण, डेटा मिश्रण और कॉन्फ़िगरेशन को प्रकाशित करके, एएमडी यह प्रदर्शित कर रहा है कि उसके डेटा-सेंटर त्वरक फ्रंटियर-क्लास ओपन मॉडल शुरू से अंत तक बना सकते हैं - क्षेत्र एनवीडिया लंबे समय से हावी है। यह ओपन-वेट रेस में अधिक स्पष्ट चालों में से एक है जिसे हम अपने [ब्रेकिंग एआई न्यूज] (https://aibuzzwire.news) में ट्रैक करते हैं।

विशेषज्ञों का एक छोटा लेकिन विस्तृत मिश्रण डिज़ाइन

मार्कटेकपोस्ट में विस्तृत विवरण के अनुसार, इंस्टेला-एमओई-16बी-ए3बी एक डिकोडर-केवल एमओई मॉडल है जिसमें 16 बिलियन कुल पैरामीटर हैं जो केवल 2.8 बिलियन प्रति टोकन सक्रिय करते हैं। इसकी 27 परतों में से प्रत्येक में 2048 के छिपे आकार, 16 ध्यान प्रमुखों और 128,896-टोकन शब्दावली के साथ 2 साझा विशेषज्ञों और 64 के पूल से चुने गए 6 रूटेड विशेषज्ञों का उपयोग किया गया है। एक मल्टी-टोकन भविष्यवाणी उद्देश्य का उपयोग पूर्व-प्रशिक्षण और मध्य-प्रशिक्षण दोनों के दौरान किया जाता है।

वह विरल वास्तुकला - जहां प्रत्येक टोकन के लिए नेटवर्क का एक छोटा सा टुकड़ा "जागता है" - सस्ते-से-चलने वाले खुले मॉडल के पीछे वही दक्षता तर्क है जिसने पिछले वर्ष में बाजार को नया आकार दिया है। एएमडी ने नेमोट्रॉन-सीसी-वी2, मेगामैथ, फाइनमैथ, रिफाइनकोड और टीएक्सटी360 सहित ओपन कॉर्पोरा से तैयार किए गए 7.1 ट्रिलियन टोकन पर मॉडल को प्रशिक्षित किया, फिर तीन डेटा वेरिएंट में डोलमा3 डोलमिनो 100बी पर एक मध्य-प्रशिक्षण चरण चलाया, जिन्हें वजन औसत द्वारा मर्ज किया गया था। एक लंबा-संदर्भ चरण YaRN का उपयोग करके विंडो को 4K से 64K टोकन तक फैलाता है।

दो सिस्टम-स्तरीय नवाचार

रिलीज़ में दो संरचनात्मक विकल्प हैं जिन्हें एएमडी सार्थक इंजीनियरिंग की जीत के रूप में उजागर करता है। पहला है गेटेड मल्टी-हेड लेटेंट अटेंशन (गेटेड एमएलए), जो मल्टी-हेड लेटेंट अटेंशन में एक हल्का सीखा हुआ आउटपुट गेट जोड़ता है। एक समर्पित रैखिक प्रक्षेपण एक इनपुट-वातानुकूलित गेट प्राप्त करता है जिसे आउटपुट प्रक्षेपण से पहले गुणात्मक रूप से लागू किया जाता है।

दूसरा, फ़ारस्किप-कलेक्टिव, एक कनेक्टिविटी योजना है जो एमओई और ध्यान परतों में पुरानी और आंशिक सक्रियता को पार करती है, गणना के साथ विशेषज्ञ-समानांतर संचार को ओवरलैप करती है। एएमडी विशेषज्ञ समानता के साथ सेवा करते समय 12.7% पूर्व-प्रशिक्षण गति और पहले टोकन के समय में 39.2% की कमी की रिपोर्ट करता है। मूल्य-प्रदर्शन पर अपने हार्डवेयर को पेश करने वाली कंपनी के लिए, ये वही संख्याएं हैं जिन्हें एक खरीदार देखना चाहता है।

पूरी तरह से खुले मॉडल के लिए मजबूत बेंचमार्क

बेस चेकपॉइंट पर, इंस्टेला-एमओई का औसत मूल्यांकन में 76.7 है, जिसे एएमडी पूरी तरह से खुले मॉडल के बीच सबसे मजबूत परिणाम कहता है। यह इसे मूनलाइट-16B-A3B (76.2), SmolLM3-3B-बेस (70.5), OLMo-3-7B (70.1), और OLMoE-1B-7B (61.9) से आगे रखता है, हालांकि यह अभी भी Qwen3.5-4B-बेस (79.5) से पीछे है। यह 86.5 के स्कोर के साथ विनोग्रांडे पर आगे है और ह्यूमनएवल+ पर 65.7 अंक के साथ आगे है। लंबे संदर्भ वाले कार्यों के लिए, HELMET पर इसका औसत 41.5 और RULER पर 79.4 है।

प्रशिक्षण के बाद मॉडल को और अधिक निखारा जाता है। डीपीओ के बाद पर्यवेक्षित फाइन-ट्यूनिंग के बाद औसत स्कोर 71.58 से बढ़कर 72.67 हो गया और "थिंक" कॉन्फ़िगरेशन में 73.22 हो गया, और ओल्मो3-7बी-थिंक (71.97), जेम्मा-4-ई4बी थिंक (70.47), और क्वेन3.5-4बी (69.73) को पछाड़ दिया। निर्देश का पालन करने पर, IFEval 77.08 से बढ़कर 83.70 हो जाता है।

प्रशिक्षण के बाद का नुस्खा अपने आप में उल्लेखनीय है। डॉल्सी-थिंक-एसएफटी-7बी और नेमोट्रॉन मिश्रण पर एसएफटी के बाद, एएमडी गिरावट से बचने के लिए राउटर बायस अपडेट और सहायक लोड-बैलेंसिंग हानि अक्षम के साथ डीपीओ चलाता है। सुदृढीकरण सीखना फिर एएमडी के माइल्स फ्रेमवर्क के अंदर आगे बढ़ता है: अनुदेश-अनुवर्ती आरएलवीआर के 1,400 चरण, इसके बाद मल्टी-टीचर ऑन-पॉलिसी डिस्टिलेशन जो गणित या कोड प्रदर्शन का त्याग किए बिना लाभ को वापस लाता है।

लाइसेंसिंग पकड़

एक चेतावनी है जो व्यावसायिक उपयोगकर्ताओं के लिए मायने रखती है। मॉडल को ResearchRAIL लाइसेंस के तहत शिप किया जाता है, जो केवल शैक्षणिक और अनुसंधान उद्देश्यों तक उपयोग को प्रतिबंधित करता है, इसलिए इंस्टेला-एमओई उत्पादन तैनाती के लिए ड्रॉप-इन मॉडल नहीं है। हालाँकि, प्रशिक्षण कोडबेस MIT लाइसेंस प्राप्त है, और यह यकीनन अधिक पुन: प्रयोज्य संपत्ति है - यह अन्य प्रयोगशालाओं को AMD सिलिकॉन पर प्रशिक्षण के लिए एक ठोस खाका देता है।

एएमडी ने प्रत्येक प्रशिक्षण चरण, डेटा मिश्रण, प्रशिक्षण कॉन्फ़िगरेशन और हगिंग फेस संग्रह, गिटहब रिपोजिटरी और इसके आरओसीएम ब्लॉग में अनुमान कोड से पूर्ण वजन प्रकाशित किया है। खुलेपन का वह स्तर - प्रशिक्षण-चरण-दर-प्रशिक्षण-चरण, न कि केवल एक अंतिम चेकपॉइंट - वह है जो एक "पूरी तरह से खुले" रिलीज को एक सामान्य ओपन-वेट रिलीज से अलग करता है।

यह बेंचमार्क से परे क्यों मायने रखता है

रिलीज़ का उपपाठ हार्डवेयर प्रतियोगिता है। एनवीडिया का CUDA इकोसिस्टम और H100-क्लास जीपीयू फ्रंटियर मॉडल प्रशिक्षण के लिए डिफ़ॉल्ट सब्सट्रेट रहे हैं, और चुनौती देने वालों ने यह साबित करने में वर्षों बिताए हैं कि उनके त्वरक पूर्ण प्रशिक्षण स्टैक को संभाल सकते हैं। इंस्टेला-एमओई एक विश्वसनीय कलाकृति है कि एएमडी की इंस्टिंक्ट लाइन - पहले से ही हाइपरस्केलर्स और राष्ट्रीय प्रयोगशालाओं द्वारा बड़े पैमाने पर तैनात की गई है - अनुमान कार्यभार से अधिक कर सकती है। यदि एएमडी अपने स्वयं के हार्डवेयर पर प्रशिक्षित प्रतिस्पर्धी ओपन मॉडल का उत्पादन जारी रख सकता है, तो यह उन खरीदारों के लिए मामला मजबूत करता है जो एआई कंप्यूट बाजार पर एनवीडिया की पकड़ को तोड़ना चाहते हैं।

शोधकर्ताओं के लिए अपील पारदर्शिता है। पूरी तरह से खुली रिलीज़ जो डेटा मिश्रण, मध्य-प्रशिक्षण मिश्रण, आसवन रणनीति और आरएल पाठ्यक्रम का दस्तावेजीकरण करती हैं, दुर्लभ हैं, और वे समुदाय को इसके लिए प्रयोगशाला का शब्द लेने के बजाय ऑडिट करने और दावों को पुन: पेश करने देते हैं। इंस्टेला-एमओई एक छोटे लेकिन बढ़ते रोस्टर में शामिल हो गया है - जिसमें एएमडी के अपने पहले के इंस्टेला डेंस मॉडल भी शामिल हैं - जो उस मानक को आगे बढ़ा रहे हैं।

एआई से आगे रहें

क्या आप इस प्रकार का गहन तकनीकी कवरेज चाहते हैं जैसा कि होता है? नवीनतम एआई विकास के लिए हमारे हब को बुकमार्क करें और कोई भी रिलीज़ न चूकें।

अधिक AI समाचार पढ़ें →