तज्ञांचे डिझाइन लहान-पण-विस्तृत मिश्रण
MarkTechPost मधील तपशीलवार ब्रेकडाउननुसार, Instella-MoE-16B-A3B हे डीकोडर-केवळ MoE मॉडेल आहे ज्यामध्ये 16 अब्ज एकूण पॅरामीटर्स आहेत जे प्रति टोकन फक्त 2.8 अब्ज सक्रिय करतात. त्याच्या 27 लेयर्समध्ये 2048 चा छुपा आकार, 16 अटेन्शन हेड आणि 128,896-टोकन शब्दसंग्रहासह 2 सामायिक तज्ञ आणि 64 च्या पूलमधून निवडलेले 6 रूट केलेले तज्ञ वापरतात. एक मल्टी-टोकन अंदाज उद्देश प्री-ट्रेनिंग आणि मिड-ट्रेनिंग दोन्ही दरम्यान वापरला जातो.ते विरळ आर्किटेक्चर — जिथे नेटवर्कचा एक छोटासा तुकडा प्रत्येक टोकनसाठी "जागतो" — स्वस्त-टू-रन ओपन मॉडेल्समागे तेच कार्यक्षमतेचे तर्क आहे ज्याने गेल्या वर्षभरात बाजाराला आकार दिला आहे. AMD ने Nemotron-CC-v2, MegaMath, FineMath, RefineCode, आणि TxT360 यासह खुल्या कॉर्पोरामधून काढलेल्या 7.1 ट्रिलियन टोकन वर मॉडेलला प्रशिक्षण दिले, त्यानंतर Dolma3 Dolmino 100B वर एक मध्यम-प्रशिक्षण स्टेज चालवले जे तीन डेटा व्हेरियंटमध्ये एकत्र केले गेले. दीर्घ-संदर्भ स्टेज YaRN वापरून विंडोला 4K ते 64K टोकन पर्यंत पसरवते.
दोन प्रणाली-स्तरीय नवकल्पना
रिलीझमध्ये दोन स्ट्रक्चरल निवडी आहेत ज्यांना AMD अर्थपूर्ण अभियांत्रिकी विजय म्हणून हायलाइट करते. पहिले गेटेड मल्टी-हेड लेटेंट अटेंशन (गेट एमएलए) आहे, जे मल्टी-हेड लेटेंट अटेंशनमध्ये हलके शिकलेले आउटपुट गेट जोडते. समर्पित रेखीय प्रक्षेपण एक इनपुट-कंडिशन गेट मिळवते जे आउटपुट प्रोजेक्शनच्या आधी गुणाकाराने लागू केले जाते.
दुसरी, FarSkip-Collective, एक कनेक्टिव्हिटी योजना आहे जी कालबाह्य आणि आंशिक सक्रियता MoE आणि लक्ष स्तरांमध्ये पास करते, गणनेसह तज्ञ-समांतर संप्रेषण ओव्हरलॅप करते. AMD 12.7% प्री-ट्रेनिंग स्पीडअप आणि प्रथम टोकनसाठी वेळेत 39.2% कपात** पर्यंत तज्ञ समांतरतेसह सेवा देत असल्याचा अहवाल देते. किंमत-कार्यक्षमतेवर हार्डवेअर पिच करणाऱ्या कंपनीसाठी, खरेदीदाराला तेच नंबर पहायचे आहेत.
पूर्णपणे खुल्या मॉडेलसाठी मजबूत बेंचमार्क
बेस चेकपॉईंटवर, संपूर्ण मूल्यांकनांमध्ये Instella-MoE ची सरासरी 76.7 आहे, ज्याला AMD पूर्णपणे खुल्या मॉडेल्समध्ये सर्वात मजबूत परिणाम म्हणते. ते Moonlight-16B-A3B (76.2), SmolLM3-3B-बेस (70.5), OLMo-3-7B (70.1), आणि OLMoE-1B-7B (61.9) च्या पुढे ठेवते, तरीही ते Qwen3.5-4B-बेस (79.5) च्या मागे आहे. हे 86.5 च्या स्कोअरसह WinoGrande वर आघाडीवर आहे आणि HumanEval+ वर 65.7 पोस्ट करते. दीर्घ संदर्भातील कार्यांसाठी, हेल्मेटवर सरासरी 41.5 आणि RULER वर 79.4 आहे.
प्रशिक्षणानंतरचे मॉडेल आणखी तीक्ष्ण करते. सरासरी स्कोअर पर्यवेक्षित फाइन-ट्यूनिंगनंतर 71.58 वरून DPO नंतर 72.67 आणि "थिंक" कॉन्फिगरेशनमध्ये 73.22 वर चढला, ज्याने Olmo3-7B-थिंक (71.97), Gemma-4-E4B Think (70.47), आणि Qwen3.395). निर्देशानुसार, IFEval 77.08 वरून 83.70 पर्यंत वाढतो.
प्रशिक्षणानंतरची कृती स्वतःच लक्षणीय आहे. Dolci-Think-SFT-7B आणि Nemotron मिश्रणावर SFT नंतर, AMD राउटर बायस अपडेट्ससह DPO चालवते आणि ऱ्हास टाळण्यासाठी सहायक लोड-बॅलेंसिंग लॉस अक्षम केले आहे. मजबुतीकरण शिक्षण नंतर AMD च्या माइल्स फ्रेमवर्क मध्ये पुढे जाते: सूचनांचे 1,400 चरण- खालील RLVR, त्यानंतर मल्टी-टीचर ऑन-पॉलिसी डिस्टिलेशन जे गणित किंवा कोड कार्यप्रदर्शनाचा त्याग न करता नफा परत मिळवतात.
परवाना पकडणे
व्यावसायिक वापरकर्त्यांसाठी एक चेतावणी आहे. मॉडेलचे वजन संशोधनरेल परवान्याअंतर्गत पाठवले जाते, जे केवळ शैक्षणिक आणि संशोधन उद्देशांसाठी वापरण्यास प्रतिबंधित करते, त्यामुळे Instella-MoE उत्पादन उपयोजनांसाठी ड्रॉप-इन मॉडेल नाही. प्रशिक्षण कोडबेस, तथापि, MIT परवानाकृत आहे, आणि ती अधिक पुन्हा वापरता येण्याजोगी मालमत्ता आहे — ते इतर प्रयोगशाळांना AMD सिलिकॉनवरील प्रशिक्षणासाठी ठोस ब्लूप्रिंट देते.
एएमडीने प्रत्येक प्रशिक्षण टप्प्यातील संपूर्ण वजन, डेटा मिश्रण, प्रशिक्षण कॉन्फिगरेशन आणि हगिंग फेस कलेक्शन, गिटहब रेपॉजिटरी आणि त्याचा आरओसीएम ब्लॉगवर अनुमान कोड प्रकाशित केला आहे. मोकळेपणाची ती पातळी — प्रशिक्षण-स्टेज-दर-ट्रेनिंग-स्टेज, केवळ एक अंतिम चेकपॉईंट नाही — हे सामान्य ओपन-वेट रिलीझपासून "पूर्णपणे खुले" रिलीझ वेगळे करते.
हे बेंचमार्कच्या पलीकडे का महत्त्वाचे आहे
रिलीझचा सबटेक्स्ट हार्डवेअर स्पर्धा आहे. Nvidia चे CUDA इकोसिस्टम आणि H100-क्लास GPU हे फ्रंटियर मॉडेल प्रशिक्षणासाठी डीफॉल्ट सब्सट्रेट आहेत आणि आव्हानकर्त्यांनी त्यांचे प्रवेगक पूर्ण प्रशिक्षण स्टॅक हाताळू शकतात हे सिद्ध करण्यासाठी अनेक वर्षे घालवली आहेत. Instella-MoE ही एक विश्वासार्ह कलाकृती आहे जी AMD ची Instinct लाइन — आधीच हायपरस्केलर्स आणि नॅशनल लॅबद्वारे स्केलवर तैनात केलेली — अनुमान वर्कलोड्सपेक्षा जास्त करू शकते. जर AMD स्वतःच्या हार्डवेअरवर प्रशिक्षित स्पर्धात्मक खुल्या मॉडेल्सचे उत्पादन करत राहिल्यास, ते AI कॉम्प्युट मार्केटवरील Nvidia ची पकड तोडू पाहणाऱ्या खरेदीदारांसाठी केस मजबूत करते.
संशोधकांसाठी, आवाहन म्हणजे पारदर्शकता. पूर्णपणे उघडलेले प्रकाशन जे डेटा मिश्रण, मध्य-प्रशिक्षण मिश्रण, ऊर्धपातन धोरण आणि RL अभ्यासक्रमाचे दस्तऐवजीकरण करतात दुर्मिळ राहतात, आणि त्यांनी समुदायाला त्यासाठी प्रयोगशाळेचा शब्द घेण्याऐवजी दाव्यांचे ऑडिट आणि पुनरुत्पादन करू दिले. Instella-MoE एका लहान पण वाढत्या रोस्टरमध्ये सामील होतो — AMD च्या स्वतःच्या पूर्वीच्या Instella दाट मॉडेल्ससह — त्या मानकांना पुढे ढकलून.
AI च्या पुढे रहा
घडते तसे या प्रकारचे सखोल तांत्रिक कव्हरेज हवे आहे? नवीनतम AI घडामोडी साठी आमचे केंद्र बुकमार्क करा आणि रिलीज कधीही चुकवू नका.
अधिक एआय बातम्या वाचा →

