ஒரு சிறிய ஆனால் பரந்த கலவையான நிபுணர்களின் வடிவமைப்பு
MarkTechPost இல் உள்ள விரிவான முறிவின்படி, Instella-MoE-16B-A3B என்பது ஒரு டோக்கனுக்கு 2.8 பில்லியன் மட்டுமே செயல்படுத்தும் 16 பில்லியன் மொத்த அளவுருக்கள் கொண்ட ஒரு டிகோடர்-மட்டும் MoE மாடலாகும். அதன் 27 அடுக்குகளில் ஒவ்வொன்றும் 2 பகிரப்பட்ட நிபுணர்கள் மற்றும் 64 குழுவிலிருந்து தேர்ந்தெடுக்கப்பட்ட 6 வழித்தட நிபுணர்கள், 2048 இன் மறைக்கப்பட்ட அளவு, 16 கவனம் தலைகள் மற்றும் 128,896-டோக்கன் சொற்களஞ்சியம் ஆகியவற்றைப் பயன்படுத்துகிறது. ஒரு மல்டி-டோக்கன் முன்கணிப்பு** நோக்கம் முன் பயிற்சி மற்றும் இடைப்பட்ட பயிற்சியின் போது பயன்படுத்தப்படுகிறது.அந்த அரிதான கட்டிடக்கலை - ஒவ்வொரு டோக்கனுக்கும் நெட்வொர்க்கின் ஒரு சிறிய துண்டு "விழிக்கிறது" - கடந்த ஆண்டில் சந்தையை மறுவடிவமைத்த மலிவான-இயக்கக்கூடிய திறந்த மாடல்களுக்குப் பின்னால் உள்ள அதே செயல்திறன் தர்க்கமாகும். AMD ஆனது Nemotron-CC-v2, MegaMath, FineMath, RefineCode மற்றும் TxT360 உள்ளிட்ட திறந்த கார்போராவிலிருந்து வரையப்பட்ட 7.1 டிரில்லியன் டோக்கன்களில் மாடலைப் பயிற்றுவித்தது, பின்னர் Dolma3 Dolmino 100B இல் மூன்று தரவு மாறுபாடுகளில் சராசரியாக இணைக்கப்பட்ட மூன்று தரவு மாறுபாடுகளில் ஒரு இடைநிலைப் பயிற்சியை நடத்தியது. YaRN ஐப் பயன்படுத்தி ஒரு நீண்ட சூழல் நிலை சாளரத்தை 4K இலிருந்து 64K டோக்கன்கள் வரை நீட்டிக்கிறது.
இரண்டு அமைப்புகள்-நிலை கண்டுபிடிப்புகள்
இந்த வெளியீடு இரண்டு கட்டமைப்புத் தேர்வுகளைக் கொண்டுள்ளது, அவை அர்த்தமுள்ள பொறியியல் வெற்றிகளாக AMD முன்னிலைப்படுத்துகின்றன. முதலாவது கேட்டட் மல்டி-ஹெட் லேட்டன்ட் அட்டென்ஷன் (கேட்டட் எம்எல்ஏ), இது மல்டி-ஹெட் லேட்டன்ட் அட்டென்ஷனுக்கு இலகுரக கற்றறிந்த வெளியீட்டு வாயிலைச் சேர்க்கிறது. ஒரு பிரத்யேக லீனியர் ப்ரொஜெக்ஷன் ஒரு உள்ளீடு-நிபந்தனை செய்யப்பட்ட வாயிலைப் பெறுகிறது, இது வெளியீட்டுத் திட்டத்திற்கு முன் பெருக்கல் முறையில் பயன்படுத்தப்படுகிறது.
இரண்டாவது, FarSkip-கலெக்டிவ் என்பது, காலாவதியான மற்றும் பகுதியளவு செயல்பாடுகளை MoE மற்றும் கவனம் அடுக்குகளுக்குள் அனுப்பும் ஒரு இணைப்புத் திட்டமாகும். AMD ஆனது 12.7% பயிற்சிக்கு முந்தைய வேகத்தை மற்றும் 39.2% வரை முதல் டோக்கன் வரை நிபுணத்துவ இணையாக சேவை செய்யும் போது குறைகிறது. ஒரு நிறுவனம் அதன் வன்பொருளை விலை-செயல்திறன் மீது பிட்ச் செய்ய, வாங்குபவர் பார்க்க விரும்பும் எண்கள்.
முழுமையாக திறந்த மாதிரிக்கான வலுவான வரையறைகள்
அடிப்படை சோதனைச் சாவடியில், Instella-MoE சராசரியாக 76.7 மதிப்பீட்டில் உள்ளது, இது AMD ஆனது முழுமையாக திறந்த மாதிரிகளில் வலுவான முடிவு என்று அழைக்கிறது. இது Moonlight-16B-A3B (76.2), SmolLM3-3B-Base (70.5), OLMo-3-7B (70.1), மற்றும் OLMoE-1B-7B (61.9) ஆகியவற்றை விட முன்னணியில் உள்ளது, இருப்பினும் இது இன்னும் Qwen3.5-4B-Base (79.5) ஐப் பின்தொடர்கிறது. இது 86.5 மதிப்பெண்களுடன் வினோகிராண்டில் முன்னணியில் உள்ளது மற்றும் HumanEval+ இல் 65.7 ஐப் பதிவு செய்கிறது. நீண்ட சூழல் பணிகளுக்கு, ஹெல்மெட்டில் சராசரியாக 41.5 மற்றும் RULER இல் 79.4.
பிந்தைய பயிற்சி மாதிரியை மேலும் கூர்மைப்படுத்துகிறது. ஃபைன்-ட்யூனிங்கிற்குப் பிறகு மேற்பார்வையிடப்பட்ட 71.58 லிருந்து சராசரி மதிப்பெண்கள் DPO க்குப் பிறகு 72.67 ஆகவும், "திங்க்" கட்டமைப்பில் 73.22 ஆகவும் உயர்ந்து, Olmo3-7B-Think (71.97), Gemma-4-E4B Think (70.47), மற்றும் Qwen3.47 (695-73) ஆகியவற்றைத் தாண்டியது. அறிவுறுத்தலின்படி, IFEval 77.08 இலிருந்து 83.70 ஆக உயர்கிறது.
பயிற்சிக்குப் பிந்தைய செய்முறையே குறிப்பிடத்தக்கது. Dolci-Think-SFT-7B மற்றும் Nemotron கலவைகளில் SFTக்குப் பிறகு, AMD ஆனது DPO ஐ இயக்குகிறது. வலுவூட்டல் கற்றல் பின்னர் AMD இன் மைல்ஸ் கட்டமைப்பிற்குள் தொடர்கிறது: RLVR இன் 1,400 படிகள், அதைத் தொடர்ந்து மல்டி-டீச்சர் ஆன்-பாலிசி டிஸ்டில்லேஷன் இது கணிதம் அல்லது குறியீடு செயல்திறனைத் தியாகம் செய்யாமல் மீண்டும் ஆதாயத்தை மடிக்கிறது.
உரிமம் கேட்ச்
வணிக பயனர்களுக்கு முக்கியமான ஒரு எச்சரிக்கை உள்ளது. மாடல் எடைகள் ResearchRAIL உரிமத்தின் கீழ் அனுப்பப்படுகிறது, இது கல்வி மற்றும் ஆராய்ச்சி நோக்கங்களுக்காக மட்டுமே பயன்படுத்துவதை கட்டுப்படுத்துகிறது, எனவே Instella-MoE என்பது உற்பத்தி வரிசைப்படுத்தல்களுக்கான ஒரு டிராப்-இன் மாடல் அல்ல. எவ்வாறாயினும், பயிற்சி கோட்பேஸ் எம்ஐடி உரிமம் பெற்றது, மேலும் இது மீண்டும் பயன்படுத்தக்கூடிய சொத்து - இது மற்ற ஆய்வகங்களுக்கு AMD சிலிக்கான் பற்றிய பயிற்சிக்கான உறுதியான வரைபடத்தை வழங்குகிறது.
AMD ஒவ்வொரு பயிற்சி நிலையிலிருந்தும் முழு எடைகளையும், தரவு கலவைகள், பயிற்சி உள்ளமைவுகள் மற்றும் ஹக்கிங் ஃபேஸ் சேகரிப்பு, ஒரு கிட்ஹப் களஞ்சியம் மற்றும் அதன் ROCm வலைப்பதிவு முழுவதும் அனுமானக் குறியீடு ஆகியவற்றை வெளியிட்டுள்ளது. அந்த அளவிலான திறந்தநிலை - பயிற்சி-நிலை-பயிற்சி-நிலை, இறுதி சோதனைச் சாவடி மட்டுமல்ல - இது ஒரு பொதுவான திறந்த-எடையிலிருந்து "முழுமையான" வெளியீட்டை வேறுபடுத்துகிறது.
ஏன் இது அளவுகோல்களுக்கு அப்பால் முக்கியமானது
வெளியீட்டின் துணை உரை வன்பொருள் போட்டி. என்விடியாவின் CUDA சுற்றுச்சூழல் அமைப்பும் H100-வகுப்பு GPU களும் எல்லைப்புற மாதிரி பயிற்சிக்கான இயல்புநிலை அடி மூலக்கூறு ஆகும், மேலும் சவால் செய்பவர்கள் தங்கள் முடுக்கிகள் முழு பயிற்சி அடுக்கையும் கையாள முடியும் என்பதை நிரூபிக்க பல ஆண்டுகளாக முயற்சித்து வருகின்றனர். Instella-MoE என்பது AMD இன் இன்ஸ்டிங்க்ட் லைன் - ஏற்கனவே ஹைப்பர்ஸ்கேலர்கள் மற்றும் தேசிய ஆய்வகங்களால் அளவில் பயன்படுத்தப்பட்ட ஒரு நம்பத்தகுந்த கலைப்பொருளாகும். AMD ஆனது அதன் சொந்த வன்பொருளில் பயிற்சியளிக்கப்பட்ட போட்டித்திறன் வாய்ந்த திறந்த மாடல்களைத் தொடர்ந்து உற்பத்தி செய்ய முடிந்தால், AI கம்ப்யூட் சந்தையில் என்விடியாவின் பிடியை உடைக்க விரும்பும் வாங்குபவர்களுக்கு இது வலுவூட்டுகிறது.
ஆராய்ச்சியாளர்களுக்கு, முறையீடு வெளிப்படைத்தன்மை. தரவு கலவை, நடுநிலைப் பயிற்சிக் கலவை, வடிகட்டுதல் உத்தி மற்றும் RL பாடத்திட்டம் ஆகியவற்றை ஆவணப்படுத்தும் முழுமையாக திறந்த வெளியீடுகள் அரிதாகவே இருக்கின்றன, மேலும் அவை ஆய்வகத்தின் வார்த்தையை எடுத்துக் கொள்ளாமல் சமூக தணிக்கை மற்றும் உரிமைகோரல்களை மீண்டும் உருவாக்க அனுமதிக்கின்றன. Instella-MoE ஒரு சிறிய ஆனால் வளர்ந்து வரும் பட்டியலில் இணைகிறது - AMD இன் முந்தைய இன்ஸ்டெல்லா அடர்த்தியான மாதிரிகள் உட்பட - அந்த தரத்தை முன்னோக்கி தள்ளுகிறது.
AIக்கு முன்னால் இருங்கள்
இதுபோன்ற ஆழமான தொழில்நுட்ப கவரேஜ் நடக்க வேண்டுமா? சமீபத்திய AI மேம்பாடுகளுக்கு எங்கள் மையத்தை புக்மார்க் செய்யுங்கள் மற்றும் வெளியீட்டை தவறவிடாதீர்கள்.
மேலும் AI செய்திகளைப் படிக்கவும் →

