AMD ஆனது Instella-MoE-16B-A3B ஐ வெளியிட்டது, இது முழுக்க முழுக்க திறந்த கலவை-நிபுணர்களின் (MoE) மொழி மாடலானது, அதன் சொந்த Instinct MI300X மற்றும் MI325X GPUகளில் பயிற்சியளிக்கப்பட்டது. இந்த வெளியீடு மென்பொருளைப் பற்றிய அறிக்கையைப் போலவே சிலிக்கான் பற்றிய அறிக்கையாகும்: ஒவ்வொரு பயிற்சி நிலை, தரவு கலவை மற்றும் உள்ளமைவை வெளியிடுவதன் மூலம், AMD அதன் தரவு மைய முடுக்கிகள் எல்லைப்புற-வகுப்பு திறந்த மாதிரிகளை இறுதிவரை உருவாக்க முடியும் என்பதை நிரூபிக்கிறது - என்விடியா நீண்ட காலமாக ஆதிக்கம் செலுத்துகிறது. எங்கள் பிரேக்கிங் AI செய்திகளில் நாங்கள் கண்காணிக்கும் ஓப்பன் வெயிட் பந்தயத்தில் இது மிகவும் கூர்மையான நகர்வுகளில் ஒன்றாகும்.

ஒரு சிறிய ஆனால் பரந்த கலவையான நிபுணர்களின் வடிவமைப்பு

MarkTechPost இல் உள்ள விரிவான முறிவின்படி, Instella-MoE-16B-A3B என்பது ஒரு டோக்கனுக்கு 2.8 பில்லியன் மட்டுமே செயல்படுத்தும் 16 பில்லியன் மொத்த அளவுருக்கள் கொண்ட ஒரு டிகோடர்-மட்டும் MoE மாடலாகும். அதன் 27 அடுக்குகளில் ஒவ்வொன்றும் 2 பகிரப்பட்ட நிபுணர்கள் மற்றும் 64 குழுவிலிருந்து தேர்ந்தெடுக்கப்பட்ட 6 வழித்தட நிபுணர்கள், 2048 இன் மறைக்கப்பட்ட அளவு, 16 கவனம் தலைகள் மற்றும் 128,896-டோக்கன் சொற்களஞ்சியம் ஆகியவற்றைப் பயன்படுத்துகிறது. ஒரு மல்டி-டோக்கன் முன்கணிப்பு** நோக்கம் முன் பயிற்சி மற்றும் இடைப்பட்ட பயிற்சியின் போது பயன்படுத்தப்படுகிறது.

அந்த அரிதான கட்டிடக்கலை - ஒவ்வொரு டோக்கனுக்கும் நெட்வொர்க்கின் ஒரு சிறிய துண்டு "விழிக்கிறது" - கடந்த ஆண்டில் சந்தையை மறுவடிவமைத்த மலிவான-இயக்கக்கூடிய திறந்த மாடல்களுக்குப் பின்னால் உள்ள அதே செயல்திறன் தர்க்கமாகும். AMD ஆனது Nemotron-CC-v2, MegaMath, FineMath, RefineCode மற்றும் TxT360 உள்ளிட்ட திறந்த கார்போராவிலிருந்து வரையப்பட்ட 7.1 டிரில்லியன் டோக்கன்களில் மாடலைப் பயிற்றுவித்தது, பின்னர் Dolma3 Dolmino 100B இல் மூன்று தரவு மாறுபாடுகளில் சராசரியாக இணைக்கப்பட்ட மூன்று தரவு மாறுபாடுகளில் ஒரு இடைநிலைப் பயிற்சியை நடத்தியது. YaRN ஐப் பயன்படுத்தி ஒரு நீண்ட சூழல் நிலை சாளரத்தை 4K இலிருந்து 64K டோக்கன்கள் வரை நீட்டிக்கிறது.

இரண்டு அமைப்புகள்-நிலை கண்டுபிடிப்புகள்

இந்த வெளியீடு இரண்டு கட்டமைப்புத் தேர்வுகளைக் கொண்டுள்ளது, அவை அர்த்தமுள்ள பொறியியல் வெற்றிகளாக AMD முன்னிலைப்படுத்துகின்றன. முதலாவது கேட்டட் மல்டி-ஹெட் லேட்டன்ட் அட்டென்ஷன் (கேட்டட் எம்எல்ஏ), இது மல்டி-ஹெட் லேட்டன்ட் அட்டென்ஷனுக்கு இலகுரக கற்றறிந்த வெளியீட்டு வாயிலைச் சேர்க்கிறது. ஒரு பிரத்யேக லீனியர் ப்ரொஜெக்ஷன் ஒரு உள்ளீடு-நிபந்தனை செய்யப்பட்ட வாயிலைப் பெறுகிறது, இது வெளியீட்டுத் திட்டத்திற்கு முன் பெருக்கல் முறையில் பயன்படுத்தப்படுகிறது.

இரண்டாவது, FarSkip-கலெக்டிவ் என்பது, காலாவதியான மற்றும் பகுதியளவு செயல்பாடுகளை MoE மற்றும் கவனம் அடுக்குகளுக்குள் அனுப்பும் ஒரு இணைப்புத் திட்டமாகும். AMD ஆனது 12.7% பயிற்சிக்கு முந்தைய வேகத்தை மற்றும் 39.2% வரை முதல் டோக்கன் வரை நிபுணத்துவ இணையாக சேவை செய்யும் போது குறைகிறது. ஒரு நிறுவனம் அதன் வன்பொருளை விலை-செயல்திறன் மீது பிட்ச் செய்ய, வாங்குபவர் பார்க்க விரும்பும் எண்கள்.

முழுமையாக திறந்த மாதிரிக்கான வலுவான வரையறைகள்

அடிப்படை சோதனைச் சாவடியில், Instella-MoE சராசரியாக 76.7 மதிப்பீட்டில் உள்ளது, இது AMD ஆனது முழுமையாக திறந்த மாதிரிகளில் வலுவான முடிவு என்று அழைக்கிறது. இது Moonlight-16B-A3B (76.2), SmolLM3-3B-Base (70.5), OLMo-3-7B (70.1), மற்றும் OLMoE-1B-7B (61.9) ஆகியவற்றை விட முன்னணியில் உள்ளது, இருப்பினும் இது இன்னும் Qwen3.5-4B-Base (79.5) ஐப் பின்தொடர்கிறது. இது 86.5 மதிப்பெண்களுடன் வினோகிராண்டில் முன்னணியில் உள்ளது மற்றும் HumanEval+ இல் 65.7 ஐப் பதிவு செய்கிறது. நீண்ட சூழல் பணிகளுக்கு, ஹெல்மெட்டில் சராசரியாக 41.5 மற்றும் RULER இல் 79.4.

பிந்தைய பயிற்சி மாதிரியை மேலும் கூர்மைப்படுத்துகிறது. ஃபைன்-ட்யூனிங்கிற்குப் பிறகு மேற்பார்வையிடப்பட்ட 71.58 லிருந்து சராசரி மதிப்பெண்கள் DPO க்குப் பிறகு 72.67 ஆகவும், "திங்க்" கட்டமைப்பில் 73.22 ஆகவும் உயர்ந்து, Olmo3-7B-Think (71.97), Gemma-4-E4B Think (70.47), மற்றும் Qwen3.47 (695-73) ஆகியவற்றைத் தாண்டியது. அறிவுறுத்தலின்படி, IFEval 77.08 இலிருந்து 83.70 ஆக உயர்கிறது.

பயிற்சிக்குப் பிந்தைய செய்முறையே குறிப்பிடத்தக்கது. Dolci-Think-SFT-7B மற்றும் Nemotron கலவைகளில் SFTக்குப் பிறகு, AMD ஆனது DPO ஐ இயக்குகிறது. வலுவூட்டல் கற்றல் பின்னர் AMD இன் மைல்ஸ் கட்டமைப்பிற்குள் தொடர்கிறது: RLVR இன் 1,400 படிகள், அதைத் தொடர்ந்து மல்டி-டீச்சர் ஆன்-பாலிசி டிஸ்டில்லேஷன் இது கணிதம் அல்லது குறியீடு செயல்திறனைத் தியாகம் செய்யாமல் மீண்டும் ஆதாயத்தை மடிக்கிறது.

உரிமம் கேட்ச்

வணிக பயனர்களுக்கு முக்கியமான ஒரு எச்சரிக்கை உள்ளது. மாடல் எடைகள் ResearchRAIL உரிமத்தின் கீழ் அனுப்பப்படுகிறது, இது கல்வி மற்றும் ஆராய்ச்சி நோக்கங்களுக்காக மட்டுமே பயன்படுத்துவதை கட்டுப்படுத்துகிறது, எனவே Instella-MoE என்பது உற்பத்தி வரிசைப்படுத்தல்களுக்கான ஒரு டிராப்-இன் மாடல் அல்ல. எவ்வாறாயினும், பயிற்சி கோட்பேஸ் எம்ஐடி உரிமம் பெற்றது, மேலும் இது மீண்டும் பயன்படுத்தக்கூடிய சொத்து - இது மற்ற ஆய்வகங்களுக்கு AMD சிலிக்கான் பற்றிய பயிற்சிக்கான உறுதியான வரைபடத்தை வழங்குகிறது.

AMD ஒவ்வொரு பயிற்சி நிலையிலிருந்தும் முழு எடைகளையும், தரவு கலவைகள், பயிற்சி உள்ளமைவுகள் மற்றும் ஹக்கிங் ஃபேஸ் சேகரிப்பு, ஒரு கிட்ஹப் களஞ்சியம் மற்றும் அதன் ROCm வலைப்பதிவு முழுவதும் அனுமானக் குறியீடு ஆகியவற்றை வெளியிட்டுள்ளது. அந்த அளவிலான திறந்தநிலை - பயிற்சி-நிலை-பயிற்சி-நிலை, இறுதி சோதனைச் சாவடி மட்டுமல்ல - இது ஒரு பொதுவான திறந்த-எடையிலிருந்து "முழுமையான" வெளியீட்டை வேறுபடுத்துகிறது.

ஏன் இது அளவுகோல்களுக்கு அப்பால் முக்கியமானது

வெளியீட்டின் துணை உரை வன்பொருள் போட்டி. என்விடியாவின் CUDA சுற்றுச்சூழல் அமைப்பும் H100-வகுப்பு GPU களும் எல்லைப்புற மாதிரி பயிற்சிக்கான இயல்புநிலை அடி மூலக்கூறு ஆகும், மேலும் சவால் செய்பவர்கள் தங்கள் முடுக்கிகள் முழு பயிற்சி அடுக்கையும் கையாள முடியும் என்பதை நிரூபிக்க பல ஆண்டுகளாக முயற்சித்து வருகின்றனர். Instella-MoE என்பது AMD இன் இன்ஸ்டிங்க்ட் லைன் - ஏற்கனவே ஹைப்பர்ஸ்கேலர்கள் மற்றும் தேசிய ஆய்வகங்களால் அளவில் பயன்படுத்தப்பட்ட ஒரு நம்பத்தகுந்த கலைப்பொருளாகும். AMD ஆனது அதன் சொந்த வன்பொருளில் பயிற்சியளிக்கப்பட்ட போட்டித்திறன் வாய்ந்த திறந்த மாடல்களைத் தொடர்ந்து உற்பத்தி செய்ய முடிந்தால், AI கம்ப்யூட் சந்தையில் என்விடியாவின் பிடியை உடைக்க விரும்பும் வாங்குபவர்களுக்கு இது வலுவூட்டுகிறது.

ஆராய்ச்சியாளர்களுக்கு, முறையீடு வெளிப்படைத்தன்மை. தரவு கலவை, நடுநிலைப் பயிற்சிக் கலவை, வடிகட்டுதல் உத்தி மற்றும் RL பாடத்திட்டம் ஆகியவற்றை ஆவணப்படுத்தும் முழுமையாக திறந்த வெளியீடுகள் அரிதாகவே இருக்கின்றன, மேலும் அவை ஆய்வகத்தின் வார்த்தையை எடுத்துக் கொள்ளாமல் சமூக தணிக்கை மற்றும் உரிமைகோரல்களை மீண்டும் உருவாக்க அனுமதிக்கின்றன. Instella-MoE ஒரு சிறிய ஆனால் வளர்ந்து வரும் பட்டியலில் இணைகிறது - AMD இன் முந்தைய இன்ஸ்டெல்லா அடர்த்தியான மாதிரிகள் உட்பட - அந்த தரத்தை முன்னோக்கி தள்ளுகிறது.

AIக்கு முன்னால் இருங்கள்

இதுபோன்ற ஆழமான தொழில்நுட்ப கவரேஜ் நடக்க வேண்டுமா? சமீபத்திய AI மேம்பாடுகளுக்கு எங்கள் மையத்தை புக்மார்க் செய்யுங்கள் மற்றும் வெளியீட்டை தவறவிடாதீர்கள்.

மேலும் AI செய்திகளைப் படிக்கவும் →