AMD သည် ၎င်း၏ကိုယ်ပိုင် Instinct MI300X နှင့် MI325X GPUs ဖြင့် အပြည့်အဝဖွင့်ထားသော Mixture-of-Experts (MoE) ဘာသာစကားမော်ဒယ် Instella-MoE-16B-A3B ကို ထုတ်ပြန်လိုက်ပြီဖြစ်သည်။ ထုတ်ဝေမှုသည် ဆော့ဖ်ဝဲလ်နှင့်ပတ်သက်သည့်အတိုင်း ဆီလီကွန်နှင့်ပတ်သက်သည့် ထုတ်ပြန်ချက်တစ်ခုဖြစ်သည်- လေ့ကျင့်ရေးအဆင့်တိုင်း၊ ဒေတာအရောအနှောနှင့် ဖွဲ့စည်းမှုပုံစံအားလုံးကို ထုတ်ဝေခြင်းဖြင့် AMD သည် ၎င်း၏ဒေတာစင်တာမှ အရှိန်မြှင့်စက်များသည် နယ်ခြားအတန်းအစားဖွင့်မော်ဒယ်များကို အဆုံးအထိတည်ဆောက်နိုင်သည်—နယ်မြေ Nvidia သည် ကာလကြာရှည်လွှမ်းမိုးထားသည်။ ကျွန်ုပ်တို့၏ ထူးခြားသော AI သတင်း တွင် ကျွန်ုပ်တို့ ခြေရာခံထားသော အလွတ်ဝိတ်ပြိုင်ပွဲတွင် ပိုမိုထင်ရှားသော လှုပ်ရှားမှုများထဲမှ တစ်ခုဖြစ်သည်။

သေးငယ်သော်လည်း ကျယ်ပြန့်သော ကျွမ်းကျင်ပညာရှင်များ၏ ဒီဇိုင်း

MarkTechPost တွင် အသေးစိတ်ခွဲခြမ်းစိတ်ဖြာချက်အရ Instella-MoE-16B-A3B သည် တိုကင်တစ်ခုလျှင် 2.8 ဘီလီယံ သာ 2.8 ဘီလီယံသာ အသက်သွင်းနိုင်သော ကုဒ်ဒါ-သီးသန့် MoE မော်ဒယ်တစ်ခုဖြစ်သည်။ ၎င်း၏ 27 အလွှာတစ်ခုစီတွင် မျှဝေထားသောကျွမ်းကျင်သူ 2 ဦးနှင့် 64 ရေကူးကန်မှ ရွေးချယ်ထားသော ကျွမ်းကျင်သူ 6 ဦးကို အသုံးပြုပြီး ဝှက်ထားသောအရွယ်အစား 2048၊ အာရုံစူးစိုက်မှုခေါင်း 16 ခုနှင့် 128,896 ဝေါဟာရ တိုကင်တစ်ခုကို အသုံးပြုသည်။ Multi-Token Prediction** ရည်မှန်းချက်ကို ကြိုတင်လေ့ကျင့်ချိန်နှင့် အလယ်အလတ်လေ့ကျင့်ရေးနှစ်ခုလုံးတွင် အသုံးပြုသည်။

တိုကင်တစ်ခုစီအတွက် ကွန်ရက်၏သေးငယ်သောအစိပ်စိပ်တစ်ခု "နိုးထလာ" သည့် သေးငယ်သော ဗိသုကာလက်ရာသည် လွန်ခဲ့သည့်နှစ်အတွင်း စျေးကွက်ကို ပြန်လည်ပုံဖော်ခဲ့သည့် ဈေးပေါသော-လည်ပတ်နိုင်သော အဖွင့်မော်ဒယ်များ၏ နောက်ကွယ်တွင် တူညီသော ထိရောက်မှုယုတ္တိတစ်ခုဖြစ်သည်။ AMD သည် Nemotron-CC-v2၊ MegaMath၊ FineMath၊ RefineCode နှင့် TxT360 အပါအဝင် open corpora မှ ထုတ်ယူထားသော 7.1 ထရီလီယံ တိုကင် ဖြင့် မော်ဒယ်ကို လေ့ကျင့်သင်ကြားခဲ့ပြီး၊ ထို့နောက် ပျမ်းမျှအလေးချိန်ဖြင့် ပေါင်းစပ်ထားသော ဒေတာအမျိုးအစားသုံးမျိုးဖြင့် Dolma3 Dolmino 100B တွင် အလယ်အလတ်လေ့ကျင့်ရေးအဆင့်ကို လုပ်ဆောင်ခဲ့သည်။ ရှည်လျားသောအကြောင်းအရာအဆင့်သည် YaRN ကို အသုံးပြု၍ ဝင်းဒိုးအား 4K မှ 64K တိုကင် သို့ ဆန့်သည်။

စနစ်-အဆင့် ဆန်းသစ်တီထွင်မှုနှစ်ခု

ထုတ်ဝေမှုတွင် အဓိပ္ပာယ်ပြည့်ဝသော အင်ဂျင်နီယာအနိုင်ဖြင့် AMD မီးမောင်းထိုးပြထားသည့် ဖွဲ့စည်းပုံရွေးချယ်မှုနှစ်ခုပါရှိသည်။ ပထမအချက်မှာ Gated Multi-head Latent Attention (Gated MLA) ဖြစ်ပြီး၊ Multi-head Latent Attention သို့ ပေါ့ပါးသော သင်ယူထားသော အထွက်ဂိတ်တစ်ခုကို ပေါင်းထည့်သည်။ သီးသန့် မျဉ်းသား ပရောဂျက်သည် အထွက်အား ပရိုဂရမ်မတင်မီ မြှောက်တင်ထားသော အဝင်-အအေးခံထားသော ဂိတ်တစ်ခုမှ ဆင်းသက်လာသည်။

ဒုတိယ၊ FarSkip-Collective သည် ခေတ်မမီတော့သော၊ တစ်စိတ်တစ်ပိုင်းလှုပ်ရှားဆောင်ရွက်မှုများကို MoE နှင့် အာရုံစူးစိုက်မှုအလွှာများအတွင်းသို့ ဖြတ်သန်းကာ ကျွမ်းကျင်သူ-အပြိုင် ဆက်သွယ်ရေးနှင့် တွက်ချက်မှုတို့ ထပ်နေပါသည်။ AMD က 12.7% အကြိုလေ့ကျင့်မှု အရှိန်မြှင့်ခြင်း နှင့် ကျွမ်းကျင်သူအပြိုင်အပြိုင် ဝန်ဆောင်မှုပေးသောအခါ ပထမဆုံး တိုကင်အတွက် အချိန် 39.2% အထိ လျော့ချပေးသည်။ ကုမ္ပဏီတစ်ခုသည် ၎င်း၏ ဟာ့ဒ်ဝဲကို စျေးနှုန်းစွမ်းဆောင်ရည်ဖြင့် မြှင့်တင်ရန်အတွက်၊ ၎င်းတို့သည် ဝယ်သူမြင်လိုသည့် ကိန်းဂဏန်းများ အတိအကျဖြစ်သည်။

အပြည့်အဝဖွင့်ထားသော မော်ဒယ်အတွက် ခိုင်မာသော စံသတ်မှတ်ချက်များ

အခြေခံစစ်ဆေးရေးဂိတ်တွင်၊ Instella-MoE သည် အကဲဖြတ်မှုများတွင် ပျမ်းမျှအားဖြင့် 76.7 ရှိပြီး AMD သည် အပြည့်အဝဖွင့်ထားသောမော်ဒယ်များကြားတွင် အပြင်းထန်ဆုံးရလဒ်ဟုခေါ်ဆိုသည်။ ၎င်းသည် Moonlight-16B-A3B (76.2)၊ SmolLM3-3B-Base (70.5)၊ OLMo-3-7B (70.1) နှင့် OLMoE-1B-7B (61.9)၊ Qwen3.5-4B-Base (79.5) တို့ထက်သာလွန်သည်။ ရမှတ် 86.5 ဖြင့် WinoGrande တွင် ဦးဆောင်နေပြီး HumanEval+ တွင် 65.7 တင်ထားသည်။ ရှည်လျားသောဆက်စပ်လုပ်ဆောင်စရာများအတွက်၊ ၎င်းသည် HELMET တွင် ပျမ်းမျှ 41.5 နှင့် RULER တွင် 79.4 ဖြစ်သည်။

လေ့ကျင့်ပြီးနောက် မော်ဒယ်ကို ပိုမိုထက်မြက်စေသည်။ DPO ပြီးနောက် 72.67 နှင့် "Think" စီစဉ်သတ်မှတ်မှုတွင် Olmo3-7B-Think (71.97)၊ Gemma-4-E4B Think (70.47) နှင့် Qwen3.5-73B ကို ကြီးကြပ်ပြီးနောက် ပျမ်းမျှရမှတ်များသည် 71.58 မှ တက်လာပါသည်။ ညွှန်ကြားချက်များအတိုင်း၊ IFEval သည် 77.08 မှ 83.70 သို့ မြင့်တက်လာသည်။

လေ့ကျင့်မှုပြီးသွားသော ဟင်းချက်နည်းသည် မှတ်သားဖွယ်ကောင်းသည်။ Dolci-Think-SFT-7B နှင့် Nemotron အရောအနှောများတွင် SFT ပြီးနောက်၊ AMD သည် Router ဘက်လိုက်မှုမွမ်းမံမှုများဖြင့် DPO ကို လုပ်ဆောင်ပြီး ပျက်စီးယိုယွင်းမှုမဖြစ်စေရန် auxiliary load-balancing loss ကို ပိတ်ထားသည်။ အားဖြည့်သင်ယူမှုသည် AMD ၏ Miles framework အတွင်းတွင် ဆက်လက်လုပ်ဆောင်သည်- ပို့ချသည့် RLVR ၏ အဆင့် 1,400 ၏နောက်တွင်၊ Multi-Teacher On-Policy Distillation သည် သင်္ချာ သို့မဟုတ် ကုဒ်စွမ်းဆောင်ရည်ကို မစွန့်လွတ်ဘဲ ပြန်လည်ရရှိလာမည်ဖြစ်သည်။

လိုင်စင်ဖမ်းခြင်း။

စီးပွားရေးသမားတွေအတွက် အရေးကြီးတဲ့ သတိပေးချက်တစ်ခုရှိပါတယ်။ မော်ဒယ်အလေးများ သည် ResearchRAIL လိုင်စင်ဖြင့် ပို့ဆောင်ပေးသော ပညာရပ်ဆိုင်ရာ နှင့် သုတေသန ရည်ရွယ်ချက်များအတွက်သာ အသုံးပြုခြင်း ဖြစ်သောကြောင့် Instella-MoE သည် ထုတ်လုပ်မှု ဖြန့်ကျက်မှုအတွက် ကျဆင်းလာသော မော်ဒယ်မဟုတ်ပါ။ လေ့ကျင့်ရေးကုဒ်ဘေ့စ်သည် MIT လိုင်စင်ရ** ဖြစ်ပြီး ၎င်းသည် ပိုမိုပြန်လည်အသုံးပြုနိုင်သည့် ပိုင်ဆိုင်မှုဖြစ်သည်—၎င်းသည် အခြားဓာတ်ခွဲခန်းများကို AMD ဆီလီကွန်လေ့ကျင့်ရေးအတွက် ခိုင်မာသောအသေးစိတ်ပုံစံကိုပေးသည်။

AMD သည် လေ့ကျင့်ရေးအဆင့်တိုင်း၊ ဒေတာအရောအနှောများ၊ လေ့ကျင့်ဖွဲ့စည်းပုံများနှင့် အနုမာနကုဒ်များကို ပွေ့ဖက်ထားသောမျက်နှာစုစည်းမှု၊ GitHub သိုလှောင်ရာနှင့် ၎င်း၏ ROCm ဘလော့ဂ်တို့မှ အလေးချိန်အပြည့်အစုံကို ထုတ်ပြန်ထားသည်။ အဆိုပါပွင့်လင်းမှုအဆင့် - လေ့ကျင့်ရေးအဆင့် - လေ့ကျင့်ရေးအဆင့်၊ နောက်ဆုံးစစ်ဆေးရေးဂိတ်တစ်ခုသာမကဘဲ - သည် ပုံမှန်အဖွင့်အလေးချိန်တစ်ခုနှင့် "အပြည့်အ၀ဖွင့်ခြင်း" ကို ခွဲခြားသိမြင်စေသည်။

စံသတ်မှတ်ချက်များထက် အဘယ်ကြောင့် ဤအရာသည် အရေးကြီးသနည်း။

ထုတ်ဝေမှု၏ အခြေခံအကြောင်းအရာမှာ ဟာ့ဒ်ဝဲ ပြိုင်ဆိုင်မှုဖြစ်သည်။ Nvidia ၏ CUDA ဂေဟစနစ်နှင့် H100-အတန်းအစား GPU များသည် Frontier မော်ဒယ်လေ့ကျင့်ရေးအတွက် မူရင်းအလွှာဖြစ်ပြီး စိန်ခေါ်သူများသည် ၎င်းတို့၏ အရှိန်မြှင့်စက်များသည် လေ့ကျင့်ရေးစဥ်ကို အပြည့်အဝကိုင်တွယ်နိုင်ကြောင်း သက်သေပြရန် နှစ်ပေါင်းများစွာ ကြိုးစားခဲ့ကြသည်။ Instella-MoE သည် AMD ၏ Instinct လိုင်း— hyperscalers များနှင့် အမျိုးသားဓာတ်ခွဲခန်းများမှ အတိုင်းအတာတစ်ခုအထိ ဖြန့်ကျက်ထားပြီး— အနုမာနအလုပ်များထက် ပိုမိုလုပ်ဆောင်နိုင်သည့် ယုံကြည်ရလောက်သည့်အရာတစ်ခုဖြစ်သည်။ AMD သည် ၎င်း၏ကိုယ်ပိုင် hardware တွင်လေ့ကျင့်ထားသော အပြိုင်အဆိုင်အဖွင့်မော်ဒယ်များကို ဆက်လက်ထုတ်လုပ်နိုင်ပါက၊ ၎င်းသည် AI တွက်ချက်မှုစျေးကွက်တွင် Nvidia ၏ချုပ်ကိုင်မှုကိုချိုးဖျက်ရန်ရှာဖွေနေသော ၀ ယ်သူများအတွက်ကိစ္စရပ်ကိုပိုမိုအားကောင်းစေသည်။

သုတေသီများအတွက် အယူခံဝင်မှုသည် ပွင့်လင်းမြင်သာမှုဖြစ်သည်။ ဒေတာရောနှောမှု၊ လေ့ကျင့်ရေးအလယ်အလတ်ပေါင်းစပ်မှု၊ ပေါင်းခံနည်းဗျူဟာနှင့် RL သင်ရိုးညွှန်းတမ်းတို့ကို မှတ်တမ်းတင်ထားသည့် အပြည့်အ၀ ပွင့်လင်းမြင်သာစွာ ထုတ်ပြန်မှုများသည် ရှားပါးပြီး ၎င်းတို့သည် ၎င်းအတွက် ဓာတ်ခွဲခန်း၏ စကားလုံးကို ယူမည့်အစား အသိုင်းအဝိုင်းအား စာရင်းစစ်ပြီး အရေးဆိုမှုများကို ပြန်လည်ထုတ်လုပ်ခွင့်ပေးခဲ့သည်။ Instella-MoE သည် AMD ၏အစောပိုင်း Instella သိပ်သည်းသောမော်ဒယ်များအပါအဝင် သေးငယ်သော်လည်း ကြီးထွားလာသောစာရင်းတွင်ပါဝင်သည် — ထိုစံနှုန်းကိုရှေ့သို့တွန်းပို့သည်။

AI ထက်သာလွန်နေပါစေ။

ဒီလိုမျိုး နက်နဲတဲ့ နည်းပညာဆိုင်ရာ လွှမ်းခြုံမှုကို လိုချင်ပါသလား။ နောက်ဆုံးပေါ် AI ဖွံ့ဖြိုးတိုးတက်မှုများ အတွက် ကျွန်ုပ်တို့၏ဗဟိုကို အမှတ်အသားပြုပြီး ထုတ်ဝေမှုကို ဘယ်တော့မှ လက်လွတ်မခံပါ။

AI သတင်းအပြည့်အစုံကို ဖတ်ရှုရန် →