304-billion-parmeter အရောအနှော-ကျွမ်းကျင်သူများစနစ်ဖြစ်သည့် DeepSeek ၏ V4 Flash မော်ဒယ်သည် AMD MI300X GPU တစ်ခုတည်းတွင် ထုတ်လုပ်မှုတွင် အလုပ်လုပ်နိုင်ပြီး တစ်စက္ကန့်လျှင် 168.6 တိုကင်များကို အလေးချိန် quantization သို့မဟုတ် offloading ပြုလုပ်ခြင်းမရှိဘဲ တစ်စက္ကန့်လျှင် တိုကင်များရရှိကြောင်း သရုပ်ပြခဲ့သည်။ GitHub တွင်ထုတ်ဝေပြီး 2026 ခုနှစ် သြဂုတ်လ 4 ရက်နေ့တွင် Hacker News ၏ထိပ်ပိုင်းသို့တက်သွားသောအလုပ်သည် AMD ၏ဟာ့ဒ်ဝဲသည် Nvidia ကိုအမှီမပြုဘဲရှေ့တန်းစကေးဖွင့်မော်ဒယ်ကိုလုပ်ဆောင်နိုင်သည်ဟူသောအရှင်းလင်းဆုံးအထောက်အထားကိုပေးသည်။
developer Ryan Zhou မှထိန်းသိမ်းထားသော repository တွင် Docker Compose stack၊ pinned file overlays နှင့် MI300X တစ်ခုရှိ DeepSeek-V4-Flash-0731 checkpoint ကို run ရန်အတွက် tuning table များပါဝင်သည်။ AMD နှင့် Nvidia အကြား ချစ်ပ်စစ်ပွဲတွင် ထူးခြားဆန်းသစ်သော AI သတင်း ကို ခြေရာခံဖတ်ရှုသူများအတွက်၊ ရလဒ်သည် နယ်နိမိတ်ကောက်ချက်တွင် Nvidia ၏ နောက်ဆုံးပေါ်နှင့် ဈေးအကြီးဆုံး ဟာ့ဒ်ဝဲ လိုအပ်သည်ဟူသော ယူဆချက်ကို စိန်ခေါ်နေသောကြောင့် ရလဒ်သည် သိသာထင်ရှားပါသည်။
##နံပါတ်များ
ROCm ၏ညစဉ်ညစဉ်တည်ဆောက်မှု vLLM ကိုအသုံးပြု၍ pinned software stack တွင်တိုင်းတာထားသောစံသတ်မှတ်ချက်စွမ်းဆောင်ရည်သည် AMD accelerator တစ်ခုတည်းလုပ်ဆောင်နိုင်သည်နှင့် ပတ်သက်၍ ဆွဲဆောင်မှုရှိသောဇာတ်လမ်းကိုပြောပြသည်-
- Single-stream decode- တစ်စက္ကန့်လျှင် 168.6 တိုကင်များ၊ အချိန်နှင့်တပြေးညီ chat နှင့် agentic workload များအတွက် လုံလောက်သောမြန်ဆန်ပါသည်။
- Prefill throughput- ချိန်ညှိထားသော kernels ဖြင့် တစ်စက္ကန့်လျှင် ခန့်မှန်းခြေ 7,900 မှ 8,500 တိုကင်များ၊ ဆိုလိုသည်မှာ ရှည်လျားသော အချက်ပြမှုများကို တစ်စက္ကန့်အတွင်း ကောင်းမွန်စွာ လုပ်ဆောင်ပါသည်။
- တစ်ပြိုင်တည်းစီးကြောင်း ရှစ်ခု- တစ်စက္ကန့်လျှင် တိုကင်ပေါင်း 542 ခု၊ တစ်စက္ကန့်လျှင် 90.3 တိုကင်များ ပါဝင်သည်။
- 64-stream burst- တစ်စက္ကန့်လျှင် တိုကင်ပေါင်း 830 ၊ မှတ်ဉာဏ်ချို့ယွင်းချက်မရှိ၊ အင်ဂျင်ချို့ယွင်းမှုမရှိပါ။
- အကြောင်းအရာအရှည်- ဗိသုကာလက်ရာသည် တစ်သန်းအထိ ပံ့ပိုးပေးသည့် စမ်းသပ်မှုတွင် အတည်ပြုထားသော တိုကင် 256,000။
မော်ဒယ်တစ်ခုလုံးသည် MI300X ၏ 192-gigabyte HBM3 pool အတွင်း လုံးလုံးလျားလျား လိုက်ဖက်သော မြန်နှုန်းမြင့်မှတ်ဉာဏ်၏ 156.67 ဂစ်ဂါဘိုက်ရှိသည်။ မော်ဒယ်၏ တိကျမှု အပြည့်ကို ထိန်းသိမ်းထားနိုင်သည့် အပိုပမာဏ အရေအတွက် သို့မဟုတ် အလေးချိန် လျှော့ချရန် မလိုအပ်ပါ။
ဘာကြောင့် MI300X အလုပ်လုပ်တာလဲ။
AMD MI300X တွင် မော်ဒယ်တစ်ခု၏ GPU တစ်ခုတည်းကို အသုံးပြုနိုင်စေရန် ဤကြီးမားသော ဖြစ်နိုင်ချေရှိသော အရည်အချင်းနှစ်ခုရှိသည်။ ၎င်းတွင် HBM3 မမ်မိုရီ 192 ဂစ်ဂါဗိုက်၊ Nvidia H100 SXM5 ၏ စွမ်းရည် 2.4 ဆ နှင့် memory bandwidth ၏ တစ်စက္ကန့်လျှင် 5.3 terabytes ရှိသည်။ ဤဖြန့်ကျက်မှုအတွက် အခြေခံအုတ်မြစ်ချထားသည့် Fergus Finn ဟုသတ်မှတ်ထားသော developer မှသီးခြားရေးသားချက်တစ်ခုတွင် MI300X သည် စာရင်းပေါက်စျေးတွင် နှိုင်းယှဉ်နိုင်သော Nvidia ဟာ့ဒ်ဝဲထက် ထက်ဝက်ခန့်ကုန်ကျသည်ဟု ခန့်မှန်းခဲ့သည်။
ဤအထူးသဖြင့် 304 ဘီလီယံ-ပါရာမီတာစစ်ဆေးရေးဂိတ်အတွက်၊ မှတ်ဉာဏ်စွမ်းရည်သည် အဆုံးအဖြတ်ပေးသည့်အချက်ဖြစ်သည်။ မော်ဒယ်သည် on-chip memory တွင် လုံး၀ အံဝင်ခွင်ကျရှိပြီး 20-gigabyte GPU key-value cache pool နှင့် 96-gigabyte CPU အဆင့်ကို ဖယ်ထုတ်ထားသော prefix-cache entry များအတွက် နေရာချန်ထားသည်။ ကတ်တစ်ကတ်သည် ပုံမှန် တစ်ပြိုင်နက်တည်း စီးကြောင်း နှစ်ခုမှ ရှစ်ခုအထိ ထုတ်လွှင့်နိုင်ပြီး 64 လိုင်းအထိ ပေါက်ထွက်နိုင်သည်၊ ၎င်းသည် ထုတ်လုပ်မှု အနုမာနအလုပ်များများအတွက် လုံလောက်ပါသည်။
အင်ဂျင်နီယာ အတားအဆီးများ
MI300X တွင် DeepSeek V4 Flash ကိုအသုံးပြုခြင်းသည် ရိုးရှင်းသည်မဟုတ်။ တရားဝင် vLLM စာရွက်တွင် Nvidia ဟာ့ဒ်ဝဲနှင့် MI325X နှင့် MI355X ကဲ့သို့သော အသစ်သော AMD GPU များကို အကျုံးဝင်သည်၊ သို့သော် ဇူလိုင် 31 စစ်ဆေးရေးဂိတ်အတွက် MI300X ထုတ်လုပ်မှုပုံစံတစ်ခုတည်းမဟုတ်ပါ။
repository သည် ဖြေရှင်းရမည့် အင်ဂျင်နီယာပြဿနာများစွာကို မှတ်တမ်းတင်ထားသည်။ MI300X သည် FP8 နံပါတ်ဖော်မတ်၏ မူကွဲတစ်မျိုးကို အသုံးပြု၍ အသစ်အသစ်သော AMD ချစ်ပ်များအသုံးပြုသည့် စံနှုန်းများနှင့် မတူဘဲ၊ မှားယွင်းသော semantics ဖြစ်သည်ဟု ယူဆသည့် kernel သည် အချက်နှစ်ချက်ဖြင့် ရလဒ်များကို ထုတ်ပေးနိုင်သည်။ ဆော့ဖ်ဝဲအင်ဂျင်နီယာသည် မြင့်မားသော concurrency၊ အကြောင်းရင်းမှန်းဆအတည်ပြုချက်နှင့် CPU သော့-တန်ဖိုး ထပ်တူပြုခြင်းတို့ကို ပေါင်းစပ်ထားသော ကျွမ်းကျင်သူများ၏လမ်းကြောင်းကို ပြုပြင်ရမည်ဖြစ်ပြီး၊ အများအပြားကို upstream vLLM တွင် မပြင်ဆင်ရသေးပါ။
သိုလှောင်မှုတွင် မှန်ကန်မှုထပ်ဆင့်မှုများ၊ မှန်းဆရေးဆွဲခြင်းဖြင့် တရားဝင်သော ဝန်ဆောင်မှုပေးသည့်ဖွဲ့စည်းပုံတစ်ခု၊ ထုပ်ပိုးထားသောဇယားများပျောက်ဆုံးနေသည့် ချစ်ပ်ပုံစံများအတွက် AITER GEMM ချိန်ညှိခြင်းဇယားများနှင့် CPU offload နှင့် GPU cache ကိုပေါင်းစပ်ထားသည့် hybrid key-value ဗျူဟာတစ်ခု။
Chip War အတွက် ဘာကိုဆိုလိုလဲ။
အဆိုပါသရုပ်ပြမှုသည် AI တွင် AMD ၏ရည်မှန်းချက်များအတွက် အရေးကြီးသောအခိုက်အတန့်တစ်ခုသို့ရောက်ရှိလာသည်။ Nvidia သည် AMD ဖြတ်ကျော်ရန် ရုန်းကန်နေရသော ကျုံးတစ်ခုအဖြစ် developer အများအပြားမြင်သည့် ၎င်း၏ CUDA ဆော့ဖ်ဝဲလ်ဂေဟစနစ်ဖြင့် လွှမ်းမိုးထားသော AI အရှိန်မြှင့်ကိရိယာစျေးကွက်၏ လွှမ်းမိုးမှုအများစုကို ထိန်းချုပ်ထားသည်။ SemiAnalysis သည် "AMD သည် CUDA ကျုံးကို ချိုးဖျက်နိုင်သလား" ဟူသောခေါင်းစဉ်ဖြင့် ဇူလိုင်လ 2026 ခွဲခြမ်းစိတ်ဖြာမှုတွင် အဆိုပါမေးခွန်းကို တိုက်ရိုက်စစ်ဆေးခဲ့သည်။ အဖြေမှာ ပြိုင်ဆိုင်နေဆဲဖြစ်သည်။
ဒါပေမယ့် ဒီ chip လိုမျိုး open-source ပရောဂျက်တွေက perception gap နဲ့ဝေးပါတယ်။ MI300X တစ်ခုတည်းသည် ပြိုင်ဆိုင်မှုအမြန်နှုန်းဖြင့် ရှေ့တန်းစကေးမော်ဒယ်ကို ဝန်ဆောင်မှုပေးနိုင်ပါက AMD အတွက် ကုန်ကျစရိတ် အငြင်းပွားမှုသည် ပယ်ရန် ပိုမိုခက်ခဲလာသည်။ AMD သည် ၎င်း၏ကိုယ်ပိုင် Instinct GPUs များတွင် အစမှအဆုံးလေ့ကျင့်သင်ကြားထားသော အပြည့်အဝအဖွင့်မော်ဒယ် Instella-MoE-16B ကိုထုတ်ပြီး 15-megawatt MI355X ပလပ်ဖောင်းပေါ်တွင် Zyphra နှင့် ပူးပေါင်းဆောင်ရွက်လျက်ရှိသည်။
ထိုအတောအတွင်း၊ DeepSeek ကိုယ်တိုင်က Frontier AI ၏ကုန်ကျစရိတ်ကို လျှော့ချနေပါသည်။ V4 Flash မော်ဒယ်သည် GPT-5.6 Luna ကို ကုန်ကျစရိတ် 60 ရာခိုင်နှုန်း သက်သာသော ကုန်ကျစရိတ်ဖြင့် သုတေသနကုမ္ပဏီ ခွဲခြမ်းစိတ်ဖြာချက်အရ လည်ပတ်ရန် ဈေးအသက်သာဆုံး နာမည်ကြီး မော်ဒယ်ဖြစ်နေပါပြီ။ စျေးသက်သာသော AMD ဟာ့ဒ်ဝဲနှင့် ပေါင်းစပ်လိုက်သောကြောင့် Nvidia ဂေဟစနစ်အပြင်ဘက်ရှိ မော်ဒယ်ကြီးများကို ဝန်ဆောင်မှုပေးခြင်း၏ စီးပွားရေးသည် လျင်မြန်စွာ တိုးတက်လာသည်။
Open Source အားသာချက်
repository သည် 2026 AI ဖွံ့ဖြိုးတိုးတက်မှုတွင် ပိုမိုကျယ်ပြန့်သောအကြောင်းအရာကို အလေးပေးဖော်ပြသည်- open-weight model နှင့် open-source inference tooling သည် တစ်ချိန်က ရန်ပုံငွေကောင်းကောင်း labs ၏ သီးသန့်ဒိုမိန်းဖြစ်ခဲ့သည့် လွတ်လပ်သောအင်ဂျင်နီယာများအတွက် ဖြန့်ကျက်မှုများကို ပုံတူပွားပြီး ပိုမိုကောင်းမွန်အောင်လုပ်ဆောင်နိုင်စေသည်။ အပြည့်အစုံဖွဲ့စည်းပုံ၊ ချိန်ညှိဇယားများနှင့် လမ်းတစ်လျှောက်တွင် ပြင်ဆင်ထားသော ချို့ယွင်းချက်များအား ထုတ်ဝေခြင်းဖြင့်၊ ၎င်းသည် လေးနက်သော AI အလုပ်တာဝန်များအတွက် AMD ဟာ့ဒ်ဝဲကို စဉ်းစားသူတိုင်းအတွက် အတားအဆီးကို လျှော့ချပေးသည်။
AI ၏ရှေ့တွင်နေပါ။
AI ကောက်ချက်ချမှုအတွက် AMD နှင့် Nvidia အကြား တိုက်ပွဲသည် ပိုမိုပြင်းထန်လာကာ ဤအသုံးချမှုကဲ့သို့သော open-source ပံ့ပိုးမှုများသည် ပြိုင်ဆိုင်မှုအခင်းအကျင်းကို တိတ်တဆိတ်ပြောင်းလဲစေသည်။ ဟာ့ဒ်ဝဲ၊ အဖွင့်မော်ဒယ်များနှင့် အခြေခံအဆောက်အအုံဆိုင်ရာ နောက်ဆုံးပေါ် AI ဖွံ့ဖြိုးတိုးတက်မှုများ အတွက်၊ ကျွန်ုပ်တို့၏ လွှမ်းခြုံမှုနှင့်အတူ ဆက်လက်နေထိုင်ပါ။
AI သတင်းအပြည့်အစုံကို ဖတ်ရှုရန် →