ဗဟိုချုပ်ကိုင်မှုလျှော့ချထားသော AI ဓာတ်ခွဲခန်း Prime Intellect သည် ယနေ့ခေတ်ရှေ့တန်း AI မော်ဒယ်များသည် autonomous machine learning research ကို မည်မျှ ကောင်းမွန်စွာ လုပ်ဆောင်နိုင်သည်ကို စမ်းသပ်သည့် အကြီးစား စမ်းသပ်မှု ရလဒ်များကို ထုတ်ပြန်ခဲ့ပြီး ၎င်းတို့ထဲမှ အကောင်းဆုံးများသည် ကျော်ကြားသော လူ့အသိုက်အဝန်း စံချိန်စံညွှန်းနှင့် ကိုက်ညီရန် သိသိသာသာ နီးစပ်လာပါသည်။
NanoGPT Speedrun Frontier ဟုအမည်ပေးထားသည့် ပရောဂျက်တွင် သြဂုတ်လ 22 ရက်နေ့တွင် ထုတ်ဝေသည့် ပရောဂျက်တွင်၊ nanoGPT optimizer speedrun ကို ကြိုးပမ်းနေသည့် နယ်ခြားမော်ဒယ် 18 ခုတွင် 153 autonomous runs ပါဝင်သည် — သုတေသီများသည် ပုံသေအရည်အသွေးသတ်မှတ်ထားသော အရည်အသွေးပန်းတိုင်သို့ သေးငယ်သောဘာသာစကားမော်ဒယ်ကိုလေ့ကျင့်ရန် အထိရောက်ဆုံးနည်းလမ်းကို ရှာဖွေသည့် ပြိုင်ဆိုင်မှုတစ်ခုဖြစ်သည်။ ဇာတ်လမ်းသည် Hacker News ၏ ရှေ့ဆုံးစာမျက်နှာသို့ လျင်မြန်စွာ တက်လာခဲ့ပြီး စစ်မှန်သော သိပ္ပံနည်းကျ ရှာဖွေတွေ့ရှိမှုအတွက် AI ၏ စွမ်းဆောင်ရည်နှင့် ပတ်သက်၍ ရလဒ်များက AI ၏ စွမ်းဆောင်ရည်နှင့် ပတ်သက်၍ ရလဒ်များကို ငြင်းခုံဆွေးနွေးသည့် မှတ်ချက်များစွာ ထွက်ပေါ်လာခဲ့သည်။ For more context on this story, see our ongoing AI industry coverage.
တကယ်တော့ NanoGPT Speedrun ဆိုတာဘာလဲ
စံသတ်မှတ်ချက်သည် Keller Jordan မှ ထိန်းသိမ်းထားသော modded-nanogpt repository နှင့် ရပ်ရွာပံ့ပိုးပေးသူများစာရင်းရှည်မှ လာပါသည်။ စိန်ခေါ်မှုမှာ လိမ်လည်ပြောဆိုရန် ရိုးရှင်းသည်- 8 NVIDIA H100 GPUs ကိုအသုံးပြု၍ FineWeb တရားဝင်အတည်ပြုသတ်မှတ်မှုတွင် 3.28 ဖြတ်ကျော်-entropy ဆုံးရှုံးမှုသို့ရောက်ရှိသည့် ဘာသာစကားမော်ဒယ်တစ်ခုကို လေ့ကျင့်ပေးပါ — Andrej Karpathy ၏ မူလ GPT-2 ပုံတူပွားမှုအဆင့်သည် 45 မိနစ်အကြာတွင် — မြန်နိုင်သမျှမြန်သည်။
လွန်ခဲ့သည့် နှစ်နှစ်အတွင်း ရာနှင့်ချီသော အသိုင်းအဝိုင်းမှ ပံ့ပိုးကူညီမှုများမှတစ်ဆင့်၊ လူ့စံချိန်သည် ၇၅ စက္ကန့်အောက်နှင့် လေ့ကျင့်ရေးတိုကင် သန်း ၄၀၀ အောက်သို့ ကျဆင်းသွားခဲ့ပြီး မူလဟင်းချက်နည်းထက် အဆ ၃၀ ကျော် တိုးတက်လာခဲ့သည်။ ခေတ်မီ ML အင်ဂျင်နီယာ၏ ကက်တလောက်တစ်ခုကဲ့သို့ ဖတ်ရသည့် အောင်မြင်သော ဖြေရှင်းနည်းများ- Muon optimizer၊ QK-Norm ဖြင့် rotary embeds၊ ReLU-squared activations၊ FP8 quantization နှင့် MLP passes၊ slide-window ပုံစံများဖြင့် Flash Attention 3 နှင့် အခြားနည်းပညာများစွာကို တစ်ခုနှင့်တစ်ခု အပေါ်ထပ်တွင် စီထားသည်။
Prime Intellect ၏ စမ်းသပ်မှုသည် သိုလှောင်မှု၏ စာရွက်စာတမ်းအရ — သတ်မှတ်ထားသော နံရံနာရီဘတ်ဂျက်ဖြင့် ပုံသေဗိသုကာပညာ၊ ဒေတာအတွဲနှင့် အတွဲအရွယ်အစားတို့ကို ထိရောက်စွာ အကန့်အသတ်မရှိ နံရံနာရီဘတ်ဂျက်ဖြင့် လိုအပ်သော လေ့ကျင့်ရေးအဆင့်အရေအတွက်ကို လျှော့ချပေးသည့် Prime Intellect ၏ စမ်းသပ်မှုတွင် အသုံးပြုထားသည်။ ၎င်းသည် ကုန်ကြမ်း hardware speed ထက် algorithm ရှာဖွေတွေ့ရှိမှု၏ စစ်မှန်သော စမ်းသပ်မှုတစ်ခု ဖြစ်စေသည်။
စမ်းသပ်မှု မည်သို့လုပ်ဆောင်ခဲ့သနည်း။
မော်ဒယ် 18 ခုကို လုပ်ငန်းတာဝန်တစ်ခုစီကို အလိုအလျောက် ပေးအပ်သည်- လေ့ကျင့်ရေး စာရွက်တွင် အပြောင်းအလဲများကို အဆိုပြုခြင်း၊ စမ်းသပ်မှုများ လုပ်ဆောင်ခြင်း၊ ရလဒ်များကို စစ်ဆေးခြင်းနှင့် ထပ်ခါတလဲလဲ ပြုလုပ်ခြင်း - မှန်ကန်ကြောင်း အတည်ပြုခြင်း script နှင့် ပုံသေကျပန်းမျိုးစေ့များဖြင့် အခိုင်အမာ လုပ်ဆောင်ခြင်းသည် ကံကောင်းခြင်းထက် မှန်ကန်ကြောင်း သေချာစေသည့် တိုးတက်မှုကို သေချာစေပါသည်။ Hacker News မှ မှတ်ချက်ပေးသူတစ်ဦးက ၎င်းကို အကျဉ်းချုံးဖော်ပြလိုက်သည်နှင့်အမျှ မော်ဒယ်ငယ်များအား လေ့ကျင့်မှုအား ပိုမိုကောင်းမွန်အောင်ပြုလုပ်နည်းအား သုတေသနပြုရန်၊ အပြောင်းအလဲများကို ထပ်ခါတလဲလဲ ကြိုးစားခြင်း၊ ၎င်းတို့အား စမ်းသပ်ခြင်းနှင့် ရလဒ်များကို အသုံးပြု၍ နောက်ဘာကြိုးစားရမည်ကို ဆုံးဖြတ်ရန် မော်ဒယ်များအား တောင်းဆိုခဲ့ပါသည်။
မော်ဒယ်များသည် claude-code၊ OpenAI ၏ codex၊ kimi-code၊ grok-cli၊ qwen-code နှင့် Prime Intellect ၏ကိုယ်ပိုင် prime-agent — အပါအဝင်- အေးဂျင့်ကြိုးအမျိုးမျိုးဖြင့် လုပ်ဆောင်ခဲ့ပြီး အဖွဲ့သည် run မှုတိုင်း၏ တိုကင်သုံးစွဲမှု၊ စမ်းသပ်မှုအရေအတွက်၊ ကိရိယာခေါ်ဆိုမှုများနှင့် ကုန်လွန်သွားသော အေးဂျင့်အချိန်တို့ကို ခြေရာခံခဲ့သည်။ စုစုပေါင်း၊ စမ်းသပ်မှုတွင် ထိပ်တန်းမော်ဒယ်တစ်ခုလျှင် တိုကင်ပေါင်း သန်းရာနှင့်ချီပြီး ဇယားကွက်အပြည့်ဖြင့် ဘီလီယံပေါင်းများစွာကို အသုံးပြုခဲ့သည်။
Leaderboard - Fable 5 သည် Pack ကို ဦး ဆောင်သည်။
ခေါင်းစီးရလဒ်- Claude-code ကြိုးကြိုးကိုဖြတ်၍ လည်ပတ်နေသည့် Fable 5 အဖြစ်သတ်မှတ်ထားသော မော်ဒယ်သည် အခြေခံစာရင်းစာရွက်နှင့် လူ့မှတ်တမ်းကြား ကွာဟမှု၏ 81.7 ရာခိုင်နှုန်းကို ပိတ်လိုက်ပြီး၊ ဦးဆောင်သူစာရင်းဇယား၏ မက်ထရစ်တွင် အကောင်းဆုံး 2,726 ရလဒ်ဖြင့် အတည်ပြုထားသည်။ အဲဒီကိုရောက်ဖို့ ၈.၇ ရက်ကြာ၊ အကြမ်းဖျင်း တိုကင်ပေါင်း သန်း ၈၀၀၊ စမ်းသပ်မှု ၈၁၁ ခုနဲ့ တူးလ်ဖုန်းခေါ်ဆိုမှု ၃၀၀၀ လောက်ကြာပါတယ်။
Chasing pack ကို 53.6 ရာခိုင်နှုန်း ကွာဟမှုကို ပိတ်ပေးသော Opus 5 မှ ဦးဆောင်ကာ Prime Intellect ၏ prime-agent harness (နှင့် kimi-code မှတဆင့် 45.8 ရာခိုင်နှုန်း) ဖြင့် မောင်းနှင်လာသောအခါ Kimi K3 က 52.2 ရာခိုင်နှုန်းဖြင့် အနီးကပ်လိုက်ပါသည်။ Opus 4.8 သည် 39.4 ရာခိုင်နှုန်းကို စီမံခန့်ခွဲနိုင်ပြီး GPT-5.6 အမျိုးအစားများစွာသည် အကြမ်းဖျင်းအားဖြင့် 11 နှင့် 36 ရာခိုင်နှုန်းကြားတွင် ဆင်းသက်လာကာ Sonnet 5 သည် 26.8 ရာခိုင်နှုန်းနှင့် Grok 4.5 နှင့် Qwen3.8 Max တစ်ခုစီတွင် 24.6 ရာခိုင်နှုန်းခန့်အထိ ရောက်ရှိခဲ့သည်။
ထို့အပြင် DeepSeek V4 Pro သည် ကွာဟချက်၏ 12.3 ရာခိုင်နှုန်းကို ပိတ်ခဲ့ပြီး GPT-5.5 သည် 8.1 ရာခိုင်နှုန်းသို့ ရောက်ရှိကာ အဟောင်း Kimi K2.7 သည် 7.2 ရာခိုင်နှုန်းဖြင့် ပြီးဆုံးခဲ့သည်။ ထူးခြားသည်မှာ၊ မကြာသေးမီကထွက်ရှိထားသောမော်ဒယ်တစ်ခုဖြစ်သည့် GLM 5.3 — သည် ထုတ်ဝေချိန်၌ တရားဝင်မှတ်တမ်းမရှိသေးဘဲ ဆက်လက်လည်ပတ်နေသေးသည်၊၊ စံသတ်မှတ်ချက်သည် ၎င်းတို့၏ကိုယ်ပိုင်တိုးတက်မှုများကို ခိုင်လုံစွာမစစ်ဆေးနိုင်သောမော်ဒယ်များကို အပြစ်ပေးကြောင်း သတိပေးချက်တစ်ခုဖြစ်သည်။
##ဘာကြောင့်အရေးကြီးတာလဲ။
ကုဒ်နံပါတ် ဦးဆောင်ဘုတ်များ မတိုင်းတာနိုင်သော အရာတစ်ခုဖြစ်သည့် စံညွှန်းများသည်- စစ်မှန်သော သုတေသန ကွင်းဆက်—ယူဆချက်၊ စမ်းသပ်မှု၊ ခွဲခြမ်းစိတ်ဖြာမှု၊ ပြန်လည်ပြင်ဆင်မှု— မိနစ်များထက် နေ့ရက်များအတွင်း စစ်မှန်သော သုတေသနလုပ်ငန်းကို လုပ်ဆောင်နိုင်ခြင်းကြောင့်ဖြစ်သည်။ ထိုစွမ်းရည်သည် AI သုတေသနနယ်ပယ်တွင် ပေါ်ပေါက်လာသော ကိုယ်ပိုင်အုပ်ချုပ်ခွင့်ရနယ်ပယ်၏ အခြေခံအုတ်မြစ်ဖြစ်ပြီး အေးဂျင့်များသည် spec တွင် ကုဒ်ရေးရန် တာဝန်မပေးဘဲ ၎င်းတို့ကို မည်သူမျှ ပြသထားသည့်အရာများကို ရှာဖွေတွေ့ရှိခြင်းဖြင့်သာ ဖြစ်သည်။
ရလဒ်များ ပျံ့နှံ့မှုသည် သူ့အလိုလို သတင်းပေးသည်။ ပရောဂျက်၏ရေးသားချက်အရ၊ စမ်းသပ်မှုတွင် မော်ဒယ်တိုင်းနီးပါးသည် တူညီသောအောင်မြင်သောစိတ်ကူးများကို တွေ့ရှိခဲ့သည် — အကောင်းဆုံးလုပ်ဆောင်မှုများကို ပိုင်းခြားထားသည်မှာ လက်တွေ့စမ်းသပ်မှုတစ်ခု၏နောက်ကွယ်တွင်ကျန်ရှိနေသည်- ပိုမိုအားကောင်းသောအေးဂျင့်များသည် ၎င်းတို့ကိုအတည်ပြုနိုင်လောက်အောင် ဆူညံသောရလဒ်များတွင် အားနည်းသောအချက်ပြမှုများကို ကြာရှည်စွာထိန်းသိမ်းထားပြီး ၎င်းတို့၏ကိုယ်ပိုင်စမ်းသပ်ဒေတာကို ပိုမိုကောင်းမွန်စွာနားလည်နိုင်သည်။
##အသိုက်အဝန်းမှ သတိပေးချက်များ
ဟက်ကာသတင်း မှတ်ချက်ပေးသူများသည် တရားမျှတသော နည်းစနစ်ကျသော အချက်များကို ထုတ်ဖော်ခဲ့ကြသည်။ မော်ဒယ်များတွင် ကြိုးစားမှု ဆက်တင်များနှင့် ကြိုးကြိုးများသည် ကွဲပြားသည် — Fable 5 သည် Opus 5 တွင် အမြင့်ဆုံးတွင် လုပ်ဆောင်နေချိန်တွင် မြင့်မားသော ကျိုးကြောင်းဆီလျော်မှု ဆက်တင်တွင် လုပ်ဆောင်ခဲ့သည် — နှင့် မော်ဒယ် 18 ခုတွင် 153 ပြေးခြင်း၏ ဂဏန်းသင်္ချာသည် အချို့သောမော်ဒယ်များထက် ကြိုးစားမှုကို အခြားမော်ဒယ်များထက် ပိုမိုရရှိခဲ့သည်ကို ဆိုလိုသည်။ မော်ဒယ်တစ်ဦး၏ အဆင့်သတ်မှတ်ချက်သည် ၎င်း၏ သုတေသနစွမ်းရည်ကို ထင်ဟပ်စေခြင်း ရှိမရှိ သို့မဟုတ် ၎င်း၏ကြိုးသိုင်းအရည်အသွေးသည် ပွင့်ပွင့်လင်းလင်း မေးခွန်းထုတ်စရာဖြစ်နေဆဲဖြစ်သည်။
သို့တိုင် ခရီးဦးတည်ချက်က ရှင်းပါသည်။ အလျင်မြန်ဆုံးလူသားလက်များသည် လက်ရှိစံချိန်ကိုရောက်ရှိရန် နှစ်ပေါင်းများစွာစုပေါင်းကြိုးပမ်းခဲ့ကြသောအခါ၊ အကောင်းဆုံးကိုယ်ပိုင်အုပ်ချုပ်ခွင့်ရအေးဂျင့်များသည် ယခုအခါတွက်ချက်ချိန်တစ်ပတ်ကျော်အနည်းငယ်အတွင်း ထိုကွာဟချက်အများစုကို ပိတ်ပစ်လိုက်ကြသည်။ နောက်မေးခွန်း - ကျန်ရှိသော 18.3 ရာခိုင်နှုန်းကို မည်သည့်မော်ဒယ်မဆို ပိတ်နိုင်သည်ဖြစ်စေ - မျှော်လင့်ထားသည်ထက် စောလျင်စွာ အဖြေပေးနိုင်ပါသည်။
AI ၏ နယ်နိမိတ်ပုံသဏ္ဍာန် စံနှုန်းများနှင့် သုတေသနပြုချက်များဆိုင်ရာ နောက်ထပ်အချက်အလက်များအတွက် AI Buzz Wire ၏ ဆက်လက်ဖော်ပြချက်ကို လိုက်နာပါ။
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →