University of Oxford နှင့် University College London တို့ရှိ FAIR မှ သုတေသနအဖွဲ့သည် AI Research Preference Models (RPMs) ကို မိတ်ဆက်ခဲ့ပြီး မည်သည့်စက်သင်ယူမှုစမ်းသပ်မှုတွင် ကိုယ်ပိုင်အုပ်ချုပ်ခွင့်ရ သုတေသနအေးဂျင့်သည် အမှန်တကယ်လုပ်ဆောင်သင့်သည်ကို ဆုံးဖြတ်သည့်နည်းလမ်းကို မိတ်ဆက်ပေးခဲ့သည်။ စမ်းသပ်မှုတစ်ခုတွင် ရမှတ်မည်မျှရနိုင်သည်ကို ခန့်မှန်းမည့်အစား RPM သည် မလုပ်ဆောင်ရသေးသည့် ကိုယ်စားလှယ်လောင်းများကို အဆင့်သတ်မှတ်ကာ အလားအလာအရှိဆုံးကို ရွေးချယ်ကာ AI-မောင်းနှင်သော သုတေသနတွင် အမှန်တကယ် ပိတ်ဆို့မှုကို ဖြေရှင်းပေးသည်- အလုပ်နှင့်ပတ်သက်သော MarkTechPost ၏ အစီရင်ခံစာအရ အဆိုပါအဖွဲ့သည် အလုပ်နှင့်ပတ်သက်သော MarkTechPost ၏ အစီရင်ခံစာအရ သိရသည်။

သုတေသနအေးဂျင့်များသည် ၎င်းတို့၏ကိုယ်ပိုင်စမ်းသပ်ချက်များကို အဆိုပြု၊ အကောင်အထည်ဖေါ်ပြီး အမှတ်ပေးနေပြီဖြစ်သည့်အချိန်တွင် စိတ်ကူးသည် ပေါ်လာသည်။ အိုင်ဒီယာမျိုးဆက်သည် စျေးပေါသည်။ ကွပ်မျက်ခြင်းမဟုတ်ပါ။ ကိုယ်စားလှယ်လောင်းတစ်ဦးတည်းကို လေ့ကျင့်သင်ကြားခြင်းသည် GPU အချိန်နာရီများအထိ ကုန်ဆုံးနိုင်ပြီး၊ ထို့ကြောင့် ကိုယ်စားလှယ်တစ်ဦးသည် လုပ်ဆောင်ရန် တတ်နိုင်သည်ထက် များစွာပိုသော စမ်းသပ်မှုများကို မလွှဲမရှောင်သာ အဆိုပြုပါသည်။ ဘယ်ကိုယ်စားလှယ်လောင်းတွေကို ကွပ်မျက်ရမလဲဆိုတာကတော့ အဖွဲ့က ဘောင်ခတ်ထားသလို၊ သုတေသနတိုးတက်မှုအတွက် တကယ့် လီဗာဖြစ်ပါတယ်။ ၎င်းတို့၏ တွက်ချက်မှု ဘေလ်များ တက်လာခြင်းကို စောင့်ကြည့်နေသည့် ဓာတ်ခွဲခန်းများအတွက်၊ ထိုဘောင်များသည် သုတေသန အလိုအလျောက် လုပ်ဆောင်မှုတွင် နောက်ဆုံးပေါ် AI တိုးတက်မှုများကို အာရုံစူးစိုက်စေသည့် အကြောင်းရင်း အတိအကျ ဖြစ်သည်။

စမ်းသပ်ရွေးချယ်မှုသည် အဘယ်ကြောင့် ပိတ်ဆို့နေသနည်း။

အကြွင်းမဲ့ မက်ထရစ်များ သို့မဟုတ် အကောင်အထည်ဖော်မှုရလဒ်များကို ခန့်မှန်းရာတွင် ဘာသာစကားမော်ဒယ်များသည် ယုံကြည်စိတ်ချရခြင်းမရှိကြောင်း အဖွဲ့မှတွေ့ရှိခဲ့သည်။ မော်ဒယ်တစ်ဦးသည် ကိုယ်စားလှယ်လောင်း၏ စမ်းသပ်မှုကို ကြည့်ရှု၍ ရရှိမည့်ရမှတ်ကို တိကျစွာ မခန့်မှန်းနိုင်ပါ။ ၎င်းသည် လုပ်ဆောင်နိုင်သည်များကို သုတေသီများတွေ့ရှိခဲ့သည်မှာ၊ ကိုယ်စားလှယ်လောင်းနှစ်ဦးတွင် မည်သည့်လောင်းကြေးက ပိုကောင်းသည်ကို အဆုံးအဖြတ်ပေးခြင်းဖြစ်သည်— ပကတိခန့်မှန်းချက်ထက် ဆွေမျိုးနှိုင်းယှဉ်မှုဖြစ်သည်။ RPM များသည် ထိုထူးခြားချက်တစ်ဝိုက်တွင် လုံး၀တည်ဆောက်ထားပါသည်- ၎င်းတို့သည် ရမှတ်တစ်ခုအား ဘယ်သောအခါမှ မခန့်မှန်းနိုင်ဘဲ အဆင့်သတ်မှတ်ခြင်းသာဖြစ်သည်။

စနစ်သည် လောဘကြီးသော မိဘရွေးချယ်မှုနှင့် Draft၊ Improve နှင့် Debug အော်ပရေတာများမှတစ်ဆင့် စက်သင်ယူမှုစမ်းသပ်မှုများကို ထုတ်ပေးသည့် အဖွင့်-ရင်းမြစ် ဆင့်ကဲဖြစ်စဉ်သစ်ပင်ရှာဖွေရေးအခင်းဖြစ်သည့် AIRA-dojo တွင် လုပ်ဆောင်ပြီး အဆုံးတွင် အမြင့်ဆုံးအတည်ပြုချက်ရမှတ်ကို ပြန်ပေးသည်။ စံချိန်စံညွှန်း၊ AIRS-Bench သည်လည်း ပွင့်လင်းသောအရင်းအမြစ်ဖြစ်သည်။ Scaffold နှင့် preference model နှစ်ခုလုံးကို ၎င်းတို့၏ ကျောရိုးအဖြစ် Qwen3.6-27B ကို အသုံးပြုထားပြီး အသင်းမှ မှတ်သားထားသည့် အလေးများဖြစ်သည်။

နောက်ကောက်ပွဲက ဘယ်လိုလဲ။

ကလေးစမ်းသပ်မှုတစ်ခုပြုလုပ်ပြီး ၎င်းကိုလုပ်ဆောင်မည့်အစား၊ အေးဂျင့်သည် မလုပ်ဆောင်ရသေးသော ကိုယ်စားလှယ်လောင်း 15 ဦးကိုထုတ်လုပ်ရန် အပြိုင်အော်ပရေတာတစ်ခုအား 15 ကြိမ်အပြိုင်အသုံးပြုသည်။ ထို့နောက် RPM သည် ၎င်းတို့ကို နောက်ကောက်ကျသည့်ပြိုင်ပွဲတွင် အတွဲလိုက် နှိုင်းယှဉ်ကာ အနိုင်ရသူကိုသာ ကွပ်မျက်သည်။ နှိုင်းယှဉ်မှုတစ်ခုစီသည် စူးစမ်းလေ့လာထားသောသစ်ပင်၏ အနံပထမလှမ်းဖြင့် စုဆောင်းထားသော ဆက်စပ်ဆုံမှတ်များတွင် အခြေခံထားပြီး ကိုယ်စားလှယ်တစ်ဦးစီသည် ၎င်း၏ဘိုးဘေးများ၏ တရားဝင်ရမှတ်များနှင့်အတူ ပြသထားသောကြောင့် တရားသူကြီးသည် လစ်ဟာနေမည့်အစား အေးဂျင့်၏ အမှန်တကယ်ရှာဖွေမှုမှတ်တမ်းမှ အကြောင်းပြချက်ပေးသည်။

စာတမ်းတွင် မတူညီသော တွက်ချက်မှုဘတ်ဂျက်များဖြင့် ပုံစံကွဲနှစ်မျိုးကို ဖော်ပြသည်-

  • Inference-only RPM — လျှောက်ထားသူအစီအစဥ်များ၊ ကုဒ်နှင့် ရှာဖွေမှုမှတ်တမ်းကို ဖြတ်သန်းခွင့်တစ်ခုတည်းတွင် နှိုင်းယှဉ်ပေးသည့် LLM-as-a-judge တစ်ခု။ ၎င်း၏အချက်ပြမှုကို DSPy မူဘောင်မှ MIPROv2 ဖြင့် အကောင်းဆုံးပြင်ဆင်ပြီး အဖွဲ့မှ အဓိက-စုံစမ်းစစ်ဆေးသူ ရူဘရစ်ဟုခေါ်သည့်အရာအပေါ် ပေါင်းစပ်ထားသည်- ၎င်းသည် ပြုပြင်နိုင်သော ချို့ယွင်းချက်များကို ခံနိုင်ရည်ရှိပြီး တိုးချဲ့နိုင်မှုကို ဆုပေးကာ မလိုအပ်သော သုတေသနလမ်းညွှန်ချက်များကို အပြစ်ပေးသည်။ အော့ဖ်လိုင်း နှိုင်းယှဉ်မှု တိကျမှုကို 57.7 မှ 59.0 ရာခိုင်နှုန်းအထိ တိုင်းတာသည်။
  • Agentic RPM - Python၊ Bash နှင့် တင်သွင်းမှုဖြေရှင်းချက်လုပ်ဆောင်ချက် ကန့်သတ်ထားသော ကိရိယာများပါရှိသော H200 GPU တစ်ခုတည်းအပါအဝင် အေးဂျင့်၏ပတ်ဝန်းကျင်ကို ဖန်တီးထားသည့် သဲပုံးတစ်ခုနှင့် တူညီသောတရားသူကြီးတစ်ဦး။ ၎င်းသည် အသေးစား စမ်းသပ်မှုများအား လုပ်ဆောင်သည်၊ ထို့နောက် တုံ့ပြန်မှုပုံစံသည် အချက်အလက်အရှိဆုံး နောက်စမ်းသပ်မှုကို အဆိုပြုသည် သို့မဟုတ် ကွင်းဆက်ကို အဆုံးသတ်သည်။ လေယာဉ်မှူးများသည် စက္ကန့် 60 အတိုင်းအတာဖြင့် 30 တွင် ကန့်သတ်ထားပြီး ကျန်အချိန်ဘတ်ဂျက်ကို တမင်တကာ လွန်နေပါသည် — 2,700 စက္ကန့်ကို အစစ်အမှန် 300 နှင့် နှိုင်းယှဉ်တင်ပြသည် — ထို့ကြောင့် အေးဂျင့်သည် စောစီးစွာ ပိုမိုကောင်းမွန်အောင်ပြုလုပ်ခြင်းကို မရပ်တန့်ပါ။

တရားသူကြီးတစ်ဦးသည် အဓိက စုံစမ်းစစ်ဆေးသူကဲ့သို့ ညှိယူထားသည်။

အဓိက-စုံစမ်းစစ်ဆေးရေးမှူးဘောင်သည် တိတ်တဆိတ်စိတ်ဝင်စားစရာကောင်းသည့်အပိုင်းဖြစ်သည်။ အထင်ကြီးလောက်ဖွယ်ကောင်းသည့် ကိုယ်စားလှယ်များကို ဆုချီးမြှင့်မည့်အစား၊ အတွေ့အကြုံရှိ သုတေသီတစ်ဦးသည် အကြံဉာဏ်များကို တီထွင်ပုံကို ထင်ဟပ်စေသည်- ပြုပြင်နိုင်သည့် ဘာဂီကုဒ်သည် အဆုံးကိုလိုက်၍ ပွတ်တိုက်ထားသော ကုဒ်များနှင့် တည်ရှိနေသောသစ်ပင်ကို ပွားသည့် လမ်းညွှန်ချက်များသည် ဝတ္ထုတိုများထက် တန်ဖိုးနည်းပါသည်။ လက်ဖြင့်ချိန်ညှိခြင်းထက် အလျင်အမြန် ပိုမိုကောင်းမွန်အောင်ပြုလုပ်ခြင်းမှ သင်ယူခဲ့သော အဆိုပါ စည်းမျဉ်းသည် တိုးတက်မှုကို သယ်ဆောင်ပေးသည် ဟု အသင်း၏ အဆိုပြုချက်များအရ သိရသည်။

AIRS-Bench တွင် Benchmark ရလဒ်များ

အကဲဖြတ်ချက်တွင် အများသူငှာ စာသားနှင့် ဇယားအလုပ် 20 ပါ၀င်ပြီး အလုပ်တစ်ခုစီကို H200 နှင့် ကျပန်းမျိုးစေ့ 10 ခုတွင် 24 နာရီပေးသည်။ အရေးကြီးသည်မှာ၊ တူညီသော Qwen3.6-27B ကျောရိုးသည် စမ်းသပ်မှုအော်ပရေတာများနှင့် ဦးစားပေးမော်ဒယ်နှစ်ခုစလုံးကို စွမ်းဆောင်နိုင်သောကြောင့် အမြတ်များသည် ပိုမိုအားကောင်းသောတရားသူကြီးပုံစံထက် ရွေးချယ်မှုအလွှာမှရရှိခြင်းဖြစ်သည်။ ပျမ်းမျှ ပုံမှန်ရမှတ်များ-

  • RPM မရှိပါ (ကျပန်းရွေးချယ်): 0.684
  • Inference-only RPM: 0.711
  • Agentic RPM: 0.729
  • မှန်ကန်ကြောင်း ညွှန်ပြမှု (မျက်နှာကျက်) : 0.748
  • စမ်းသပ်မှု oracle (မျက်နှာကျက်): 0.759

ကျပန်းရွေးချယ်မှုထက် တိုးတက်မှု၏ဖြစ်နိုင်ခြေမှာ 0.5066 နှင့် 0.5018 ၏ 95 ရာခိုင်နှုန်းယုံကြည်မှုကြားကာလနည်းပါးသော 0.5018 ဘောင်များရှိသည့် Agentic တစ်ခုအတွက် 0.5923 နှင့် 0.5 သတ်မှတ်ချက်ထက် 0.5 ကန့်သတ်ချက်အထက်တွင်ဖြစ်သည်။

ထိရောက်မှုသည် လက်တွေ့ကျသောရလဒ်ဖြစ်သည်။ အနုမာန-သီးသန့် RPM သည် 14.88 နာရီအတွင်း ကျပန်းအခြေခံအဆင့်၏နောက်ဆုံးရမှတ် 0.684 သို့ရောက်ရှိခဲ့ပြီး 1.61x မြန်နှုန်းမြှင့်ကာ အေးဂျင့်ဗားရှင်းသည် 15.50 နာရီ၊ 1.55x အရှိန်မြှင့်ရန်လိုအပ်သည်။ ကိုယ်တိုင်လက်ခံကျင်းပသော တရားသူကြီးများ၏ ကောက်ချက်ချမှုအပေါ်တွင် စာရင်းအင်းများပင်လျှင် ချိန်ညှိထားသော နံပါတ်များသည် အဆင်သင့်ဖြစ်နေဆဲဖြစ်သည်။

ပွင့်လင်းသောအလေးနှင့် ရိုးသားစွာ သတိပေးချက်များ

RPMs များသည် ယနေ့ခေတ်တွင် တစ်စိတ်တစ်ပိုင်းသာ အသုံးပြုနိုင်သည်ဟု အဖွဲ့သည် ရှေ့တန်းတင်ပါသည်။ အစိတ်အပိုင်းများကို ဖွင့်ထားသည် — ကောင်းစွာချိန်ညှိခြင်းမရှိသော အေးခဲထားသောကြိုတင်လေ့ကျင့်ထားသောကျောရိုးများ၊ အဖွင့်အရင်းအမြစ် Scaffold နှင့် စံသတ်မှတ်ချက်များနှင့် အလေးမထားသောကျောရိုးပုံစံများ — သို့သော် အေးဂျင့်ဗားရှင်း၏ sandbox လိုအပ်ချက်နှင့် ၎င်း၏ရှေ့ပြေးစမ်းသပ်မှုအပေါ်မှ ဓာတ်ခွဲခန်းအများစုသည် အနုမြူဗားရှင်းဖြင့် စတင်မည်ဟု ဆိုလိုပါသည်။ လေယာဉ်မောင်းချိန်သည် အေးဂျင့်၏ကိုယ်ပိုင်နာရီနှင့် ယှဉ်ပြိုင်နေသောကြောင့် Debug သည် အေးဂျင့်မျိုးကွဲတွင် ကျပန်းရွေးချယ်မှုသို့ ပြန်ပြောင်းသွားသည်ကို သုတေသီများက သတိပြုမိပါသည်။

ပိုကြီးသော အရေးပါမှုသည် ဦးတည်ချက် ဖြစ်နိုင်သည်။ ကိုယ်ပိုင်အုပ်ချုပ်ခွင့်ရသုတေသနအေးဂျင့်များသည်သရုပ်ပြများမှစက်မှုဓာတ်ခွဲခန်းများတွင်နေ့စဥ်အသုံးပြုမှုသို့ပြောင်းရွှေ့လာသည်နှင့်အမျှ ရှားပါးသောအရင်းအမြစ်များသည် GPU နာရီများကိုစိတ်ကူးများမဟုတ်တော့ဘဲ၊ အချိန်ကြာလာသည်နှင့်အမျှ ပုံသေတွက်ချက်ထားသောဘတ်ဂျက်ဒြပ်ပေါင်းမှပိုမိုတိုးတက်မှုကိုညှစ်ထုတ်သည့်နည်းလမ်းများ။ မပြေးမီ အဆင့်သတ်မှတ်ခြင်းသည် ရိုးရှင်းသော အိုင်ဒီယာဖြစ်ပြီး AIRS-Bench နံပါတ်များက ၎င်းသည် အရေးပါလောက်အောင် ကောင်းမွန်စွာ လုပ်ဆောင်နိုင်သော အိုင်ဒီယာဖြစ်သည်ဟု အကြံပြုထားသည်။

AI ၏ရှေ့တွင်နေရန်

AI Buzz Wire တွင် မနက်ဖြန်၏မော်ဒယ်များကိုပုံဖော်မည့် သုတေသနကို ဆက်လက်လုပ်ဆောင်ပါ။ AI သတင်းအပြည့်အစုံကို ဖတ်ရှုရန် →