Sakana AI သည် "Beyond Imitation" ကိုထုတ်ဝေသည့် Transactions on Machine Learning Research (TMLR) ဂျာနယ်တွင် လူသားသုံးသပ်ချက်များကိုတုပမည့်အစား အမှားထောက်လှမ်းခြင်းအတွက်တည်ဆောက်ထားသော LLM-assisted peer review system ကိုဖော်ပြသည့် သုတေသနစာတမ်းတစ်စောင်ကို MarkTechPost က အောက်တိုဘာလ 10 ရက်နေ့တွင်ဖော်ပြခဲ့သည်။ အဓိကမေးခွန်းမှာ တိုကျိုအခြေစိုက်ဓာတ်ခွဲခန်းမှ အဖြေထုတ်ရမည့်အစား AI ၏ပြန်လည်သုံးသပ်ချက်အဆင့်တွင် မည်ကဲ့သို့တိုက်ဆိုင်နိုင်သည်ကို ပြန်လည်သုံးသပ်ခြင်းအစား၊ စိုက်တာ မှားနေသလား။

အဖွဲ့သည် အမှားအယွင်းရှာဖွေခြင်းအတွက် ဆန့်ကျင်ဘက်စံနှုန်းတစ်ခု၊ နှင့် စမ်းသပ်မှုတိုင်းကို ဦးဆောင်သည့် အခြေခံအလွှာအားလုံးကို ဦးဆောင်သည့် Multi-Layered Review (MLR) စနစ်ဖြင့် အဖွဲ့သည် ရှေးဟောင်းပစ္စည်းနှစ်ခုကို ပေးပို့ခဲ့သည်။ သက်တူရွယ်တူပြန်လည်သုံးသပ်မှုကို မြှင့်တင်ရန်အတွက် AI ကိုအသုံးပြုရန် စိတ်ဝင်စားမှုတိုးလာချိန်တွင် ရလဒ်များထွက်ပေါ်လာသည် — တင်သွင်းမှုပမာဏများပြားလာခြင်းမှ တင်းမာနေသည့်လုပ်ငန်းစဉ်တစ်ခုဖြစ်သည်။ AI သည် သုတေသနကို သူ့ဘာသာသူ ပြန်လည်ပုံဖော်နေပုံအကြောင်း ပိုမိုသိရှိရန်၊ ကျွန်ုပ်တို့၏ နောက်ဆုံးပေါ် AI ဖွံ့ဖြိုးတိုးတက်မှုများ ကို လိုက်နာပါ။

စိုက်ထားသော အမှားများ၏ စံသတ်မှတ်ချက်တစ်ခု

Contradiction Benchmark သည် အစစ်အမှန်စာရွက်များတွင် အမှားအယွင်းများကို ထည့်သွင်းပြီး ဝေဖန်သုံးသပ်သူများသည် ၎င်းတို့ကို ဖမ်းမိခြင်းရှိမရှိ စစ်ဆေးသည်။ သုတေသီများသည် ACL၊ AISTATS၊ CVPR နှင့် ICML 2025 နှင့် NeurIPS 2024 တို့မှ CC-licensed စာတမ်း 257 ခုကို စုဆောင်းခဲ့ပြီး စာရွက်တစ်ခုစီ၏ တောင်းဆိုချက်၊ အထောက်အထားများနှင့် နည်းလမ်းများကို အသိပညာဂရပ်တစ်ခုတည်ဆောက်ရန် Gemini 2.5 Pro ကို အသုံးပြုခဲ့သည်။

ပြင်းထန်မှုကို ဖွဲ့စည်းတည်ဆောက်ပုံအရ သတ်မှတ်ထားသည်- စာရွက်၏ "ပင်မအရေးဆိုမှု" မှ node ၏အကွာအဝေးသည် အမှားမည်မျှဗဟိုချက်ဖြစ်သည်ကို ဆုံးဖြတ်သည်။ အကွာအဝေး သုညသည် ပင်မအရေးဆိုမှုကို ထိမှန်သည်၊ ပိုကြီးသောအကွာအဝေးများသည် ပံ့ပိုးပေးသည့်အသေးစိတ်အချက်အလက်များကို ထိမှန်သည်။ GPT-4.1 သည် အကွာအဝေးတစ်ခုလျှင် node တစ်ခုအား ဆန့်ကျင်ဘက်တစ်ခုအဖြစ် ပြန်လည်ရေးသားပြီး စုစုပေါင်းဒေတာ 1,164 မှတ်ကိုထုတ်ပေးသည်။ o3 တရားသူကြီးသည် သုံးသပ်ချက်တစ်ခုစီတိုင်းကို ဆယ်ကြိမ် အမှတ်ပေးသည်။ သန့်ရှင်းသောစာရွက်များပေါ်တွင်တရားသူကြီးသည် 99.9% တိကျမှုသို့ရောက်ရှိခဲ့ပြီး ၎င်းသည် ကိုယ်တိုင်အတည်ပြုထားသောဖမ်းမိမှုများအတွက် 86.8% အထိအခိုက်မခံကြောင်းပြသခဲ့သည် — ဆိုလိုသည်မှာ အစီရင်ခံတင်ပြထားသောရှာဖွေတွေ့ရှိမှုရမှတ်များသည် အမှန်တကယ်ရှေးရိုးစွဲဖြစ်နိုင်သည်။

Multi-Layered Review အလုပ်လုပ်ပုံ

MLR သည် စင်ပြင်ပရှိ Claude မော်ဒယ်များပေါ်တွင် လုပ်ဆောင်နေသည့် အထူးပြုအေးဂျင့် သုံးခုမှ စုစည်းထားသော စာရွက်တစ်ရွက်ကို မဝေဖန်မီ နားလည်နိုင်သော အေးဂျင့်စနစ်တစ်ခုဖြစ်သည် — GPU အစုအဝေးမရှိခြင်းနှင့် ကောင်းစွာချိန်ညှိရန် မလိုအပ်ပါ။

  • နောက်ဆက်တွဲ အေးဂျင့် (Claude Haiku 3.5)- နောက်ဆက်တွဲမှ လက်တွေ့စမ်းသပ်မှုများနှင့် အကောင်အထည်ဖော်မှုအသေးစိတ်များကို အကျဉ်းချုပ်ဖော်ပြသည်။
  • Literature Review Agent (Claude Sonnet 4၊ ချန်လှပ်ထားနိုင်သည်) သည် စာရွက်ကို အရင်အလုပ်ကိစ္စတွင် ထည့်သွင်းရန် ဝဘ်ရှာဖွေမှုကို အသုံးပြုသည်။
  • Review Agent (Claude Sonnet 4) သည် ကွန်ပျူတာသိပ္ပံပညာရှင် S. Keshav ၏ လူသိများသော "Three-Pass Approach" မှ လှုံ့ဆော်ပေးသည့် 3-pass prompt ကွင်းဆက်တစ်ခုကို လုပ်ဆောင်သည် — ပထမအဆင့်မြင့်ကောက်ကြောင်းတစ်ခု၊ ထို့နောက် အသေးစိတ်ဖတ်ရန် အလံတင်ထားသော အားနည်းချက်များ၊ ယူဆချက်များနှင့် ကွာဟချက်များနှင့် နောက်ဆုံးတွင် အားနည်းချက်များ၊ မေးခွန်းများ၊ စာရင်းများ၊ အားသာချက်များအဖြစ် အေးဂျင့်အားလုံး၏ အားနည်းချက်များ၊

PDF ကို မော်ဒယ်များထံ တိုက်ရိုက် ပေးပို့ထားသောကြောင့် ကိန်းဂဏန်းများနှင့် ညီမျှခြင်းများ ဆက်လက်လုပ်ဆောင်နေပါသည်။ စနစ်သည် ပင်မစာသား၏ စာမျက်နှာ 10 အထိ ဖတ်နိုင်ပြီး Sakana သည် သုံးသပ်ချက်တစ်ခုလျှင် $0.47 ခန့် ကုန်ကျသည်။

ရလဒ်များ- ဒီဇိုင်းနှင့် မော်ဒယ်ရွေးချယ်မှု နှစ်ခုစလုံး အရေးကြီးသည်။

MLR သည် စံသတ်မှတ်ချက်တွင် စမ်းသပ်ထားသော စနစ်လေးခုလုံးကို ဦးဆောင်ခဲ့သည်။ အမှီအခိုကင်းသော သုံးသပ်ချက်လေးခုဖြင့်၊ ၎င်းသည် အဓိက-အရေးဆိုမှု (အကွာအဝေး-သုည) ဆန့်ကျင်ကွဲလွဲမှုများ၏ 73.43% နှင့် အလုံးစုံ 40.95% ကို ရရှိခဲ့သည်။ AgentReview ဟုခေါ်သော အကောင်းဆုံး အခြေခံအချက်ဖြစ်သည့် စနစ်သည် အဓိက အရေးဆိုမှုများတွင် 14.81% ကိုသာ စီမံခန့်ခွဲခဲ့သည်။ MLR ပြန်လည်သုံးသပ်ချက်တစ်ခုတွင်ပင် core-claim အမှားများ 60.79% ကိုဖမ်းမိခဲ့သည်။

ablation လေ့လာမှုတစ်ခုသည် ဒီဇိုင်း၏ပံ့ပိုးကူညီမှုကို မော်ဒယ်ရွေးချယ်မှုနှင့် ပိုင်းခြားထားသည်။ Claude Sonnet 4 အတွက် လက်ရှိပြန်လည်သုံးသပ်မှုပိုက်လိုင်းအတွင်းရှိ GPT-4.1 ကို လဲလှယ်ခြင်းသည် core-claim detection ကို 14.56% မှ 35.40% သို့ ရုတ်သိမ်းလိုက်သော်လည်း MLR ၏ multi-agent ဒီဇိုင်းသည် ပြန်လည်သုံးသပ်ချက်တစ်ခုအတွက် အပေါ်မှ အကြမ်းဖျင်းအားဖြင့် 25 ရာခိုင်နှုန်းကို ထပ်မံထည့်သွင်းထားသည်။ ပြင်းထန်မှု အမှတ်ပေးမှုကို ထောက်ခံသည်ဟု စာရေးသူဆိုသော အမှားများက အဓိက အရေးဆိုမှုမှ ဝေးကွာသွားသောအခါ ထောက်လှမ်းမှု တိကျမှု ကျဆင်းသွားသည်။

ရုပ်ပုံသည် ပိုဆိုးသော၊ လက်တွေ့ကမ္ဘာဒေတာပေါ်တွင် မှောင်သွားပါသည်။ WithdrarXiv-Check တွင်၊ အမှန်တကယ် ပြန်လည်ရုပ်သိမ်းလိုက်သော arXiv စာရွက် 211 အုပ်တွင် MLR သည် "အလားတူ" ပွဲစဉ်များတွင် 26.07% နှင့် အတိအကျကိုက်ညီမှုတွင် 16.11% ရခဲ့သည် — နှင့် စနစ်သည် စာမူထဲတွင် ထည့်သွင်းထားသော လျှို့ဝှက်ထိုးသွင်းမှုတွင် အားနည်းချက်ရှိနေပါသည်။ တစ်နည်းဆိုရသော် အတုယူထားသော ဆန့်ကျင်ကွဲလွဲမှုများကို ဖမ်းဆုပ်ခြင်းထက် အစစ်အမှန် နုတ်ယူထားသော စာရွက်များကို ဖတ်ခြင်းသည် ပို၍ ခက်ခဲသည်။

Peer Review အတွက် ဘာကိုဆိုလိုလဲ။

လေ့လာမှု၏ လက်တွေ့အကျဆုံး ထုတ်ယူလိုက်သည့်အရာသည် ၎င်း၏ ဆွဲဆောင်မှုအနည်းဆုံးဖြစ်နိုင်သည်- စနစ်ဒီဇိုင်းနှင့် မော်ဒယ်ရွေးချယ်မှု နှစ်ခုစလုံးသည် အမှားအယွင်းရှာဖွေတွေ့ရှိမှုကို ရွေ့လျားစေပြီး၊ မဆုံးဖြတ်မီ ဖတ်ရှုသော သုံးသပ်သူများသည် လူသားသုံးသပ်ချက်စာသားနှင့် ကိုက်ညီသည့် ပုံစံထက် ပိုလေးနက်သော အမှားအယွင်းများကို တွေ့ရှိကြသည်။ AI-အကူအညီဖြင့် ပြန်လည်သုံးသပ်ခြင်းဆိုင်ရာ ရှေ့လုပ်ဆောင်မှုအများစုသည် လူ့စီရင်ဆုံးဖြတ်ခြင်းဆိုင်ရာ သဘောတူညီချက်အတွက် အကောင်းမွန်ဆုံးဖြစ်သည်—စစ်မှန်သောစိစစ်မှုထက် ယုံကြည်စိတ်ချမှုရှိသော လိုက်လျောညီထွေမှုကို ဆုချသည့် မက်ထရစ်တစ်ခုဖြစ်သောကြောင့် ယင်းထူးခြားချက်မှာ အရေးကြီးပါသည်။

Sakana ၏ရလဒ်များက AI သည် လူသားဒိုင်လူကြီးများကို အစားထိုးရန် အဆင်သင့်ဖြစ်နေပြီဟု အကြံပြုထားခြင်းမရှိပါ — စစ်မှန်သောပြန်ရုတ်သိမ်းထားသောစာရွက်များတွင် အမှားအယွင်းအများစုကိုလွတ်သွားကာ embedded prompts ဖြင့် ခြယ်လှယ်နိုင်သည့်စနစ်သည် အခွင့်အာဏာမဟုတ်ဘဲ အထောက်အကူပြုအလွှာတစ်ခုအဖြစ် သဘောထားအကောင်းဆုံးဖြစ်သည်။ စံနှုန်း၏ ပေါင်းစပ်အမှားအယွင်းများသည် ကိန်းဂဏန်းဆိုင်ရာ ရှုပ်ထွေးမှုများနှင့် သက်တူရွယ်တူပြန်လည်သုံးသပ်မှုတွင် စစ်မှန်သောသဘောထားကွဲလွဲမှုများကိုလွှမ်းမိုးထားသည့် ပြိုင်ဆိုင်ထားသော အဓိပ္ပာယ်ဖွင့်ဆိုချက်များထက် ပိုမိုသန့်ရှင်းသည်၊ ထို့ကြောင့် စိုက်ထားသောဆန့်ကျင်ဘက်များကို စွမ်းဆောင်ရည်ကို ကတိတစ်ခုမဟုတ်ဘဲ မျက်နှာကျက်အဖြစ် ဖတ်သင့်သည်။

သို့သော် သုံးသပ်ချက်တစ်ခုလျှင် $0.47 နီးပါးဖြင့် စမ်းသပ်ထားသည့် မည်သည့်စနစ်၏ အမြင့်ဆုံးအမှား-ထောက်လှမ်းမှုနှုန်းဖြင့် AI သုံးသပ်သူများသည် ဆန့်ကျင်ကွဲလွဲမှုများကို AI သုံးသပ်သူများကိုင်တွယ်သည့် ပထမအကြိမ်စခရင်ကို ကိုင်တွယ်ဖြေရှင်းသည့် အနီးအနားတွင် MLR က ထောက်ပြသည်။ LLM-အကူအညီဖြင့် ပြန်လည်သုံးသပ်ခြင်းကို စမ်းသပ်နေသည့် ဂျာနယ်များနှင့် ညီလာခံစီစဉ်သူများသည် ယခုအခါ ၎င်းတို့၏ကိုယ်ပိုင်စနစ်များကို တိုင်းတာရန်အတွက် အများသူငှာ စံနှုန်းတစ်ခုနှင့် ခိုင်မာသောအခြေခံအချက်များကို နှစ်ခုလုံးရှိနေပြီ — နှင့် 73.43% နှင့် 14.81% အကြား ကွာဟချက်မှာ ရှိနေပါက၊ ဖတ်ရှုခြင်းဗိသုကာလက်ရာသည် အကြမ်းထည် မော်ဒယ်အရွယ်အစားထက် ပိုအရေးကြီးကြောင်း ရှင်းရှင်းလင်းလင်း သိသာထင်ရှားသောအချက်တစ်ခုဖြစ်သည်။

---

AI ၏ရှေ့တွင်နေရန်

နောက်ဆုံးပေါ် AI သတင်းများ၊ ခွဲခြမ်းစိတ်ဖြာမှုနှင့် အောင်မြင်မှုများ—အားလုံးကို တစ်နေရာတည်းတွင် ရယူပါ။

AI သတင်းအပြည့်အစုံကို ဖတ်ရှုရန် →