AI စနစ်သည် နောက်ဆုံးတွင် စက်များကို ဆယ်စုနှစ်များစွာ တုန်လှုပ်စေခဲ့သော ဂန္တဝင်ဘုတ်ဂိမ်း Stratego ကို သိမ်းပိုက်နိုင်ခဲ့ပြီး ဖိနပ်ကြိုးများဖြင့် ပြုလုပ်ထားသည်။ Carnegie Mellon University, MIT, New York University နှင့် Stanford University တို့မှ သုတေသီအဖွဲ့တစ်ဖွဲ့သည် Pim Niemeijer အား အကောင်းဆုံး Stratego ကစားသမားအဖြစ် သတ်မှတ်ခံထားရသော Ataraxos ဟုခေါ်သော AI ကို တည်ဆောက်ခဲ့ပြီး ပွဲစဉ် 15 ပွဲမှ 1 မှတ်အထိ ရမှတ် 4 ပွဲ သရေကျခဲ့ကြောင်း Ars Technica က ဖော်ပြခဲ့သည်။
ရလဒ်သည် စျေးနှုန်းအမှတ်ထက် အမှတ်အသားအတွက် သိသိသာသာ နည်းပါးသည်။ Ataraxos သည် တစ်ပတ်ခန့် GPU 16 ခုသာ လေ့ကျင့်သင်ကြားခဲ့ပြီး အဖော်မော်ဒယ်တစ်ခုကို လေ့ကျင့်ရန်အတွက် လေးရက်ကြာ ထပ်တိုး GPU လေးခုကို လေ့ကျင့်ပေးခဲ့သည် — လည်ပတ်မှုအဖွဲ့မှ ဒေါ်လာထောင်ဂဏန်းမျှသာ ကုန်ကျသည်ဟု ဆိုသည်။ ဂိမ်းတွင် AI အာရုံစူးစိုက်မှုကို ပထမဆုံးရရှိသည့် DeepMind ၏ DeepNash ၊ 2022 စနစ်သည် Google ၏ အထူးပြု TPU ချစ်ပ် 1,024 ခုတွင် နှစ်လမှ သုံးလကြာ လေ့ကျင့်သင်ကြားခဲ့ပြီး Ataraxos အဖွဲ့မှ လည်ပတ်သည့် ခန့်မှန်းချက်တစ်ခုသည် 2025 စျေးနှုန်းတွင် $3 သန်းနှင့် $4.5 သန်းကြား ကုန်ကျမည်ဖြစ်သည်။ For more context on this story, see our ongoing AI news.
ဘာကြောင့် Stratego က AI ကို ဆယ်စုနှစ်တွေကြာအောင် ရပ်တန့်ထားတာလဲ။
Deep Blue သည် 1997 ခုနှစ်တွင် စစ်တုရင်ပြိုင်ပွဲတွင် Garry Kasparov ကိုအနိုင်ယူခဲ့သည်။ AlphaGo သည် 2016 ခုနှစ်တွင် Lee Sedol ကို Go တွင်အနိုင်ယူခဲ့သည်။ Poker bot များသည် ပရော်ဖက်ရှင်နယ်များကို နှစ်ပေါင်းများစွာ အနိုင်ယူခဲ့သည်။ Stratego သည် DeepMind ၏ များပြားလှသော အရင်းအမြစ်များကိုပင် ဆန့်ကျင်ခဲ့သည်။
ဂိမ်း၏အခက်အခဲမှာ လျှို့ဝှက်အချက်အလက်များ၊ အတိုင်းအတာနှင့် အရှည်တို့၏ ပုံမှန်မဟုတ်သော ပေါင်းစပ်မှုမှ လာပါသည်။ ကစားသမားတစ်ဦးစီသည် စစ်ဗိုလ်အဆင့်မှ သူလျှိုအထိ၊ ဗုံးများနှင့် အလံကို ကိုယ်စားပြုသည့် အပိုင်း ၄၀ ကို အမိန့်ပေးသည်။ ပြိုင်ဘက်၏အလံကိုဖမ်းခြင်းဖြင့်သင်အနိုင်ရသည်။ မင်းရဲ့ပြိုင်ဘက်က မင်းရဲ့အပိုင်းအစတွေ ဘယ်မှာရှိလဲဆိုတာ သိနိုင်ပေမယ့် အဲဒါတွေက ဘာတွေလဲ။ အပိုင်းနှစ်ပိုင်း တိုက်မိသည့်အခါတွင် အထောက်အထားများကို ထုတ်ဖော်ပြသပြီး အားနည်းသောအပိုင်းကို ဖယ်ရှားသည်။
"Stratego တွင်၊ မည်သည့်အစီအစဥ်အတိုင်းဖြစ်စေနိုင်သောဘုတ်ပြားပေါ်တွင်အပိုင်း ၄၀ ရှိသည်" ဟု MIT ကွန်ပျူတာသိပ္ပံပညာရှင်နှင့်လေ့လာမှု၏ပူးတွဲရေးသားသူ Gabriele Farina က Ars Technica သို့ပြောကြားခဲ့သည်။ ၎င်းသည် လွန်ခဲ့သည့်နှစ်များက အက်ကွဲနေသော ဂိမ်းကွန်ပြူတာတစ်ခုဖြစ်သည့် Texas Hold'em ရှိ ဖြစ်နိုင်ခြေရှိသော လက်များ 1,326 ကို လျော့နည်းသွားစေပါသည်။ အရှည်သည် ပြဿနာကို ပေါင်းစပ်ထားသည်- "စစ်တုရင်တွင် များသောအားဖြင့် ဂိမ်းသည် အကြိမ် 40 ရွေ့လျားလေ့ရှိသော်လည်း Stratego တွင် ဂိမ်းတစ်ခုသည် ရွှေ့လျားမှု 2,000 ကို လွယ်ကူစွာ ကြာရှည်ခံနိုင်သည်" ဟု Farina ကဆိုသည်။
နောက်တော့ မှုန်ဝါးဝါး ရှိတယ်။ မာရှယ်ကဲ့သို့ အားနည်းသောအပိုင်းကို ရွှေ့ခြင်းသည် ပြိုင်ဘက်ကို ကြောက်လန့်စေနိုင်သော်လည်း မကြာခဏဆိုသလို ဖြီးဖြန်းပြီး ခြိမ်းခြောက်မှုများသည် ဘာမျှအဓိပ္ပာယ်မရှိပေ။ ဘယ်တော့မှ မဖြီးဖြီးနဲ့ မင်း ခန့်မှန်းနိုင်လောက်တယ်။ ထိုဟန်ချက်ညီမှုလုပ်ရပ်သည် DeepNash ကဲ့သို့သော အစောပိုင်းစနစ်များကို ထိပ်တန်းသို့မရောက်ရှိစေရန် တားဆီးထားသည်။
"Stratego နဲ့ ပတ်သက်ပြီး အလွန်ထူးခြားတဲ့ အရာတစ်ခု ရှိပါတယ်၊ ဒါက အချိန်အတော်ကြာအောင် ဖြန့်ကျက်ထားတဲ့ လျှို့ဝှက်အချက်အလက် အများအပြားပါပဲ" ဟု NYU မှ သုတေသီနှင့် အခြား တွဲဖက်ရေးသားသူ Eugene Vinitsky က ပြောကြားခဲ့သည်။
မှန်းဆနိုင်သော ဒုတိယ အာရုံကြောကွန်ရက်
Ataraxos သည် DeepNash ၏တူညီသောအခြေခံနည်းလမ်းကိုလေ့လာသင်ယူခဲ့သည်- သူ့ကိုယ်သူယှဉ်ပြိုင်ကစားခြင်းဖြင့် စုစုပေါင်းဂိမ်းပေါင်း 163 သန်း၊ အနိုင်ရခြင်းနှင့်မရသောသူများကို ထိခိုက်စေသောလှုပ်ရှားမှုများကို အားဖြည့်ပေးသည်။ ဝှက်ထားသောအချက်အလက်များသည် စက်ဝိုင်းများအတွင်း ကိုယ်တိုင်ကစားနိုင်သော အယ်လဂိုရီသမ်များကို ပေးပို့လေ့ရှိသောကြောင့် အသင်း၏ပထမဆုံးတိုးတက်မှုမှာ ဂိမ်းတစ်ခုစီအပြီးတွင် မည်မျှချိန်ညှိမှုစနစ်တွင်ရှိသနည်း။ Ataraxos သည် လေ့ကျင့်ရေးတွင် အစောပိုင်းတွင် ကြီးမားသော ဗျူဟာအပြောင်းအလဲများကို ပြုလုပ်ခဲ့ပြီး နောက်ပိုင်းတွင် ပိုမိုသတိထားပါ။
ပိုမိုကြီးမားသောအောင်မြင်မှုသည် DeepNash တခါမှမရှိသောအရာဖြစ်သည်- လှုပ်ရှားမှုတစ်ခုစီမတိုင်မီကြိုတင်စဉ်းစားပါ။ သရုပ်ဆောင်ခြင်းမပြုမီ Search-based သန့်စင်မှုသည် AlphaGo အား အားကောင်းစေသည့်အရာဖြစ်သည်၊ သို့သော် ရှာဖွေမှုနေရာသည် ကျယ်ပြောလွန်းသောကြောင့် DeepMind သည် Stratego တွင် အလုပ်မလုပ်နိုင်ပါ။
ဖြေရှင်းချက်မှာ ပြိုင်ဘက်၏ လျှို့ဝှက်ထားသောအပိုင်းများ ရွေ့လျားနေပုံကို ခန့်မှန်းရန် လေ့ကျင့်ထားသည့် ဒုတိယမသေ့ချာကွန်ရက်—ယုံကြည်မှုပုံစံတစ်ခုဖြစ်သည်။ ဖြစ်နိုင်ချေရှိသော အစီအစဉ်တိုင်းကို အထပ်ထပ်ပြုလုပ်မည့်အစား Ataraxos သည် ဖြစ်နိုင်ခြေရှိသောသူများကို နမူနာယူကာ၊ ကိုယ်စားလှယ်လောင်းတစ်ဦးစီ၏ ရွေ့လျားမှုကို ပြသပြီး ရလဒ်များအပေါ်အခြေခံကာ ရွေးချယ်သည်။ ဦးဆောင်စာရေးဆရာ Samuel Sokota နှင့် Farina တို့သည် ဂရပ်ဖစ်ကတ်များပေါ်တွင် တစ်စက္ကန့်လျှင် ရွေ့လျားမှုသန်းပေါင်းများစွာကို လုပ်ဆောင်ပေးသည့် စိတ်ကြိုက် simulator တစ်ခုကိုလည်း ရေးသားခဲ့သည်၊ ယင်းသည် ပညာရေးဆိုင်ရာ ဓာတ်ခွဲခန်းတစ်ခုသည် လေ့ကျင့်ရေးအပြေးအတွက် တတ်နိုင်ပုံပင်ဖြစ်သည်။ "ကျွန်ုပ်တို့ပညာရေးနယ်ပယ်တွင်ရှိနေသည့်အတိုင်းအတာအရ GPU နယ်ပယ်တစ်ခုလုံးကို အမှန်တကယ်ဝင်ရောက်ခွင့်မရှိပါ" ဟု Farina မှပြောကြားခဲ့သည်။
လူသားချန်ပီယံတစ်ယောက် ပြန်ရခဲ့တယ်။
ကမ္ဘာ့ချန်ပီယံဆု လေးကြိမ်ရရှိထားပြီး ကမ္ဘာ့အဆင့်ထိပ်တန်းကစားသမားအဖြစ် ရက်သတ္တပတ် 600 ကျော်ကြာ ကစားခဲ့သည့် Niemeijer သည် Ataraxos နှင့် 3 ပတ်အတွင်း အွန်လိုင်းဂိမ်း 20 ကစားခဲ့ပြီး အနိုင်ရမှုတစ်ခုအတွက် $100 ရရှိခဲ့သည်။ AI သည် သူ့အား လိုက်လျောညီထွေဖြစ်စေမည်မဟုတ်ကြောင်း သိထားပြီး အားနည်းချက်များကို ရှာဖွေရန် အချိန်ပေးသည်။ တစ်ကြိမ်တိတိ အနိုင်ယူနိုင်ခဲ့ပါတယ်။
ဆုံးရှုံးမှုတစ်ခုတည်းက ချို့ယွင်းချက်မဟုတ်ဘူးလို့ သုတေသီတွေက ဆိုပါတယ်။ ကောင်းမွန်သော Stratego သည် သင်၏တပ်ဆင်မှုကို ကျပန်းလုပ်ဆောင်ရန် လိုအပ်သည်၊ ထို့ကြောင့် ကံကောင်းခြင်းမှာ အမြဲတမ်းအခန်းကဏ္ဍတစ်ခုဖြစ်သည်။ "ပြီးပြည့်စုံတဲ့ နည်းဗျူဟာတစ်ခုတောင်မှ တစ်ခါတရံမှာ ဆုံးရှုံးသွားမှာပါ" ဟု Farina က ပြောကြားခဲ့သည်။
2025 Stratego World Championship တွင် လူသားကစားသမားများသည် ပိုမိုဆိုးရွားသွားသည်- Ataraxos ကို စိန်ခေါ်သူ တက်ရောက်သူများသည် ဂိမ်း 40 တွင် 2 ကြိမ်သာ အနိုင်ရခဲ့သည်။ ဘော့တ်သည် လူများကစားပုံအားပင် ပြောင်းလဲခဲ့ပြီး၊ ရှားရှားပါးပါး ကစားရသည့် စနစ်ထည့်သွင်းမှုတစ်ခုဖြစ်သည့် ၎င်း၏အလံကို ဗုံးနှစ်လုံး၏နောက်တွင် ထောင့်တစ်ခုတွင် ထည့်ခြင်းကဲ့သို့သော ပုံမှန်မဟုတ်သော ရွေးချယ်မှုများဖြင့် မက်တာဂိမ်းကို လှည့်စားခဲ့သည်။
စနစ်၏အမည်သည် ရှေးဂရိစကားလုံးမှ ဆင်းသက်လာပြီး ငြိမ်သက်ခြင်းအတွက် ၎င်း၏အရည်အသွေးကို ပြသသည်ဟု သုတေသီများက ဆိုသည်။ လူသားတစ်ဦးသည် လိုငွေပြမှုမှ ပြန်လည်ကောင်းမွန်လာစေရန် ရိုင်းစိုင်းစွာ လောင်းကစားပြုလုပ်နိုင်သော်လည်း Ataraxos သည် ၎င်း၏နည်းလမ်းအတိုင်း ဖြည်းဖြည်းနှင့် နည်းလမ်းတကျ ပြန်လည်လုပ်ဆောင်သည်။ "Bot 'bluff' သည် အောင်ပွဲဖြစ်နိုင်ခြေ နှစ်ရာခိုင်နှုန်းကဲ့သို့ပင် ပြန်သွားသည်ကို ကျွန်ုပ်တို့ စောင့်ကြည့်ရပေလိမ့်မည်၊ အလွန်ပေါ့ပေါ့တန်တန်ပါပဲ" ဟု Vinitsky မှ ပြောကြားခဲ့သည်။
အဲဒါက ဘာကို ဆိုလိုတာလဲ။
လျှို့ဝှက်သတင်းအချက်အလက်ဂိမ်းများတွင် လူများကို ရိုက်နှက်ခြင်းသည် ဧည့်ခန်းလှည့်ကွက်ထက် ပိုပါသည်။ အချက်အလက်မပြည့်စုံသည့် ပြိုင်ဘက်၏ပုဂ္ဂလိကနိုင်ငံတော်အကြောင်း ကျိုးကြောင်းဆင်ခြင်ခြင်းနည်းပညာများ - စေ့စပ်ညှိနှိုင်းရေးစနစ်များ၊ ဆိုက်ဘာလုံခြုံရေး၊ စီးပွားရေးပုံစံရေးဆွဲခြင်းနှင့် ကိုယ်စားလှယ်အများအပြား ညှိနှိုင်းဆောင်ရွက်ခြင်း၊ အချို့ကို အမည်ပေးလိုက်ပါ။
ထိရောက်မှုထောင့်သည် ဇာတ်လမ်း၏ ဩဇာအရှိဆုံးအပိုင်းကို သက်သေပြနိုင်သည်။ နယ်ခြားဓာတ်ခွဲခန်းတစ်ခုသည် 2022 ခုနှစ်တွင် ဤပြဿနာအတွက် လပေါင်းများစွာ တွက်ချက်အသုံးပြုခဲ့သည်။ ပညာရှင်အဖွဲ့တစ်ဖွဲ့သည် 2026 ခုနှစ်တွင် ကားဟောင်းတစ်စီး၏စျေးနှုန်းအကြမ်းဖျင်းအားဖြင့် ရလဒ်ကို ကျော်လွန်သွားခဲ့သည်။ AI သုတေသနသည် ကြီးမားသောတွက်ချက်မှုဘတ်ဂျက်များနှင့် ထပ်တူထပ်မျှဖြစ်လာသည်နှင့်အမျှ Ataraxos သည် အယ်လဂိုရီသမ်အယူအဆများ — ဤနေရာတွင်၊ ကြီးမားသောရှာဖွေမှုနေရာကို ထိန်းကျောင်းနိုင်သော ယုံကြည်ချက်ပုံစံတစ်ခု—သည် ကုန်ကြမ်းစကေးထက် ပို၍အရေးပါနေသေးကြောင်း သတိပေးချက်တစ်ခုဖြစ်သည်။
အဖွဲ့၏စာတမ်းတွင် မသေချာမရေရာမှုများအောက်တွင် တည်တည်ငြိမ်ငြိမ်ရှိနေသော၊ လူသားတစ်ဦးသည် လျစ်လျူမရှုနိုင်သော အသိပညာကို လျစ်လျူရှုကာ ကမ္ဘာပေါ်ရှိ အကောင်းဆုံးများထက် သာလွန်ကောင်းမွန်သည်ဟု ဖော်ပြထားပါသည်။ အဲဒါတွေက ဘုတ်ပေါ်မှာ အသုံးဝင်တဲ့ အရည်အချင်းတွေပါ။
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →