သုတေသီများသည် ကြီးမားသောဘာသာစကားမော်ဒယ်များ (LLMs) ဒေတာမှ ညွှန်ကြားချက်များကို ခွဲခြားပုံတွင် အခြေခံကျသော မျက်စိကွယ်သည့်နေရာကို အသုံးချသည့် ကျိုးကြောင်းဆင်ခြင်ခြင်း AI မော်ဒယ်များကို ဆန့်ကျင်သည့် ပြင်းထန်သောတိုက်ခိုက်မှုအသစ်ကို သရုပ်ပြခဲ့သည်။ Chain-of-Thought (CoT) Forgery ဟုခေါ်သော နည်းပညာသည် မော်ဒယ်အား တိုက်ခိုက်သူမှ ပံ့ပိုးပေးထားသော စာသားကို မော်ဒယ်၏ ကိုယ်ပိုင် အတွင်းပိုင်း ကျိုးကြောင်းဆင်ခြင်ခြင်းကဲ့သို့ သဘောထားကာ စာသားအား တရားဝင်ညွှန်ကြားချက်များကို အစားထိုးရန် လှည့်စားပါသည်။

Hackaday မှအစီရင်ခံတင်ပြသောတွေ့ရှိချက်သည် AI စနစ်များကို ခြယ်လှယ်ခြင်းမှကာကွယ်ခြင်းသည် အဘယ်ကြောင့်မဖြေရှင်းနိုင်သောပြဿနာတစ်ခုအဖြစ်ရှိနေဆဲဖြစ်ကြောင်း အလေးပေးဖော်ပြသည်။ နယ်ပယ်တွင် ပေါ်ပေါက်လာသော ခြိမ်းခြောက်မှုများကို လိုက်လျောညီထွေဖြစ်စေရန်အတွက် ကျွန်ုပ်တို့၏ [AI လုပ်ငန်းကဏ္ဍလွှမ်းခြုံမှု] (https://aibuzzwire.news) ကို ဆက်လက်လေ့လာသုံးသပ်ရန် လိုက်နာပါ။

အရင်းခံအကြောင်းရင်း- အခန်းကဏ္ဍရှုပ်ထွေးမှု

အားနည်းချက်၏ အဓိကအချက်မှာ သုတေသီများက အခန်းကဏ္ဍ ရှုပ်ထွေးမှုဟု ဖော်ပြသည်။ ခေတ်မီ LLM များသည် ၎င်းတို့၏ထည့်သွင်းမှုအားလုံးကို—စနစ်စည်းမျဉ်းများ၊ အသုံးပြုသူတောင်းဆိုမှုများနှင့် မော်ဒယ်၏ကိုယ်ပိုင်တွေးခေါ်မှုဆိုင်ရာ ကျိုးကြောင်းဆင်ခြင်ခြင်း—စာသားချန်နယ်တစ်ခုမှတစ်ဆင့် ရရှိသည်။ အမိန့်ချမှတ်ရန်၊ ဆော့ဖ်ဝဲအင်ဂျင်နီယာများသည် ယုံကြည်မှုအဆင့်ကို ဖန်တီးရန်အတွက် ``၊ `` နှင့် `` ကဲ့သို့သော မက်တာဒေတာတဂ်များကို အသုံးပြုပါသည်။ ဥပမာအားဖြင့် အန္တရာယ်ရှိသော အကြောင်းအရာများကို ရှောင်ရှားရန် `` ညွှန်ကြားချက်သည် `` တောင်းဆိုချက်အား ဆန့်ကျင်ဘက်သို့ အစားထိုးရန် လိုအပ်သည်။

`` တဂ်သည် မော်ဒယ်၏ အတွင်းပိုင်း ကျိုးကြောင်းဆင်ခြင်ခြင်း လုပ်ငန်းစဉ်ကို ကိုယ်စားပြုသောကြောင့်၊ ၎င်းသည် ယုံကြည်စိတ်ချရမှု မြင့်မားသော စီးကြောင်းကို ကိုယ်စားပြုပါသည်။ သုတေသီများတွေ့ရှိခဲ့သည့် ပြဿနာမှာ မော်ဒယ်များသည် မည်သည့်အရာကို ယုံကြည်ရမည်ကို ဆုံးဖြတ်ရန် ၎င်းတို့ကိုယ်တိုင် tag များပေါ်တွင် အဓိက အားကိုးခြင်း မရှိပါ။ စာရေးဟန်ကို ဦးစားပေးကြသည်။ မော်ဒယ်တစ်ခု၏ အတွင်းပိုင်း `` နှင့် ဆင်တူစေရန် စတိုင်လ်ကျကျ ဖော်မတ်ပြုလုပ်ထားသည့် စာသားသည် မည်သည့်နေရာမှ ထွက်ပေါ်လာသည်ဖြစ်စေ စစ်မှန်သော ကျိုးကြောင်းဆင်ခြင်မှုအတွက် လွဲမှားနိုင်ပါသည်။

တိုက်ခိုက်မှုဘယ်လိုအလုပ်လုပ်လဲ။

အရေးကြီးသည်မှာ၊ CoT Forgery သည် `` တဂ်များအတွင်း မလိုလားအပ်သော အချက်ပြမှုများကို ခြုံငုံမိရုံမျှမက၊ မော်ဒယ်အများစုသည် ငြင်းပယ်မည့် ကိစ္စဖြစ်သည်။ ယင်းအစား၊ တိုက်ခိုက်သူသည် မော်ဒယ်၏ထူးခြားသော အတွင်းပိုင်းကျိုးကြောင်းဆီလျော်မှုအသံကို အနီးကပ်လိုက်ဖက်သော ပုံစံဖြင့် ရှုပ်ထွေးသော ကျိုးကြောင်းဆင်ခြင်ခြင်းကို ရေးသားသည်။ မော်ဒယ်သည် ဤစာသားကိုတွေ့သောအခါ၊ ၎င်းသည် အယောင်ဆောင်ထားသော ကျိုးကြောင်းဆီလျော်မှုကို ပြီးပြီးသား နိဂုံးတစ်ခုအဖြစ် မှတ်ယူသည်။

Hackaday ၏အဆိုအရ၊ ၎င်းသည် LLM အား ကြိုတင်ကောက်ချက်ချမှုအဖြစ် ပွင့်လင်းမြင်သာစွာ ယုတ္တိမတန်သော ကျိုးကြောင်းဆင်ခြင်မှုကို လက်ခံစေပြီး အသုံးပြုသူ၏တောင်းဆိုမှုအပေါ် ၎င်း၏တုံ့ပြန်မှုကို ပြောင်းလဲစေသည်။ အယောင်ဆောင်ထားသော အကြောင်းအရာကို ယုံကြည်စိတ်ချရမှုနည်းသော အသုံးပြုသူထည့်သွင်းမှုထက် ယုံကြည်စိတ်ချရသော အတွင်းပိုင်းတွေးခေါ်မှုဟု ယူဆသောကြောင့်၊ ၎င်းသည် ပုံမှန်အားဖြင့် ခြယ်လှယ်သောညွှန်ကြားချက်များကို ပိတ်ဆို့မည့် ဘေးကင်းရေးအစောင့်အကြပ်များကို ကျော်လွှားနိုင်သည်။

LLM တစ်ခုအတွင်း ယုံကြည်မှု၏ အထက်တန်းအဆင့်

တိုက်ခိုက်မှုအောင်မြင်ရခြင်းအကြောင်းရင်းကို နားလည်ရန်မှာ အခန်းကဏ္ဍများ မည်သို့လုပ်ဆောင်သည်ကို နားလည်ရန် လိုအပ်သည်။ အဖုံးအောက်တွင်၊ အခန်းကဏ္ဍများသည် မော်ဒယ်၏ထည့်သွင်းမှုကို စီစဥ်ထားသည့် အထက်တန်းအဆင့်သို့ အပိုင်းပိုင်းခွဲထားသည်။ အခန်းကဏ္ဍတစ်ခုမှ ညွှန်ကြားချက်များကို ၎င်းတို့သည် ဦးစားပေးအဆင့်မြင့်သူများနှင့် မဆန့်ကျင်သရွေ့ လိုက်နာဆောင်ရွက်ပါသည်။ ဥပမာအားဖြင့် "တရားမဝင်သော လှုပ်ရှားမှုများကို မဆွေးနွေးပါနှင့်" ဟူသော စနစ်အဆင့် ညွှန်ကြားချက်သည် တားမြစ်ထားသော ဟင်းချက်နည်းကို ပေးဆောင်ရန် အသုံးပြုသူ တောင်းဆိုချက်အား အစားထိုးရန် ရည်ရွယ်သည်။ `` အခန်းကဏ္ဍသည် ၎င်းသည် ၎င်းကိုယ်တိုင်ရောက်ရှိနေပြီဟု မော်ဒယ်က ယုံကြည်သည့် ကောက်ချက်များအား ကိုယ်စားပြုသောကြောင့် ၎င်းသည် အထက်တန်းအဆင့်၏ထိပ်အနီးတွင် တည်ရှိသည်။

မော်ဒယ်သည် အဆိုပါ အထက်အောက် စက်ပိုင်းဆိုင်ရာအား မလိုက်နာသောကြောင့် ပြိုကွဲရခြင်း ဖြစ်သည်။ ယင်းအစား၊ မည်သည့်စာသားသည် မည်သည့်အခန်းကဏ္ဌမှ ပါဝင်သည်ဟု ကောက်ချက်ချသည်။ သုတေသန၏ ရပ်ရွာဆွေးနွေးမှုတွင် မှတ်ချက်ပြုထားသည့်အတိုင်း စာသားသည် တွေးခေါ်မှုဆိုင်ရာ အကြောင်းအရာတစ်ခုကဲ့သို့ ပုံစံချထားပါက၊ မော်ဒယ်သည် စစ်မှန်သော ကျိုးကြောင်းဆင်ခြင်မှုအတွက် ဆင်တူသည့်ဖွဲ့စည်းပုံပါရှိသည့် မည်သည့်စာသားကိုမဆို မှားယွင်းနိုင်ပြီး စာသားသည် သာမန်အသုံးပြုသူစာသားထက် ပိုမိုဦးစားပေးပါသည်။

လှည့်ကွက်အသစ်ဖြင့် ရင်းနှီးသောပုံစံ

သုတေသနသည် AI စနစ်များတွင် ကာလကြာရှည်စွာ အသိအမှတ်ပြုထားသော အားနည်းချက်ကို တည်ဆောက်သည်- ချက်ခြင်းထိုးခြင်း ဖြစ်သည်။ အစောပိုင်းတိုက်ခိုက်မှုများသည် LLM များတွင် ညွှန်ကြားချက်များနှင့် ဒေတာအတွက် သီးခြားစီးကြောင်းများမရှိဟူသောအချက်ကို အသုံးချကာ "ယခင်ညွှန်ကြားချက်အားလုံးကို လျစ်လျူရှုခြင်း" ကဲ့သို့သော စကားစုသည် တစ်ခါတစ်ရံတွင် မော်ဒယ်၏အပြုအမူကို ခိုးယူသွားနိုင်သည်။ အခန်းကဏ္ဍများနှင့် မက်တာဒေတာတဂ်များကို နိဒါန်းပျိုးခြင်းသည် ယုံကြည်မှု အထက်တန်းအဆင့်ကို ဖန်တီးခြင်းဖြင့် ၎င်းကို လျော့ပါးစေရန် ရည်ရွယ်ပါသည်။

CoT Forgery သည် လျော့ပါးသက်သာစေရန် မပြည့်စုံကြောင်း သက်သေပြသည်။ မော်ဒယ်များသည် စာသားများ၏ ယုံကြည်စိတ်ချရမှုကို ၎င်း၏ဖွဲ့စည်းပုံဆိုင်ရာ မက်တာဒေတာဖြင့် တင်းကျပ်စွာ ဆောင်ရွက်ခြင်းထက် ၎င်း၏ အသွင်အပြင်လက္ခဏာများဖြင့် တစ်စိတ်တစ်ပိုင်း အကဲဖြတ်နေသရွေ့၊ မှန်ကန်သောပုံစံကို အတုခိုးနိုင်သော တိုက်ခိုက်သူများသည် ၎င်းတို့၏ ထည့်သွင်းမှု၏ အခွင့်အာဏာကို တိုးမြင့်လာစေနိုင်ပါသည်။

##ဘာလို့ပြင်ရခက်တာလဲ။

သုတေသီများဖြစ်သည့် Charles Ye၊ Jasmine Cui နှင့် Dylan Hadfield-Menll တို့က LLMs များတွင် အခန်းကဏ္ဍခံယူချက်သည် သန့်ရှင်းစွာ ကျင့်သုံးနိုင်သည့် binary ပစ္စည်းမဟုတ်ကြောင်း စောဒကတက်သည်။ မော်ဒယ်များသည် hard-coded စည်းမျဉ်းများထက် လေ့ကျင့်ခြင်းအားဖြင့် တဂ်များကို အနက်ပြန်ဆိုရန် သင်ယူကြပြီး၊ ဆိုလိုသည်မှာ ၎င်းတို့၏ အပြုအမူများသည် ဒေတာရှိ ပုံစံများဖြင့် ပုံဖော်ထားသည်—နှင့် ပုံစံများကို တုပနိုင်သည်။

Hackaday မှ မီးမောင်းထိုးပြထားသည့် အလုပ်နှင့်ပတ်သက်သည့် အသိုင်းအဝိုင်းဆွေးနွေးမှုတွင် ထပ်တလဲလဲဆောင်ပုဒ်တစ်ခုပေါ်လာသည်- အသန့်ရှင်းဆုံးပြင်ဆင်မှုသည် သင်ယူပြီး စတိုင်လ်အခြေခံအချက်များပေါ်တွင် အားကိုးရမည့်အစား ဖွဲ့စည်းတည်ဆောက်ပုံအရ သီးခြားလမ်းကြောင်းများမှတစ်ဆင့် ယုံကြည်စိတ်ချရသောထည့်သွင်းမှုများကို ကိုင်တွယ်ရန် မော်ဒယ်များ လိုအပ်မည်ဖြစ်သည်။ ထိုသို့မဖြစ်မချင်း၊ ချက်ခြင်းထိုးသွင်းသည့်ပုံစံ တိုက်ခိုက်မှုများကို ခုခံကာကွယ်ခြင်းသည် ဖြေရှင်းရမည့်ပြဿနာထက် ဆင့်ကဲဖြစ်စဉ်တစ်ခုအဖြစ် ရှိနေနိုင်ဖွယ်ရှိသည်။

ပိုမိုကျယ်ပြန့်သောသက်ရောက်မှုများ

အားနည်းချက်သည် ဓာတ်ခွဲခန်းဆန္ဒပြပွဲများထက် အရေးကြီးသည်။ ကျိုးကြောင်းဆင်ခြင်ခြင်း မော်ဒယ်များသည် ဝဘ်ကို ကြည့်ရှုနိုင်သည်၊ ကုဒ်ကို လုပ်ဆောင်ရန်နှင့် အသုံးပြုသူ၏ ကိုယ်စား လုပ်ဆောင်မှုများကို လုပ်ဆောင်နိုင်သည့် အေးဂျင့်စနစ်များတွင် ပိုမိုအသုံးပြုလာပါသည်။ အကယ်၍ တိုက်ခိုက်သူသည် မော်ဒယ်တစ်ဦး၏ အတွင်းပိုင်း ကောက်ချက်များအား အတုခိုးပါက၊ ၎င်းတို့သည် အဆိုပါ လုပ်ရပ်များကို မရည်ရွယ်ဘဲ သို့မဟုတ် အန္တရာယ်ရှိသော ရလဒ်များဆီသို့ ဦးတည်သွားနိုင်မည်ဖြစ်သည်။ မော်ဒယ်များသည် ကိုယ်ပိုင်အုပ်ချုပ်ခွင့် ပိုမိုရရှိပြီး ကိရိယာများကို အသုံးပြုခွင့် ရရှိလာသည်နှင့်အမျှ မော်ဒယ်များသည် အန္တရာယ် တိုးလာပါသည်။ လူသားများသည် လိမ္မာပါးနပ်ပြီး တီထွင်ဖန်တီးနိုင်စွမ်းရှိနေဆဲဖြစ်ကြောင်း သုတေသီများက မှတ်သားထားပြီး၊ မော်ဒယ်များသည် ယုံကြည်စိတ်ချရသော နှင့် စိတ်မချရသော စာသားများကြားတွင် သန့်ရှင်းသော ဗိသုကာဆိုင်ရာ ခွဲခြားမှု မရှိသရွေ့၊ ဆုံးဖြတ်တိုက်ခိုက်သူများသည် မျဉ်းကို မှုန်ဝါးစေမည့် နည်းလမ်းများကို ဆက်လက်ရှာဖွေနေမည်ဖြစ်သည်။ စာရွက်တွင် ဖာထေးရန် ချို့ယွင်းချက်အဖြစ် စိန်ခေါ်မှုကို ဘောင်ခတ်ထားပြီး hard-coded စည်းမျဉ်းများထက် ၎င်းတို့၏ အပြုအမူများကို ဒေတာများမှ လေ့လာသည့် စနစ်များ၏ ဖွဲ့စည်းပုံဆိုင်ရာ ပိုင်ဆိုင်မှုတစ်ခုအဖြစ် ပိုမိုပြုလုပ်ထားသည်။

စာတမ်းအပြည့်အစုံကို arXiv တွင်ရရှိနိုင်ပြီး သုတေသီများသည် ၎င်းတို့၏ကိုယ်ပိုင်စနစ်များကို ခံနိုင်ရည်ရှိမရှိ စမ်းသပ်နိုင်ရန် GitHub တွင် ကုဒ်နမူနာများကို ထုတ်ဝေခဲ့သည်။

AI ၏ရှေ့တွင်နေပါ။

AI ဘေးကင်းရေး သုတေသန၊ လုံခြုံရေး အားနည်းချက်များနှင့် ကြီးမားသော ဘာသာစကား မော်ဒယ်များ၏ နယ်နိမိတ် ဆိုင်ရာ အချက်အလက်များ ပိုမိုသိရှိရန်၊ AI Buzz Wire သို့ ဝင်ရောက်ကြည့်ရှုပါ။

AI သတင်းအပြည့်အစုံကို ဖတ်ရှုရန် →