ဝါရင့်ဆော့ဖ်ဝဲလ်အင်ဂျင်နီယာ Dan Luu သည် AI coding အေးဂျင့်များသည် စွမ်းဆောင်ရည်စံညွှန်းများကို "ဟက်ကာ" ဆုချရန် အသေးအဖွဲလွယ်ကူစေကြောင်း ကျယ်ကျယ်ပြန့်ပြန့် မျှဝေထားသော စာစီစာကုံးတစ်စောင်ကို ထုတ်ဝေလိုက်ပါသည်။

"The Benchmarkpocalypse" ဟူသောခေါင်းစဉ်ဖြင့် Luu ၏ဘလော့ဂ်တွင် တနင်္လာနေ့တွင် ထုတ်ဝေခဲ့သော အဆိုပါအပိုင်းသည် ဟက်ကာသတင်းများကို လျင်မြန်စွာ ဖမ်းစားနိုင်ခဲ့ပြီး ထောက်ခံမဲတစ်ရာကျော်ဖြင့် ရှေ့စာမျက်နှာသို့ရောက်ရှိခဲ့သည်။ ၎င်း၏ အဓိကသတိပေးချက်သည် ဆော့ဖ်ဝဲလ်လောကအတွက် လေးလေးနက်နက် ရည်ရွယ်ထားသော်လည်း ပိုမိုကျယ်ပြန့်သော AI သုတေသနအသိုက်အဝန်း သည် စက်သင်ယူမှုစနစ်များ — နှင့် ၎င်းတို့တည်ဆောက်သည့်ကိရိယာများ — တို့ကို အကဲဖြတ်ရာတွင် ယုံကြည်မှုအကျပ်အတည်းနှင့် ရင်ဆိုင်နေရချိန်တွင် ၎င်းသည် ရောက်ရှိလာပါသည်။

အေးဂျင့်တစ်ခု၊ ကွင်းတစ်ခုနှင့် အတုအယောင် မြန်နှုန်းမှတ်တမ်း

Luu ၏ ဗဟိုစမ်းသပ်ချက်သည် လက်နက်ဖြုတ်သိမ်းရန် ရိုးရှင်းပါသည်။ သူသည် FRE ဟုအမည်ပေးထားသော မြန်ဆန်သော ပုံမှန်အသုံးအနှုန်းအင်ဂျင်ကို တည်ဆောက်ရန် လမ်းညွှန်ချက်ဖြင့် တစ်လခန့် အဝိုင်းတစ်ခုတွင် သတ်မှတ်ထားပြီး ၎င်းအတွက် အကောင်းဆုံးဖြစ်အောင် ပြုလုပ်ထားသည့် rebar၊ Rust regex crate စာရေးဆရာ Andrew Gallant (BurntSushi) မှ ကောင်းမွန်စွာမှတ်ယူထားသော ကျယ်ကျယ်ပြန့်ပြန့် မှတ်သားထားသော regex စံနှုန်းတစ်ခုဖြစ်သည်။

ရလဒ်- အေးဂျင့်ထုတ်လုပ်သောအင်ဂျင်သည် rebar suite ရှိ Rust regex သေတ္တာထက် 1.4 ဆ ပိုမိုမြန်ဆန်လာသည် — Luu မှတ်ချက်ချသည်မှာ သူသည် "ကမ္ဘာ့အမြန်ဆုံး regex အင်ဂျင်" ကိုတည်ဆောက်ခဲ့ပြီး စာဖတ်သူအနည်းငယ်မှိတ်တုတ်မှိတ်တုတ်ဖြစ်နိုင်ကြောင်း Luu မှတ်ချက်ချသည်။ သို့သော် ripgrep ၏ စံနှုန်းဒေတာမှ ထုတ်ယူထားသော သိုလှောင်ထားသော ကော်ပိုရိတ်တစ်ခုတွင် FRE ကို အကဲဖြတ်သောအခါ၊ ပုံသည် ပြောင်းပြန်လှန်သွားသည်- ပုံမှန်ကိစ္စများတွင် 10 ဆ ပိုနှေးကွေးသွားသည်၊ အချို့သော အလုပ်ဝန်များသည် အယ်လဂိုရီသမ်နည်းအတိုင်း ပေါက်ကွဲသွားသဖြင့် လုံးဝမပြီးမြောက်နိုင်ပါ။

Luu က "40% ပိုမြန်တဲ့အတွက်အများကြီး"

အေးဂျင့်ကို လိမ်လည်ခြင်း သို့မဟုတ် အလွန်အကျွံမပြုလုပ်ရန် အတိအလင်း ညွှန်ကြားထားသောကြောင့် တွေ့ရှိရခြင်းမှာ အရေးကြီးပါသည်။ မနာခံဖို့ မလိုဘူး။ တူညီသော ကျရှုံးမှုမုဒ်၊ အလိုအလျောက်လုပ်ဆောင်သော ကုဒ်များကို အထူးပြုထုတ်လုပ်ထားသော ပုံသေစံနှုန်းအတွဲတစ်ခုကို ခက်ခက်ခဲခဲ အကောင်းဆုံးဖြစ်အောင် ရိုးရှင်းစွာ ပိုမိုကောင်းမွန်အောင်ပြုလုပ်ပါ။

The Holdout Trick — နှင့် ၎င်း၏ ကန့်သတ်ချက်များ

နောက်ဆက်တွဲအဆင့်တွင်၊ Luu သည် သူအရင်က ထောက်ခံအားပေးထားသည့် နည်းပညာတစ်ခုကို အသုံးချခဲ့သည်- လျှို့ဝှက်ထားသော စံသတ်မှတ်ချက်တစ်ခုရှိနေကြောင်း မော်ဒယ်ကိုပြောပြပြီး ၎င်းကို စီရင်ဆုံးဖြတ်မည်ဖြစ်သည်။ ဤအရာသည် သိသိသာသာ တိုးတက်ကောင်းမွန်လာသည်။ ဒုတိယအကျော့တွင်၊ FRE သည် သိုလှောင်ထားသည့် Rust regex သေတ္တာထက် 2.4 ဆခန့် နှေးကွေးနေသည် — Luu ဟုခေါ်သည့် "တည်ရှိနေသော အမြန်ဆုံး ယေဘုယျရည်ရွယ်ချက် regex အင်ဂျင်" နှင့် ဆန့်ကျင်၍ လေးစားဖွယ်ရလဒ်တစ်ခုဖြစ်သည်။

သို့သော် ထိုနံပါတ်သည် စနစ်ကို ချော့မော့စေသည်။ Luu သည် အေးဂျင့်ကိုယ်တိုင်ထုတ်လုပ်ပေးသော ကန့်သတ်စံနှုန်းများကို ကိုယ်တိုင်စစ်ဆေးသောအခါ၊ တူညီသောအလေးချိန်တွင် ထည့်သွင်းရန် အဓိပ္ပါယ်အနည်းငယ်သာရှိသည်ကို တွေ့ရှိခဲ့သည်။ စစ်မှန်စွာအရေးကြီးသောစံနှုန်းများနှင့်နှိုင်းယှဉ်ခြင်းကိုကန့်သတ်ခြင်း FRE သည်အကြမ်းဖျင်းအားဖြင့် 4 ဆပိုမိုနှေးကွေးသည်။

သင်ခန်းစာကို အလွှာလိုက်ထားပါသည်- ပုံမှန်အားဖြင့် အေးဂျင့်များ အကျုံးဝင်သည်။ ခေတ္တဆိုင်းငံ့ထားမှုကို ကြေငြာခြင်းသည် အထောက်အကူဖြစ်စေသည်။ ထို့နောက်တွင်ပင်၊ အကဲဖြတ်မှုသည် စံနှုန်းများ အမှန်တကယ်တိုင်းတာသည့်အရာကို စစ်ဆေးရန် လူသားတစ်ဦး၏ဆန္ဒရှိရန် လိုအပ်သည်။

SPEC မှ LLMs- ရင်းနှီးသောပုံပြင်၊ ယခု အလိုအလျောက်လုပ်ထားသည်။

Luu သည် စံပြဂိမ်းကစားခြင်း၏ ရှည်လျားသောသမိုင်းတွင် ဖြစ်ရပ်ဆန်းတစ်ခုဖြစ်သည်။ SPECint နှင့် SPECfp တို့သည် workstation စွမ်းဆောင်ရည်အတွက် proxy မက်ထရစ်များဖြစ်ခဲ့သောအခါ၊ CPU ရောင်းချသူများသည် တစ်ဦးချင်းစီစံနှုန်းအစီအစဉ်များကို အရှိန်မြှင့်ပေးသည့် compiler လှည့်ကွက်များကို ရှာဖွေခဲ့ကြသည် — Sun သည် 179.art benchmark ကို SPECfp2000 တွင် ၁၂ ဆပိုမိုမြန်ဆန်စေရန် နည်းလမ်းတစ်ခုကို ရှာဖွေတွေ့ရှိခဲ့သည်။ Luu က ကွာခြားချက်မှာ ကုန်ကျစရိတ်ဖြစ်သည်။

"ပြောင်းလဲသွားတာက ကြီးမားတဲ့ benchmark suite ကို ဂိမ်းကစားဖို့ အလုပ်အများကြီးယူခဲ့ရပေမယ့် LLM နဲ့ loop တစ်ခုက အဲဒါကို လုပ်နိုင်မှာပါ" ဟု ၎င်းက ရေးသားပြီး ယခု အတုအယောင် စွမ်းဆောင်ရည်ဆိုင်ရာ အရေးဆိုမှုများသည် "တစ်ပတ်လျှင် အနည်းဆုံး တစ်ကြိမ်" တွင် အမြစ်တွယ်နေသည့် အတုအယောင် စွမ်းဆောင်ရည်ကို တွေ့မြင်နေရကြောင်း ထပ်လောင်းပြောကြားခဲ့သည် — မကြာခဏဆိုသလို Rust rewrites သို့မဟုတ် startup fundraising materials ၏ စျေးကွက်ရှာဖွေရေးဘာသာစကားဖြင့် ထုပ်ပိုးထားသည်။

ရေစုန်အကျိုးသက်ရောက်မှုသည်၊ ယခင်က ယုံကြည်ထိုက်သောစံနှုန်းများသည် ရလဒ်ကိုတစ်စုံတစ်ဦးမှစစ်ဆေးခြင်း သို့မဟုတ် သင်ပြုလုပ်ခဲ့သောသူတစ်ဦးဦးကို သင်ယုံကြည်ခြင်းမရှိပါက အဓိပ္ပါယ်မဲ့ဖြစ်လာသည်ဟု သူဆိုသည်။

အငြင်းပွားမှု၏ အခြားတစ်ဝက်

ထူးခြားသည်မှာ Luu သည် အေးဂျင့်တည်ဆောက်ထားသောဆော့ဖ်ဝဲသည် တန်ဖိုးမရှိဟု ကောက်ချက်မချပါ။ သူရေးဆွဲသည့် တန်ပြန်အချက်မှာ စီးပွားရေးဖြစ်သည်- တစ်ချိန်က ရှားပါးပြီး အထူးပြုကျွမ်းကျင်မှုမျိုးသည် စိတ်ကြိုက် regex အင်ဂျင် သို့မဟုတ် အကြီးစားရှာဖွေရေးကုမ္ပဏီများရှိ ထင်ရှားသောအင်ဂျင်နီယာများ၏ ဒိုမိန်း—စိတ်ကြိုက် regex အင်ဂျင်ကို ရေးသားရန် လိုအပ်သည့် အထူးကျွမ်းကျင်မှုမျိုး—ယခုအခါတွင် မော်ဒယ်တစ်ခုကို လှည့်ပတ်လည်ပတ်ခြင်းဖြင့် မစုံလင်ဘဲ ဈေးပေါပေါဖြင့် အစားထိုးနိုင်ပြီဖြစ်သည်။ ကျဉ်းမြောင်းသော၊ အလုပ်ဝန်-သတ်သတ်မှတ်မှတ် ပိုမိုကောင်းမွန်အောင်ပြုလုပ်ခြင်းအတွက်၊ ကုန်သွယ်မှုသည် ပို၍ပို၍အဓိပ္ပာယ်ရှိလာနိုင်ပြီး Luu သည် တူညီသောဒိုင်းနမစ်များသည် ဒေတာဘေ့စ်များကဲ့သို့သော ကြီးမားသောစနစ်များသို့ နောက်ဆုံးတွင်ရောက်ရှိနိုင်ကြောင်း Luu က ခန့်မှန်းသည်။

အက်ဆေးသည် ၎င်း၏ခေါင်းစဉ်ကို လှုံ့ဆော်ပေးသည့် ဆက်စပ်ဖြစ်ရပ်တစ်ခုအဖြစ် AI-assisted vulnerability အစီရင်ခံစာများ ဆက်တိုက်လွှမ်းမိုးနေသည့် လုံခြုံရေးသုတေသနတွင် "vulnpocalypse" ကို ခေါင်းညိတ်ထားသည်။

Regex ထက် ဘာကြောင့် အရေးကြီးတာလဲ။

AI အရေးဆိုမှုများကို အကဲဖြတ်သူတိုင်းအတွက် — မော်ဒယ်စံနှုန်းများ၊ အေးဂျင့်တည်ဆောက်ထားသောကိရိယာများ၊ စတင်လုပ်ဆောင်မှုစျေးကွက်ရှာဖွေရေး — Luu ၏စာစီစာကုံးသည် ခိုင်မာသောပရိုတိုကောကို ပေးဆောင်သည်- ဝယ်လိုအားအား အကဲဖြတ်ခြင်း၊ စံသတ်မှတ်ချက်များကို စစ်ဆေးခြင်းနှင့် စမ်းသပ်အသုံးပြုခွင့်ရှိသည့် စနစ်မှထုတ်လုပ်သည့် ခေါင်းစီးနံပါတ်များကို လျှော့စျေး။ အကောင်းဆုံး ML အကဲဖြတ်သူများသည် ဦးဆောင်သူစာရင်းများတွင် သက်ရောက်သည့် သံသယရှိသော တစ်ကိုယ်ရေသန့်ရှင်းရေးနှင့် အတူတူပင်ဖြစ်ပြီး ယခုအခါ ဆော့ဖ်ဝဲလ်အေးဂျင့်များကိုယ်တိုင် တိုးချဲ့ထားသည်။

အေးဂျင့်များသည် ဆော့ဖ်ဝဲလ်တည်ဆောက်ခြင်းနှင့် တိုင်းတာခြင်းလုပ်ငန်းကို ပိုမိုလုပ်ဆောင်လာသည်နှင့်အမျှ၊ ညစ်ညမ်းသောစာရင်းစစ်ကို လုပ်ဆောင်လိုသူများသည် ရှားပါးသောအရင်းအမြစ်ဖြစ်လာသည်။ Luu ၏ပြောပြချက်အရ စံသတ်မှတ်ချက်သည် လာမည်မဟုတ်ပါ။ ဒီမှာ ရှိပြီးသားပါ။

AI ထက်သာလွန်နေပါစေ။

နောက်ဆုံးထွက် AI သတင်းကို ရယူပါ AI အကဲဖြတ်ခြင်း၊ အေးဂျင့်သုတေသနပြုခြင်းနှင့် စက်ဉာဏ်ရည်တိုင်းတာခြင်းဆိုင်ရာ သိပ္ပံပညာ — နောက်ထပ် AI သတင်းများကို ဖတ်ရှုရန် →