Devin AI software engineer နောက်ကွယ်မှ ကုမ္ပဏီ Cognition သည် SWE-2 ကို ၎င်း၏ အဆင့်မြင့်ဆုံး coding model အဖြစ် ဖော်ပြပြီး ကြာသပတေးနေ့တွင် စတင်ခဲ့သည်။ စက်တင်ဘာလ 10 ရက်နေ့တွင်ထုတ်ဝေသောဘလော့ဂ်ပို့စ်တစ်ခုတွင်၊ ကုမ္ပဏီသည် မော်ဒယ်အသစ်သည် စွမ်းဆောင်ရည်နှင့် ကုန်ကျစရိတ်၏ Pareto Frontier ကို တွန်းအားပေးပြီး FrontierCode 1.1 ၏ ပင်မစံနှုန်းတွင် 50.0% ရမှတ်ရရှိကာ Fable 5.1 ထက် 64% လျော့နည်းသော ကုန်ကျစရိတ်မှာ 50.9% ထက် သာလွန်ကြောင်း ပြောကြားခဲ့သည်။

Cognition သည် $48 ဘီလီယံတန်ဖိုးသတ်မှတ်မှုဖြင့် $2 billion ရန်ပုံငွေဝိုင်းကိုအတည်ပြုပြီးနောက်တစ်ရက်အကြာတွင်စတင်ရောင်းချသည်နှင့်၎င်းသည် third-party frontier မော်ဒယ်များကိုသာမှီခိုသည်ထက်၎င်း၏ကိုယ်ပိုင်မော်ဒယ်ဖွံ့ဖြိုးတိုးတက်မှုအတွက်မည်မျှပြင်းထန်စွာရင်းနှီးမြှုပ်နှံထားကြောင်းအချက်ပြသည်။ AI ကုဒ်ရေးနည်းပြိုင်ပွဲနှင့် လုပ်ငန်းနယ်ပယ်ကို ရွေ့လျားနေသည့် အခြားအရာအားလုံးကို စဉ်ဆက်မပြတ် လွှမ်းခြုံနိုင်စေရန်၊ AI Buzz Wire၊ AI သတင်းများကို ဖောက်ဖျက်ရန်အတွက် သင်၏နေ့စဉ်ရင်းမြစ်ကို မှတ်သားပါ။

စံသတ်မှတ်ချက်များပေါ်တွင် SWE-2 မြေနေရာ

Cognition ၏ ထုတ်ပြန်ထားသော ရလဒ်များအရ SWE-2 သည် FrontierCode 1.1 Main တွင် 50.0% ၊ Grok 4.6 တွင် 48.0% နှင့် GPT-5.6 Sol ထက် 47.5% နှင့် GPT-6 Astra ၏ ထင်ရှားသောအကွာအဝေးအတွင်း 53.3% ဖြင့် နယ်ပယ်ကိုဦးတည်သည်။ DeepSWE 1.1 စံသတ်မှတ်ချက်တွင်၊ SWE-2 သည် မော်ဒယ်များ၏ သိမြင်မှုစာရင်းများကြားတွင် Astra ၏ 74.1% ပြီးလျှင် ဒုတိယ 73.0% ဖြင့် ရောက်ရှိသည်။

အပြင်းထန်ဆုံးပြသမှုသည် SWE-2 ရမှတ် 92.8% ရှိသည့် Terminal-Bench 2.1 တွင် ထွက်ပေါ်လာပြီး Cognition ၏ နှိုင်းယှဉ်ဇယားတွင် အမြင့်ဆုံးကိန်းဂဏန်းနှင့် Fable 5.1 ၏ 91.4% နှင့် GPT-6 Astra 89.9% တို့ဖြစ်သည်။ SWE-2 သည် GPT-6 Astra အတွက် 57.9% နှင့် Fable 5.1 အတွက် 57.9% နှင့် SWE-2 မှ 27.3% နှင့် Fable 5.1 အတွက် 55.8% နှင့် Fable 5.1 အတွက် ပိုမိုခက်ခဲသော Terminal-Bench 4 တွင် ရုပ်ပုံသည် ပြောင်းလဲသွားပါသည်။

Cognition သည် နေရာချထားခြင်းကို ပြတ်ပြတ်သားသား နိဂုံးချုပ်သည်- FrontierCode 1.1 Main နှင့် DeepSWE 1.1 တွင်၊ SWE-2 သည် ၎င်း၏ယခင်မော်ဒယ် SWE-1.7 နှင့် Grok 4.6 ကို ရမှတ်နှင့် ကုန်ကျစရိတ်နှစ်ခုလုံးတွင် ကျော်ပြီး၊ GPT-5.6 Sol နှင့် Fable 5/5.1 တို့သည် ၎င်းတို့၏စျေးနှုန်းအပိုင်းတစ်ပိုင်းဖြင့် ကိုက်ညီပြီး GPT ၏ လေးပုံတစ်ပုံကို ကုန်ကျစရိတ်အနည်းငယ်အတွင်း ရမှတ်အနည်းငယ်အတွင်း ရရှိပါသည်။

Multi-Trillion Scale တွင် Kimi K3 မှ လေ့ကျင့်သင်ကြားပြီးနောက်

SWE-2 ကို အစကနေ တည်ဆောက်တာ မဟုတ်ပါဘူး။ Cognition သည် Moonshot AI မှ 2.8 ထရီလီယံ ပါရာမီတာ အခြေပြုမော်ဒယ် Kimi K3 မှ မော်ဒယ်ကို လေ့ကျင့်သင်ကြားပြီးဖြစ်သည်။ ထိုအခြေခံအုတ်မြစ်အပေါ်တွင်၊ Cognition က ၎င်း၏ RL လုပ်ငန်းစဉ်သည် စံနှုန်းများစွာတွင် အချက်ငါးချက်မှ ခြောက်မှတ်ကို ပေါင်းထည့်ခဲ့ပြီး K3 ၏ ကုန်ကျစရိတ်-စွမ်းဆောင်ရည်တစ်ခုလုံးကို နယ်နိမိတ်သို့ ပြောင်းလဲစေသည်ဟု ဆိုသည်။

SWE-2 သည် လေ့ကျင့်ရေးအခြေခံအဆောက်အအုံနှင့် SWE-1.7 အတွက် ဖန်တီးထားသော လေ့ကျင့်ရေးအခြေခံအဆောက်အအုံနှင့် ဟင်းချက်နည်းများကို ပေါင်းစည်းသည့် ထရီလျံပေါင်းများစွာ ကန့်သတ်ဘောင်စနစ်သို့ တိုးချဲ့သင်ကြားမှုအား ပထမဆုံးအကြိမ်အဖြစ် ချဲ့ထွင်ခြင်းဖြစ်သည်ဟု ကုမ္ပဏီက ပြောကြားခဲ့သည်။ သော့ထပ်တိုးမှုသည် သီးခြားလေ့ကျင့်ရေးပစ်မှတ်များအဖြစ် အနိမ့်၊ အလယ်အလတ်နှင့် မြင့်မားသောအားထုတ်မှုကို ကုသခြင်းထက် ဆင်ခြင်ခြင်း-အားထုတ်မှုအဆင့်အားလုံးကို လေ့ကျင့်ပေးသည့် RL algorithm တစ်ခုဖြစ်သည်။

ကုန်ကျစရိတ် ပြစ်ဒဏ်များသည် တောင်တန်းတစ်ခုလုံးကို ပုံသွင်းသည်။

SWE-2 ၏ လေ့ကျင့်ရေးတွင် အဓိက အယူအဆမှာ RL တစ်ခုတည်း ပြေးခြင်းတစ်ခုအတွင်း ကြိုးစားမှုအဆင့်အလိုက် လိုင်းခွဲကုန်ကျစရိတ် ဒဏ်ငွေဖြစ်ပြီး ပြစ်ဒဏ်တစ်ခုစီသည် အခြေခံမော်ဒယ်လ်၏ Pareto နယ်နိမိတ်၏ ကုန်းစောင်းသို့ ချိန်ညှိထားသည်။ ပထမမူများမှ ဆင်းသက်လာသော ဤချဉ်းကပ်မှုသည် မော်ဒယ်၏ ပုံသဏ္ဍာန်ကို ထိန်းသိမ်းထားကာ လေ့ကျင့်ရေးတွင် တတ်နိုင်သမျှ စစ်မှန်သော အသုံးပြုသူ ကုန်ကျစရိတ်များကို ရောင်ပြန်ဟပ်နေချိန်တွင် မော်ဒယ်၏ ကုန်ကျစရိတ်-စွမ်းဆောင်ရည် အတိုင်းအတာတစ်ခုလုံးကို တိုးတက်စေသည်ဟု Cognition က ဆိုသည်။

ကုမ္ပဏီသည် SWE-1.6 မှစတင်၍ အသုံးပြုခဲ့သည့် အရှည်အလေးသာသောဆုကြေးငွေအခြေခံကိုအသေးစိတ်ဖော်ပြပြီး ၎င်းသည် သိသိသာသာတည်ငြိမ်စေသောလေ့ကျင့်ရေးနှင့်အတူ credit ပေးသည့်အပြင်၊ ၎င်းသည် ကုဒ်ဖော်ပြခြင်းစွမ်းရည်ကိုမြှင့်တင်ရန်အတွက်အွန်လိုင်းမူကြမ်းပုံစံတစ်ခုပါဝင်သည့် RL ထုတ်ပေးခြင်းဆိုင်ရာ တိုးတက်မှုများအတွက် မြှင့်တင်မှုများနှင့်အတူ။ NVFP4 နှင့် FP8 kernels နှင့် quantization-aware training ဖြင့်၊ Cognition သည် အခြေခံမော်ဒယ်သည် ၎င်း၏ယခင်သတ်မှတ်ချက်များထက် သုံးဆနီးပါးရှိသော်လည်း အခြေခံမော်ဒယ်တွင် မှတ်ဉာဏ်အသုံးပြုမှုကို အလုံးစုံလျှော့ချပေးသည်ဟု ဆိုသည်။

လေ့ကျင့်ရေးဒေတာပိုက်လိုင်းကိုလည်း ချဲ့ထွင်ခဲ့သည်- သိမှတ်မှုသည် RL ပတ်ဝန်းကျင်အရေအတွက်ကို သုံးဆတိုးလာကာ ညွှန်ကြားချက်များအတိုင်း ထပ်ဆင့်ထပ်ထည့်ကာ မော်ဒယ်ကို အမှတ်ရရန်အတွက် အသုံးပြုသည့် စိစစ်ရေးမှူးများကို ထပ်ခါတလဲလဲ ခိုင်မာစေမည့် ယခင် SWE-2 စစ်ဆေးရေးဂိတ်များမှ မောင်းနှင်သည့် flywheel ကို တည်ဆောက်ခဲ့သည်။

ဉာဏ်ရည်ထက်မြက်သလောက် စွမ်းဆောင်ရည်

သိမှတ်မှုဘောင်များသည် SWE-2 ၏ အကျိုးအမြတ်များကို ထိရောက်မှုနှင့် နီးကပ်စွာ ဆက်စပ်နေပါသည်။ ခိုင်မာအားကောင်းသော အင်ဂျင်နီယာဆိုင်ရာ စီရင်ဆုံးဖြတ်မှုတွင် အေးဂျင့်အား လမ်းလွှဲနည်းနှင့် မလိုအပ်ဘဲ ဖတ်ရှုမှုများဖြင့် ပိုမိုပြီးပြည့်စုံသော ဖြေရှင်းချက်များကို ရေးသားနိုင်စေသည်ဟု ကုမ္ပဏီက ဆိုသည်။ FrontierCode 1.1 Main တွင်၊ SWE-2 ၏ အလယ်အလတ် ကြိုးပမ်းမှုဖွဲ့စည်းပုံသည် SWE-1.7 ထက် 58% ပိုနည်းပြီး လှည့်ပတ်မှု 81% ပိုနည်းချိန်တွင် SWE-1.7 ထက် ပိုမြင့်ပါသည်။

အဲဒါက Cognition ရဲ့ လုပ်ငန်းအတွက် အရေးကြီးတယ်။ Devin ကို ကိုယ်ပိုင်အုပ်ချုပ်ခွင့်ရဆော့ဖ်ဝဲအင်ဂျင်နီယာတစ်ဦးအနေဖြင့် ရောင်းချထားပြီး ကောက်ချက်ချစရိတ်သည် စျေးနှုန်းနှင့်အနားသတ်များအတွက် တိုက်ရိုက်ထည့်သွင်းမှုတစ်ခုဖြစ်သည်။ လုပ်ငန်းတစ်ခုအတွက် အလှည့်အပြောင်းများနှင့် တိုကင်များကို ဖြတ်တောက်ရာတွင် ရှေ့တန်း-ကပ်လျက် အရည်အသွေးကို ကိုင်ဆောင်ထားသော မော်ဒယ်တစ်ခုသည် ကုမ္ပဏီမှ ဆောင်ရွက်ပေးသည့် Devin စက်ရှင်တိုင်း၏ စီးပွားရေးကို ပြောင်းလဲစေသည်။

ရရှိနိုင်ပါသည်။

SWE-2 ကို Devin Desktop နှင့် Devin CLI တို့တွင် ယနေ့မှ စတင်၍ Devin Web နှင့် Fusion တွင် စတင်အသုံးပြုနိုင်ပြီ ဖြစ်ကြောင်း ကုမ္ပဏီမှ သိရသည်။ အသုံးပြုသူများသည် လာမည့်ရက်များအတွင်း မျက်နှာပြင်များပေါ်တွင် မော်ဒယ်ကို မြင်တွေ့ရမည်ဟု Cognition က ဆိုသည်။

Coding Model Market အတွက် ဘာကိုဆိုလိုလဲ။

ထုတ်လွှတ်မှုသည် GPT-6 Astra နောက်ကွယ်တွင် လူများသောအထုပ်ကို တင်းကျပ်စေသည်။ ယခု Cognition သည် Anthropic၊ OpenAI နှင့် xAI တို့မှ စျေးသက်သာစွာဖြင့် ကမ်းလှမ်းမှုများဖြင့် အရောင်းအ၀ယ်ပြုလုပ်သည့် မော်ဒယ်ကို ပိုင်ဆိုင်ထားပြီး ၎င်းသည် မော်ဒယ်မှ အေးဂျင့်ထုတ်ကုန်တစ်ခုအထိ အစုအဝေးကို ထိန်းချုပ်ထားသည်။ ပြိုင်ဘက်များသည် အထူးသဖြင့် SWE-2 ၏ ကုန်ကျစရိတ် ပရိုဖိုင်းအား အပြင်းထန်ဆုံးဖြစ်သည့် ပမာဏမြင့်မားသော၊ အလယ်အလတ်ခက်ခဲသော အလုပ်များအတွက် စွမ်းဆောင်ရည်အပေါ် စျေးနှုန်းအပေါ် တုံ့ပြန်ရန် ဖိအားများနှင့် ရင်ဆိုင်ရမည်ဖြစ်သည်။

AI coding tools များကိုဝယ်ယူသူများအတွက်၊ လက်တွေ့ကျသောအချက်မှာ frontier-level coding help သည် frontier-level pricing မလိုအပ်တော့ပါ။ အခြားစက်မှုလုပ်ငန်းအတွက်၊ SWE-2 သည် အခြေခံမော်ဒယ်စကေးသာမကဘဲ လေ့ကျင့်ရေးလွန်မှုနှင့် အခြေခံအဆောက်အအုံဆိုင်ရာ ထိရောက်မှုတို့သည် ပြတ်ပြတ်သားသား ယှဉ်ပြိုင်နိုင်စွမ်းရှိသော လီဗာတစ်ခုဖြစ်လာကြောင်း အထောက်အထားဖြစ်သည်။

---

AI ၏ရှေ့တွင်နေရန်

နောက်ဆုံးပေါ် AI သတင်းများ၊ ခွဲခြမ်းစိတ်ဖြာမှုနှင့် အောင်မြင်မှုများ—အားလုံးကို တစ်နေရာတည်းတွင် ရယူပါ။

AI သတင်းအပြည့်အစုံကို ဖတ်ရှုရန် →