Anthropic ၏ Claude Opus 5 သည် ၎င်း၏ကိုယ်ပိုင် GPT-5.6 Sol မော်ဒယ်ကို 38.3 ရာခိုင်နှုန်းအထိ ပြသသည့် ရလဒ်များကို ထုတ်ပြန်သည့် ARC-AGI-3 စံညွှန်းကို လွှမ်းမိုးထားပြီးနောက်တွင် OpenAI သည် သင့်အား တရားဝင်စမ်းသပ်ကြိုးထက် OpenAI ၏နှစ်သက်ရာဆက်တင်များကို အသုံးပြုခွင့်ပေးထားသည်။

2026 ခုနှစ် ဇူလိုင်လ 30 ရက်နေ့တွင် ပေါ်ပေါက်ခဲ့သော အငြင်းပွားမှုသည် AI အကဲဖြတ်မှုတွင် ကြီးထွားလာသော ပြဿနာတစ်ခု၏ နှလုံးသားကို ဖြတ်တောက်လိုက်သည်- စံသတ်မှတ်ချက်များသည် မော်ဒယ်တစ်ခုမျှသာမဟုတ်တော့ဘဲ နည်းပညာဆိုင်ရာ ငြမ်းတစ်ခုလုံးက ၎င်းကို ရစ်ပတ်ထားသည်။ နောက်ဆုံးပေါ် AI ဖွံ့ဖြိုးတိုးတက်မှုများ နှင့် မော်ဒယ်ဖြန့်ချိမှုများကို ပိုမိုလေးနက်စွာခွဲခြမ်းစိတ်ဖြာရန်အတွက် AI Buzz Wire သည် ဇာတ်လမ်းကို ခြေရာခံနေသည်။

နံပါတ်များနှင့် ဖမ်းသည်။

GPT-5.6 Sol သည် ARC-AGI-3 တွင် 38.3 ရာခိုင်နှုန်းရောက်ရှိပြီး Anthropic ၏ Claude Opus 5 ကိုကျော်လွန်ကာ ယခင်စံနှုန်းထက် 30.2 ရာခိုင်နှုန်းရမှတ်ဖြင့် ကျော်တက်သွားခဲ့ကြောင်း OpenAI မှဖော်ပြခဲ့သည်။ သတိပေးချက်မှာ သိသာထင်ရှားသည်- အဆိုပါ ၃၈.၃ ရာခိုင်နှုန်း ကိန်းဂဏန်းသည် OpenAI ၏ တုံ့ပြန်မှု API ၏ သီးခြားအင်္ဂါရပ်နှစ်ခုပေါ်တွင် မူတည်သည်။

ပထမတစ်ချက်မှာ Retained Reasoning သည် လုပ်ဆောင်ချက်တစ်ခုပြီးတိုင်း ၎င်းကို စွန့်ပစ်ခြင်းထက် ခြေလှမ်းများကြားတွင် မော်ဒယ်၏ အတွေးကွင်းဆက်ကို ထိန်းသိမ်းပေးသည်။ ဒုတိယမှာ Compaction သည် ၎င်းကို ဖြတ်တောက်မည့်အစား အဟောင်းများကို အကျဉ်းချုံးပြီး မော်ဒယ်သည် အစောပိုင်းအကြောင်းပြချက်များကို မဆုံးရှုံးစေဘဲ ရှည်လျားသောပြဿနာများကို ဆက်လက်လုပ်ဆောင်နိုင်စေမည်ဖြစ်သည်။

ARC Prize ၏တရားဝင်စံသတ်မှတ်ထားသောကြိုးကြိုးကိုဖြတ်၍ လည်ပတ်သည် — Apple-to-apples နှိုင်းယှဉ်မှုများကိုသေချာစေရန်ရည်ရွယ်ချက်ရှိရှိဖြင့် ဝန်ဆောင်မှုပေးသူ-သီးသန့်ဆက်တင်များကို ရှောင်ရှားသည် — GPT-5.6 Sol သည် 7.8 ရာခိုင်နှုန်းသာစီမံထားသည်။ အကြောင်းပြချက် OpenAI က တရားဝင်သတ်မှတ်မှုသည် ခြေလှမ်းတိုင်းပြီးနောက် မော်ဒယ်၏ ကျိုးကြောင်းဆင်ခြင်မှုကို ပယ်ချပြီး စဉ်ဆက်မပြတ် အဆင့်ဆင့်တွေးခေါ်မှုလိုအပ်သည့် အလုပ်များအပေါ် စွမ်းဆောင်ရည်ကို ထိခိုက်စေသောကြောင့်ဖြစ်သည်။

သန့်ရှင်းမှုအတွက် တည်ဆောက်ထားသော စံသတ်မှတ်ချက်တစ်ခု

ARC-AGI-3 ကို François Chollet နှင့် ARC Prize အဖွဲ့တို့မှ ယခင်က မမြင်ဖူးသော ဆန်းသစ်သော ဆင်ခြင်ဥာဏ်ပဟေဋ္ဌိများကို ဖြေရှင်းပေးနိုင်သည့် မော်ဒယ်တစ်ဦး၏ စွမ်းရည်ကို စစ်ဆေးရန်—အလွတ်ကျက်ထားသော အသိပညာထက် အထွေထွေဉာဏ်ရည်စမ်းသပ်မှု စမ်းသပ်မှုတစ်ခု ဖြစ်သည်။ နှိုင်းယှဉ်မှုများကို တရားမျှတစေရန်အတွက် တရားဝင်ကြိုးသိုင်းသည် ပံ့ပိုးပေးသူ၏ သီးခြားအင်္ဂါရပ်များကို တမင်တကာ ဖယ်ထုတ်ကာ ကြားနေပတ်ဝန်းကျင်တွင် မော်ဒယ်လုပ်နိုင်စွမ်းကို တိုင်းတာသည်။

OpenAI ၏ တန်ပြန်ငြင်းခုံမှုသည် ဤကြားနေမှုသည် အသာစီးဖြစ်လာနိုင်သည် ။ ကုမ္ပဏီသည် Claude API မှ ကမ်းလှမ်းထားပြီးသော စွမ်းဆောင်ရည်များ ကင်းမဲ့နေသည့် "OpenAI-style completions API" အဟောင်းကို အားကိုးပြီး OpenAI ကို မူရင်းနှိုင်းယှဉ်မှုတွင် Anthropic နှင့် သက်ဆိုင်သည့် ဖွဲ့စည်းပုံဆိုင်ရာ အားနည်းချက်တစ်ခုအဖြစ် ထိထိရောက်ရောက် ထားရှိကြောင်း ကုမ္ပဏီက အခိုင်အမာဆိုသည်။

အနှစ်သာရအားဖြင့် OpenAI က ပြောနေသည်- သင်သည် ကျွန်ုပ်တို့၏ မော်ဒယ်ကို ၎င်း၏နောက်ကျောတွင် လက်တစ်ဖက်ဖြင့် တိုင်းတာသည်။

Chollet ၏ တုံ့ပြန်မှု

ARC Prize ပူးတွဲတည်ထောင်သူ François Chollet သည် စမ်းသပ်မှုပုံစံနှစ်မျိုးကြားတွင် ရှင်းလင်းသောမျဉ်းကိုဆွဲခြင်းဖြင့် တုံ့ပြန်ခဲ့သည်။ စံသတ်မှတ်ချက်ကိုဖြေရှင်းရန် သို့မဟုတ် စံသတ်မှတ်ချက်ပုံစံနှင့်ပတ်သက်သည့် အသိပညာများပါရှိသော "စိတ်ကြိုက်ပြုလုပ်ထားသောကြိုးများ" သည် အကန့်အသတ်မရှိဟု ဆိုသည်။ သို့သော် "ARC-AGI-3 အတွက်မတီထွင်ခဲ့ဘဲ API အသုံးပြုသူများအားလုံးရရှိနိုင်သည်" ၏အထွေထွေရည်ရွယ်ချက် API ဆက်တင်များသည်တရားမျှတသောဂိမ်းဖြစ်သည်။

အမှန်မှာ၊ Chollet သည် ARC Prize ၏ကိုယ်ပိုင် GPT-5.6 Sol ရမှတ်သည် OpenAI ကို အားနည်းချက်ဖြစ်စေသည်ဟု ဝန်ခံခဲ့သည်။ အဖွဲ့အစည်းသည် ၎င်းတို့၏ မော်ဒယ်များကို အထူးသဖြင့် သေးငယ်အောင် ပြုလုပ်နည်းနှင့် ပတ်သက်၍ အကောင်းဆုံး စမ်းသပ်နည်းနှင့်ပတ်သက်၍ OpenAI နှင့် အပြန်ပြန်အလှန်လှန် အလှည့်အပြောင်း အများအပြား ရှိနေကြောင်း ၎င်းက မှတ်ချက်ပြုခဲ့ပြီး ကုမ္ပဏီအား "အဖြေကို စတင်ဖော်ထုတ်ခြင်း" ကို ကြိုဆိုခဲ့သည်။

Chollet သည် ကျန်သည့်စိုးရိမ်မှုကို အလံပြခဲ့သည်။ မတူညီသောဆက်တင်များကိုအသုံးပြုသည့် မတူညီသောဝန်ဆောင်မှုပေးသူများသည် "ဖြစ်နိုင်ချေရှိသော တန်းတူညီမျှမှုပြဿနာ" ဟုခေါ်သည့်အရာကို ဖန်တီးပေးသည် — သို့သော် ၎င်းသည် "ဆက်တင်များနှင့် ကုန်ကျစရိတ်များကို ရှင်းလင်းစွာအစီရင်ခံထားသရွေ့ လက်ခံနိုင်ဖွယ်ရှိသည်" ဟုယူဆသည်။

ဒီအချက်က ဦးဆောင်သူစာရင်းထက် ဘာကြောင့် အရေးကြီးတာလဲ။

အပိုင်းသည် AI လုပ်ငန်းတိုးတက်မှုကို အကဲဖြတ်ပုံကို ပြန်လည်ပုံဖော်ထားသည့် တင်းမာမှုကို အလေးပေးဖော်ပြသည်။ မော်ဒယ်များကို သီးခြားစနစ်များအဖြစ်ထက် အင်္ဂါရပ်ကြွယ်ဝသော APIs များမှတစ်ဆင့် ပိုမိုအသုံးချလာသောကြောင့်၊ မော်ဒယ်တစ်ခု၏ မွေးရာပါစွမ်းရည်နှင့် ၎င်းပတ်ဝန်းကျင်ရှိ အင်ဂျင်နီယာဆိုင်ရာကြားမျဉ်းသည် မှုန်ဝါးနေပါသည်။ ငြမ်းကို လျစ်လျူရှုသော စံသတ်မှတ်ချက်တစ်ခုသည် လက်တွေ့ကမ္ဘာ၏ စွမ်းဆောင်ရည်ကို အားနည်းစေနိုင်သည်။ ဂိမ်းစမ်းသပ်မှုအတွက် ကုမ္ပဏီများကို ဆုချနိုင်မည်ဖြစ်သည်။

ARC-AGI-3 ဆွေးနွေးပွဲသည် နောက်ဆုံးဖြစ်ဖွယ်မရှိပါ။ သတ်မှတ်ထားသော စံသတ်မှတ်ချက်များ၏ထိပ်အနီးတွင် ရှေ့တန်းမော်ဒယ်များ အစုလိုက်အပြုံလိုက် အစုလိုက်အပြုံလိုက် မျှတသော တိုင်းတာမှုအဖြစ် ရေတွက်ခြင်း—နှင့် စံသတ်မှတ်ရန် မည်သူ၏ကြိုးသိုင်းများ—အပေါ်တွင်သာ သဘောထားကွဲလွဲမှုများ ပြင်းထန်လာမည်ဖြစ်သည်။

AI ထက်သာလွန်နေပါစေ။

မော်ဒယ်များ၊ စံညွှန်းများနှင့် ၎င်းတို့ကို တည်ဆောက်နေသည့် ဓာတ်ခွဲခန်းများဆိုင်ရာ ထူးခြားဆန်းသစ်သော AI သတင်း ကို လိုက်နာလိုပါသလား။ AI Buzz Wire သည် သင့်အား ဖုံးအုပ်ထားသည်။

AI သတင်းများကို ဖတ်ရှုရန်