Nvidia မှ သုတေသီများသည် Anthropic ၏ Claude Opus 5 ကို AI တွင် အလိုအပ်ဆုံး အပြန်အလှန် ကျိုးကြောင်းဆီလျော်မှု စံနှုန်းများထဲမှ တစ်ခုဖြစ်သည့် ARC-AGI-3 တွင် 100% ရမှတ်သို့ ပြီးပြည့်စုံသော 100% ရမှတ်သို့ တွန်းပို့သည့် အေးဂျင့်စနစ်တစ်ခုကို တည်ဆောက်ထားသည် — ၎င်းသည် ၎င်းကိုယ်တိုင် လုပ်ဆောင်သည့်အခါ ရမှတ် 30% ရမှတ်ကို အသုံးပြုထားသည်။ Nvidia Technical Blog တွင် သောကြာနေ့က ထုတ်ဝေခဲ့သော ရလဒ်သည် ဆော့ဖ်ဝဲလ်သည် ရှေ့တန်းမော်ဒယ်ကို ပတ်ထားသော မော်ဒယ်ကိုယ်တိုင်ကဲ့သို့ အရေးပါကြောင်း အခိုင်မာဆုံး သက်သေသာဓက ဖြစ်ပါသည်။ [နောက်ဆုံးပေါ် AI တိုးတက်မှုများ] (https://aibuzzwire.news) ကို ခြေရာခံသည့်မည်သူမဆိုအတွက် ၎င်းသည် အေးဂျင့် AI ၏ ပြိုင်ဆိုင်မှုဆိုင်ရာ အားသာချက်များ အမှန်တကယ်နေထိုင်သည့်နေရာတွင် အပြောင်းအလဲတစ်ခုဖြစ်သည်။
ဤစနစ်ကို AVO ဟုခေါ်သည်၊ Agentic Variation Operators ၏အတိုကောက်ဖြစ်ပြီး ၎င်းသည် Nvidia ၏ long-horizon ကိုယ်ပိုင်အုပ်ချုပ်ခွင့်ရအေးဂျင့်များအတွက် ယေဘူယျရည်ရွယ်ချက်ဖြင့် တည်ဆောက်ထားခြင်းဖြစ်သည် — AI သည် အချက်တစ်ချက်တည်းကိုဖြေဆိုမည့်အစား နာရီ သို့မဟုတ် ရက်များစွာကြာကြာနေနိုင်သည့်အလုပ်ဖြစ်သည်။ ARC-AGI-3 အများသူငှာသတ်မှတ်မှုတွင်၊ AVO သည် ဂိမ်းပတ်ဝန်းကျင် 25 ခုလုံးတွင် 100.00 RHAE ရမှတ်ကို မှတ်တမ်းတင်ထားပြီး Claude Opus 5 ကို ၎င်း၏နောက်ခံပုံစံအဖြစ် အသုံးပြု၍ အဆင့် 183 အားလုံးကို 6,624 ပတ်၀န်းကျင်လုပ်ဆောင်ချက်များတွင် ပြီးမြောက်စေခဲ့သည်။
ARC-AGI-3 အမှန်တကယ် စမ်းသပ်ခြင်းဟူသည် အဘယ်နည်း
ARC-AGI-3 သည် ARC Prize ဖောင်ဒေးရှင်းမှ ဖန်တီးထားသည့် အပြန်အလှန်တုံ့ပြန်သော ကျိုးကြောင်းဆင်ခြင်ခြင်းစံနှုန်းတစ်ခုဖြစ်သည်။ အေးဂျင့်တစ်ဦးသည် ညွှန်ကြားချက်မရှိ၊ ဖော်ပြထားသော စည်းမျဉ်းများမရှိ၊ ဖော်ပြထားသော ပန်းတိုင်မရှိသော ဂိမ်းကဲ့သို့သော ရင်းနှီးမှုမရှိသော၊ ၎င်းသည် စမ်းသပ်မှုနှင့် အမှားမှတစ်ဆင့် စူးစမ်းလေ့လာရန်၊ ပတ်ဝန်းကျင်၏ အလုပ်လုပ်ပုံကို ကောက်ချက်ချရန်၊ "အနိုင်ရခြင်း" ဟူသော အဓိပ္ပာယ်ကို ရှာဖွေဖော်ထုတ်ရန်၊ ထို့နောက် ပိုမိုခက်ခဲသောအဆင့်များမှတစ်ဆင့် အဆင့်ဆင့်တိုးတက်ရန် လုံလောက်စွာ ထိရောက်စွာ လုပ်ဆောင်ရမည်ဖြစ်သည်။
စံသတ်မှတ်ချက်၏ အမှတ်ပေး မက်ထရစ်၊ ဆွေမျိုးလူသား လုပ်ဆောင်ချက် ထိရောက်မှု (RHAE)၊ သည် လုပ်ငန်းပြီးမြောက်ရေးတွင် အေးဂျင့်သည် ပထမအကြိမ် လူသားကစားသမားများနှင့် ပတ်သက်သည့် မည်မျှ ဖြုန်းတီးသည့် လုပ်ဆောင်ချက် အနည်းငယ်နှင့် ပေါင်းစပ်ထားသည်။ ၎င်းသည် စဉ်ဆက်မပြတ် ကိုယ်ပိုင်အုပ်ချုပ်ခွင့်အတွက် ရက်စက်ကြမ်းကြုတ်သော စမ်းသပ်မှုတစ်ခု ဖြစ်စေသည်- အေးဂျင့်သည် ၎င်းသင်ယူခဲ့ရာများကို မှတ်သားထားရန်၊ အမှားများမှ ပြန်လည်ရယူကာ ၎င်း၏လုပ်ဆောင်မှုများကို လည်ပတ်မှုတစ်ခုလုံးတွင် ဂရုတစိုက် ဘတ်ဂျက်သတ်မှတ်ပေးရမည်ဖြစ်သည်။
Nvidia ၏ ခေါင်းစီးနံပါတ်သည် နှိုင်းယှဉ်မှုတစ်ခုမှ အကြောင်းအရာကို ရရှိသည်။ Claude Opus 5 ကိုအသုံးပြုသည့် ယခင်တိုက်ရိုက်အပြန်အလှန်ဆက်သွယ်မှုကြိုးဖြစ်သည့် VISTA သည် တူညီသောအများပြည်သူဆိုင်ရာသတ်မှတ်ထားသောအဆင့် 183 ကို 7,542 ပတ်ဝန်းကျင်လုပ်ဆောင်ချက်များတွင် ပြီးမြောက်ခဲ့သည်။ Nvidia ၏ဘလော့ဂ်ပို့စ်အရ AVO သည် အလုပ်ပြီးမြောက်ရန် အကြမ်းဖျင်းအားဖြင့် 12% အနည်းငယ်သာ လိုအပ်သည်။
GPU Kernels မှ Unknown Games သို့
AVO ကို ပဟေဠိများအတွက် တည်ဆောက်ထားခြင်း မဟုတ်ပါ။ Nvidia သည် သေးငယ်သောကုဒ်ပြောင်းလဲမှုများသည် မှန်ကန်မှု၊ မှတ်ဉာဏ်အပြုအမူနှင့် မှန်းဆမရသောနည်းလမ်းများဖြင့် ဖြတ်သန်းနိုင်သည့် ဒိုမိန်းတစ်ခုဖြစ်သည့် GPU-kernel optimization တွင် ဗိသုကာကို ပထမဆုံးသရုပ်ပြခဲ့သည်။ အာရုံစူးစိုက်မှု-kernel လေ့လာမှုတစ်ခုတွင်၊ AVO သည် ခုနစ်ရက်ကြာ ဆက်တိုက်လုပ်ဆောင်ခဲ့ပြီး ပိုမိုကောင်းမွန်အောင်လုပ်ဆောင်ရန် လမ်းညွှန်ချက် 500 ကျော်ကို ရှာဖွေခဲ့ပြီး kernel ဗားရှင်း 40 ကို လုပ်ဆောင်ခဲ့သည်။ NVIDIA DGX B200 စနစ်များတွင် ထွက်ပေါ်လာသော multihead အာရုံစူးစိုက်မှု kernels များသည် cuDNN ကို 3.5% အထိ စွမ်းဆောင်နိုင်ပြီး FlashAttention-4 သည် 10.5% အထိ သာလွန်သည်။ ထို့နောက်တွင် အေးဂျင့်သည် ၎င်း၏ ဆင့်ကဲပြောင်းလဲလာသော kernel အား ထပ်လောင်းကိုယ်ပိုင်အုပ်ချုပ်ခွင့်လုပ်ဆောင်မှု၏ မိနစ် 30 ခန့်တွင် အုပ်စုဖွဲ့မေးမြန်းမှုအာရုံစိုက်မှုသို့ ပြုပြင်ပြောင်းလဲခဲ့သည်။
တူညီသော core loop — inspect, plan, implement, test, evaluate — ထို့နောက် task interface မှသာလျှင် ARC-AGI-3 တွင် ညွှန်ပြခဲ့သည်။ ယန္တရားနှစ်ခုကို လွှဲပြောင်းပေးခဲ့သည်။ ပထမအချက်မှာ ကြိုတင်အကောင်အထည်ဖော်မှုများ၊ အကဲဖြတ်ရလဒ်များ၊ compiler နှင့် profiler output များနှင့် စုဆောင်းထားသော ကျိုးကြောင်းဆင်ခြင်မှုကို သိမ်းဆည်းထားသည့် persistent memory ဖြစ်သောကြောင့် ကိုယ်စားလှယ်သည် အစမှပြန်တည်ဆောက်ရမည့်အစား အကြောင်းအရာကို အစမှပြန်လည်တည်ဆောက်ခြင်းထက် ၎င်း၏လက်ရှိအခြေအနေမှ ပြန်လည်စတင်နိုင်သည်။ ဒုတိယမှာ ကြီးကြပ်ရေးမှူးဖြစ်ပြီး၊ လမ်းကြောင်းတစ်ခုလုံးကို စောင့်ကြည့်ပြီး တိုးတက်မှုရပ်တန့်နေချိန်တွင် ကြားဝင်ဆောင်ရွက်ပေးသည့် ဒုတိယအေးဂျင့်ဖြစ်သည်။
ကြီးကြပ်သူသည် အောင်မြင်မှုဖြစ်သည်။
ကုမ္ပဏီ၏ AI ယူနစ်မှ ထုတ်ကုန်ဒုတိယဥက္ကဋ္ဌ Nvidia ၏ Adel El Hallak နှင့် တွေ့ဆုံမေးမြန်းခဲ့သော TechCrunch သည် ကြီးကြပ်ရေးမှူးအား အရေးကြီးဆုံးပါဝင်ပစ္စည်းအဖြစ် မီးမောင်းထိုးပြခဲ့သည်။ "ဒါဟာ အေးဂျင့်ကို ဦးတည်သွားတဲ့အခါ ဒါမှမဟုတ် လမ်းဆုံးကို ဦးတည်သွားနိုင်တဲ့ လမ်းကြောင်းကို စတင်ရှာဖွေတဲ့အခါ၊ ဒါမှမဟုတ် သူအရင်က နင်းခဲ့ဖူးတဲ့ လမ်းကြောင်းကို ပြန်လည်ရှာဖွေဖို့ CEO တစ်ယောက်လို ပြုမူလုနီးပါးပါပဲ" ဟု El Hallak က ထုတ်ဝေမှုကို ပြောကြားခဲ့သည်။
စွမ်းဆောင်ရည် ကွာဟချက်က ပြင်းထန်ပါတယ်။ Nvidia ၏စမ်းသပ်မှုတွင် ခေတ်မီဆန်းပြားသောကြိုးမပါသော Claude Opus 5 သည် ARC-AGI-3 တွင် 30% ရမှတ်ကို စီမံခန့်ခွဲနိုင်သည် - စမ်းသပ်ထားသော ဗလာမော်ဒယ်များကြားတွင် အကောင်းဆုံးရလဒ်ဖြစ်သော်လည်း အပြည့်အဝ လည်ပတ်ရန် မနီးစပ်ပါ။ OpenAI ၏ မော်ဒယ်များသည် စံသတ်မှတ်ချက်တွင် 10% အောက်တွင် ရမှတ်ရရှိခဲ့ပြီး ကုမ္ပဏီသည် ၎င်း၏ကိုယ်ပိုင် သုတေသနပြုချက်ကို ပြီးခဲ့သည့်လက ထုတ်ပြန်ခဲ့ရာတွင် ကြိုးကြိုးဆက်တင်နှစ်ခုကို ပြောင်းလဲခြင်းဖြင့် ၎င်း၏ရမှတ်များ သုံးဆတိုးလာကြောင်း ပြသခဲ့သည်။ AVO ရရှိသည့် 100% နီးပါး မော်ဒယ်သီးသန့် ဖွဲ့စည်းမှု မရှိပါ။
မှတ်သားဖွယ်၊ AVO ဖွဲ့စည်းမှုပုံစံသည် စာသားသီးသန့်ပုံစံဖြင့် လုပ်ဆောင်သည်- လေ့လာကြည့်ရှုမှုတစ်ခုစီကို မော်ဒယ်သို့ ပုံများ သို့မဟုတ် ရုပ်ပုံတိုကင်များ မပို့ဘဲ အတိအကျ 64x64 စာသားဂရစ်တစ်ခုအဖြစ် ပံ့ပိုးထားသည်။ ဆင်ခြင်ခြင်းဆိုင်ရာ စွမ်းအားသည် မော်ဒယ်ပတ်ပတ်လည် အဝိုင်းမှ ဆင်းသက်လာကာ ဘက်စုံ ရှုမြင်မှုမှ ဆင်းသက်လာသည်။
စက်မှုလုပ်ငန်းသည် ကြိုးများကို အဘယ်ကြောင့် လောင်းကြေးထပ်သနည်း။
အကြမ်းထည်မော်ဒယ်စွမ်းရည်မဟုတ်ဘဲ အေးဂျင့်အခြေခံအဆောက်အအုံသည် ကိုယ်ပိုင်အုပ်ချုပ်ခွင့်ရ AI အတွက် လက်ရှိပိတ်ဆို့မှုဖြစ်ကြောင်း သက်သေအထောက်အထားများကြားတွင် ရှာဖွေတွေ့ရှိမှုသည် မြေနေရာများဖြစ်သည်။ Databricks သည် ဇူလိုင်လတွင် စံသတ်မှတ်ထားသော သုတေသနကို ထုတ်ဝေခဲ့ပြီး ကြိုးသည် စွမ်းဆောင်ရည်နှင့် ကုန်ကျစရိတ်ကို သိသိသာသာ သက်ရောက်မှုရှိကြောင်း ပြသခဲ့သည်။ "မော်ဒယ်တူပေမယ့် မတူညီတဲ့ကြိုးတွေကို ရွေးချယ်နိုင်ပြီး ကြိုးမှားသုံးရင် ကုန်ကျစရိတ်က သိသိသာသာပိုများပါတယ်" ဟု Databricks အမှုဆောင်အရာရှိချုပ် Ali Ghodsi က TechCrunch သို့ ပြောကြားခဲ့သည်။ "ဒါက မင်းရဲ့ ကုန်ကျစရိတ် ၂ ဆ တိုးနိုင်တယ်"
El Hallak သည် Nvidia ၏ ပွင့်လင်းမြင်သာမှုနှင့်ပတ်သက်၍ ပိုမိုကျယ်ပြန့်သော အငြင်းအခုံကို ဘောင်ခတ်ထားသည်။ "ကြိုးတစ်ခွင်၊ အခြေခံအဆောက်အအုံများတစ်လျှောက်၊ အပြေးအချိန်တစ်လျှောက်လုံး ထိန်းချုပ်နိုင်သည့် ပွင့်လင်းအေးဂျင့်အစုတစ်ခုရှိခြင်း—သည် ဂေဟစနစ်ကိုရှေ့ဆက်ပြီး လုံလုံခြုံခြုံဖြစ်စေရန်အတွက် ကျွန်ုပ်တို့အတွက် လိုအပ်သည့်အရာဖြစ်သည်" ဟု ၎င်းက ပြောကြားခဲ့သည်။ Nvidia တွင် ၎င်း၏ NeMo အမှတ်တံဆိပ်အောက်တွင် ကြိုးတန်းနည်းပညာကို အပွင့်အရွယ်အပိုင်းအစများ ထားရှိထားပြီး AVO သုတေသနကို arXiv စာတမ်းတွင် မှတ်တမ်းတင်ထားသည်။
သမိုင်းနှင့်အတူ စံမှတ်တစ်ခု
ARC-AGI-3 သည် နယ်ခြားဓာတ်ခွဲခန်းပြိုင်ဆိုင်မှုတွင် မီးမောင်းထိုးပြသည့်နေရာဖြစ်လာသည်။ OpenAI သည် ၎င်း၏ GPT-5.6 Sol မော်ဒယ်အတွက် ခိုင်မာသောရလဒ်များကို ယခင်က တောင်းဆိုခဲ့ပြီး အသုံးပြုထားသည့် အကဲဖြတ်မှုဆက်တင်များအပေါ် စိစစ်မှုဆွဲခဲ့သည်။ Nvidia ၏ ရလဒ်သည် တစ်နည်းအားဖြင့် ငြင်းခုံရသော ဘေးထွက်ဆိုးကျိုးများဖြစ်သည် — ၎င်းသည် ပိုမိုထက်မြက်သော မော်ဒယ်ကို မတောင်းဆိုဘဲ၊ ရှိပြီးသားတစ်ခုအနီးရှိ ပိုမိုကောင်းမွန်သော အင်ဂျင်ပါဝါရှိသော အေးဂျင့်တစ်ခုသာ ဖြစ်သည်။
ဆော့ဖ်ဝဲထုတ်လုပ်သူများနှင့် လုပ်ငန်းများအတွက် အေးဂျင့်ထုတ်ကုန်များတည်ဆောက်ခြင်းအတွက် မက်ဆေ့ချ်သည် တိုက်ရိုက်ဖြစ်သည်- မော်ဒယ်ရွေးချယ်မှုသည် အရေးကြီးနေသေးသော်လည်း ယခုအခါ စနစ်ဒီဇိုင်းသည် ရှေ့တန်းမော်ဒယ်သည် နယ်ခြားရလဒ်များကို ထုတ်ပေးခြင်းရှိမရှိ ဆုံးဖြတ်ပေးပါသည်။ Nvidia က ၎င်းကိုပြောသည့်အတိုင်း၊ မော်ဒယ်တစ်ခုအား အကဲဖြတ်ခြင်းသည် အေးဂျင့်ကိုအကဲဖြတ်ခြင်းနှင့် အတူတူပင်မဟုတ်ပါ — နှင့် 2026 ၏စံနှုန်းဇယားများသည် ငြမ်းကိုတည်ဆောက်သောအင်ဂျင်နီယာများကို ပို၍ဆုချခြင်းဖြစ်သည်။
AI ထက်သာလွန်နေပါစေ။
အေးဂျင့်ဗိသုကာများသည် ယခင်ကထက် ပိုမိုမြန်ဆန်စွာ ရွေ့လျားနေပြီး ကောင်းမွန်သောကြိုးနှင့် ဆိုးကြိုးကြားကွာဟချက်ကို ယခုအခါ စံအမှတ်များနှင့် ဒေါ်လာအစစ်များဖြင့် တိုင်းတာပါသည်။ AI Buzz Wire ကို လိုက်နာပါ၊ AI သုတေသန၊ စံသတ်မှတ်ချက်များနှင့် ထုတ်ကုန်မိတ်ဆက်မှုများ၏ နေ့စဉ်၊
AI သုတေသနသတင်း →