OpenAI ၏ GPT-6 Astra သည် ARC-AGI-3 တွင် ဆန်းကြယ်သော ရလဒ်များကို အေးဂျင့်ဉာဏ်ရည်ကို တိုင်းတာရန် ဒီဇိုင်းထုတ်ထားသည့် ARC-AGI-3 တွင် ခေတ်မီသော ရလဒ်များကို တင်လိုက်ပြီဖြစ်သည်။ မော်ဒယ်သည် ဖောင်ဒေးရှင်း၏ Standard ကြိုးကြိုးအောက်တွင် သတ်မှတ်ထားသော စံသတ်မှတ်ချက်၏ Semi-Private တွင် 62.7% ရမှတ်ရရှိခဲ့ပြီး တောင်းဆိုမှုများကြားတွင် မော်ဒယ်၏အတွင်းပိုင်းကျိုးကြောင်းဆီလျော်မှုအခြေအနေကို ထိန်းသိမ်းထားသည့် ပံ့ပိုးပေးသူအဒပ်တာကြိုးဖြင့် အကဲဖြတ်သည့်အခါ 99.9% ရခဲ့သည်။
OpenAI သည် Astra ကို စတင်မိတ်ဆက်ပြီးနောက် တစ်ရက်အကြာတွင် ကုမ္ပဏီ၏ အထင်ကရ မော်ဒယ်ကို ခေတ်သစ်တစ်ခု၏ အစအဖြစ် ဘောင်ခတ်ထားသည်။ နယ်ခြားဓာတ်ခွဲခန်းများ ကုန်သွယ်မှုစံနှုန်းများ ထိုးနှက်နေချိန်တွင် ရမှတ်ကို ထိန်းထားရန် ကြိုးစားနေသော စာဖတ်သူများအတွက်၊ နောက်ဆုံးပေါ် AI တိုးတက်မှုများ စာမျက်နှာသည် ကြီးကြီးမားမား ထုတ်ဝေမှုတိုင်းကို ဖြစ်ပျက်လာသည်နှင့်အမျှ ခြေရာခံပါသည်။
ကြိုးနှစ်ချောင်း၊ အလွန်ခြားနားသော ရမှတ်နှစ်ခု
Astra ၏ ခေါင်းစီးနံပါတ်နှစ်ခုကြား ကွာဟမှုသည် အစီရင်ခံစာပါ အရေးကြီးဆုံးအသေးစိတ်ဖြစ်သည်။ ARC Prize သည် မတူညီသောကြိုးများအောက်တွင် အေးဂျင့်များကို အကဲဖြတ်ပြီး တစ်ခုစီသည် မော်ဒယ်ကို ၎င်း၏ကိုယ်ပိုင်အကြောင်းအရာနှင့် လုပ်ဆောင်ရန်ခွင့်ပြုထားသည်ကို ပြောင်းလဲသည်။
Standard ကြိုးကြိုးအောက်တွင်၊ မော်ဒယ်သည် ပတ်ဝန်းကျင်တစ်ခုတွင် အလုပ်လုပ်သောကြောင့် ၎င်းအား သိမ်းဆည်းထားရန် ရွေးချယ်ထားသော ရှေ့မှတ်စုများကို သယ်ဆောင်နိုင်သည်။ ထိုထည့်သွင်းမှုနှင့်အတူ Astra သည် အကဲဖြတ်ခြင်းအတွက် စုစုပေါင်းကုန်ကျစရိတ် 26,098 ဒေါ်လာဖြင့် ကျိုးကြောင်းဆင်ခြင်အားထုတ်မှုတွင် 62.7% ရမှတ်ရခဲ့သည်။ ဆန့်ကျင်ဘက်အဆုံးတွင်၊ မော်ဒယ်သည် တိုးတက်မှုအတွက် နောက်ထပ်လုပ်ဆောင်စရာများစွာ လိုအပ်သောကြောင့် မော်ဒယ်သည် တိုးတက်မှုအတွက် နောက်ထပ်လုပ်ဆောင်စရာများစွာ လိုအပ်သောကြောင့် ဆန့်ကျင်ဘက်အားဖြင့် ဆန့်ကျင်ဘက်အားဖြင့် တူညီသောကြိုးကို ကျိုးကြောင်းဆင်ခြင်ခြင်းဖြင့် 35.2% မျှသာ ထုတ်လုပ်နိုင်သည်ကို ပိတ်ထားသည်။
ပံ့ပိုးပေးသူ အဒပ်ပတာကြိုးသည် ပိုရက်ရောသည်- ၎င်းသည် တောင်းဆိုမှုများကြားတွင် မော်ဒယ်၏ ရောင်ပြန်ဟပ်သော ကျိုးကြောင်းဆီလျော်မှုအခြေအနေကို ထိန်းသိမ်းကာ ကြာကြာပြောဆိုမှုများအတွက် စုစည်းမှုကို အသုံးပြုကာ Astra သည် ယခင်အလုပ်များကို ပြန်လည်အသုံးပြုခွင့်ပေးသည်။ ထိုကြိုးအောက်တွင် Astra သည် $18,817 ဖြင့် 98.6% ဖြင့် အမြင့်ဆုံးအားထုတ်မှုတွင် $17,332 ဖြင့် 98.6% ရခဲ့သည်။ အနိမ့်ဆုံး ကျိုးကြောင်းဆင်ခြင်မှု သတ်မှတ်ချက်များသည်ပင် 96.7% သို့ ရောက်ရှိခဲ့သည်။
တစ်နည်းဆိုရသော်၊ တစ်စိတ်တစ်ပိုင်းရမှတ်နှင့် ပြီးပြည့်စုံလုနီးပါးအကြား ခြားနားချက်သည် အကြမ်းထည်စွမ်းရည်တစ်ခုတည်းမဟုတ်ပေ — ၎င်းသည် အဆင့်များကြားတွင် မော်ဒယ်၏လုပ်ဆောင်မှုအခြေအနေ မည်မျှရှင်သန်နေမည်နည်း။
လုပ်ဆောင်ချက် ထိရောက်မှုဖြင့် လူသားများကို အနိုင်ယူခြင်း။
ARC-AGI-3 သည် ဝတ္ထု၊ စိတ်ကူးယဉ်၊ အလှည့်ကျ ဂိမ်းပတ်ဝန်းကျင်တွင် တည်ဆောက်ထားသည်။ အေးဂျင့်များသည် ညွှန်ကြားချက်မပါဘဲ စူးစမ်းလေ့လာရမည်ဖြစ်ပြီး၊ ကမ္ဘာကြီး၏အလုပ်လုပ်ပုံကို ကောက်ချက်ချရမည်၊ အကျဲသောဆုကြေးများမှ ပန်းတိုင်များကို ခွဲခြားသတ်မှတ်ကာ အဆင့်ပေါင်းများစွာ လုပ်ဆောင်ချက်များကို စီစဉ်ရမည်ဖြစ်သည်။ ပတ်ဝန်းကျင်များကို လူသားများက 100% ဖြေရှင်းနိုင်စေရန် ချိန်ညှိထားသောကြောင့် လူသားများ၏ စွမ်းဆောင်နိုင်မှု စံသတ်မှတ်ချက်များနှင့် ဆန့်ကျင်သည့် အခြေခံအချက်များကို ဖြစ်စေသည်။
Astra သည် အဆင့်အများစုကို ဖြေရှင်းရုံသာမကဘဲ၊ ၎င်းတို့ကို ထိရောက်စွာ ဖြေရှင်းပေးသည်။ ARC Prize အရ၊ မော်ဒယ်သည် အဆင့်များ၏ 96% တွင် ပျမ်းမျှစမ်းသပ်ထားသော လူသားများထက် အနည်းငယ်သာသော လုပ်ဆောင်ချက်များကို အသုံးပြုပြီး အစုံလိုက်လုပ်ဆောင်မှု ထိရောက်မှုတွင် လူသား၏ အခြေခံအဆင့်ကို ကျော်လွန်သွားပါသည်။
စီးပွားရေးအရ နှိုင်းယှဥ်မှုသည် နက်နဲသည်။ လူသားစမ်းသပ်မှုတွင် ပါဝင်သူများသည် မိနစ် 90 အပိုင်းတစ်ခုလျှင် $115 နှင့် ပြီးသွားသောဂိမ်းတစ်ခုလျှင် $5 ပေးဆောင်ရပြီး ကြိုးစားသည့်ဂိမ်းတစ်ခုလျှင် $12.78 နီးပါးရရှိမည်ဖြစ်သည်။ Astra အကဲဖြတ်မှု အပြည့်အစုံသည် ဖွဲ့စည်းမှုအပေါ်မူတည်၍ ကိန်းဂဏန်းငါးလုံး ကုန်ကျသည်။ သို့သော် ARC Prize သည် တန်ပြန်တွန့်ဆုတ်မှုကို သတိပြုမိသည်- မြင့်မားသော ကျိုးကြောင်းဆီလျော်မှုအား ယေဘုယျအားဖြင့် Astra သည် လုပ်ဆောင်ချက်နည်းနည်းဖြင့် ဂိမ်းများကို ဖြေရှင်းနိုင်သောကြောင့် မော်ဒယ်ခေါ်ဆိုမှုများနှင့် တိုကင်စုစုပေါင်းအရေအတွက်ကို လျှော့ချကာ လည်ပတ်မှုတစ်ခုလျှင် လောင်ကျွမ်းသွားသော အရေအတွက်ကို လျှော့ချပေးသောကြောင့် ဖြစ်သည်။
၎င်း၏ကိုယ်ပိုင်ဘာသာစကားကိုတည်ဆောက်သည့်ပုံစံ
ရမှတ်များအပြင် ARC Prize သည် အဖွဲ့မှ သတိပြုမိသော အရည်အသွေးရှိသော အပြုအမူကို မီးမောင်းထိုးပြခဲ့သည်။ Astra သည် မရင်းနှီးသောပတ်ဝန်းကျင်များကို ကျစ်ကျစ်လျစ်လျစ်သော သင်္ကေတကမ္ဘာပုံစံများအဖြစ်သို့ တစိုက်မတ်မတ်ပြောင်းလဲခဲ့သည် — ဂိမ်းစက်ပိုင်းဆိုင်ရာများကို ယုတ္တိနည်းဥပဒေများအဖြစ် ကိုယ်စားပြုကာ အခြေအနေနှင့် လုပ်ဆောင်ချက်များကို ခြေရာခံရန် ၎င်း၏ကိုယ်ပိုင် domain-specific အတိုကောက်ကို တီထွင်ခဲ့သည်။
အဲဒါကတော့ ARC-AGI-3 ကျွမ်းကျင်မှုကို စူးစမ်းလေ့လာဖို့ ဒီဇိုင်းထုတ်ခဲ့တာ အတိအကျပါပဲ။ အစောပိုင်းစံနှုန်းများ၏ အစောပိုင်းမျိုးဆက်များသည် ဆန်းသစ်သောပုံစံများထက် အရည်အတွက် ကျိုးကြောင်းဆင်ခြင်မှုကို စမ်းသပ်သည့်အခါ၊ အေးဂျင့်တစ်ဦးသည် စူးစမ်းရှာဖွေနိုင်၊ စံပြ၊ ရည်မှန်းချက်များချမှတ်ကာ မမြင်ဖူးသောပတ်ဝန်းကျင်များတွင် အစီအစဉ်များလုပ်ဆောင်နိုင်မှုရှိမရှိ တတိယမျိုးဆက်သည် စမ်းသပ်စစ်ဆေးသည် — ARC Prize lists အစိတ်အပိုင်းများကို စူးစမ်းလေ့လာခြင်း၊ မော်ဒယ်ပြုလုပ်ခြင်း၊ ပန်းတိုင်သတ်မှတ်ခြင်းနှင့် စီစဉ်ခြင်းနှင့် အကောင်အထည်ဖော်ခြင်းတို့ဖြစ်သည်။
AGI-Era နောက်ခံကားချပ်
OpenAI ကိုယ်တိုင်မှ အမြင့်ဆုံးသော နှုတ်ထွက်စကားများကြားတွင် စံရလဒ်များ ရောက်ရှိလာခဲ့သည်။ The New Stack ၏ သတင်းဖော်ပြချက်အရ ကုမ္ပဏီဥက္ကဋ္ဌ Greg Brockman က ကြာသပတေးနေ့ မစတင်မီ သတင်းစာရှင်းလင်းပွဲတွင် “ကျွန်ုပ်တို့သည် ယခု AGI ခေတ်သို့ ရောက်ရှိနေပြီဟု ခံစားရခြင်းမှာ ကျိုးကြောင်းဆီလျော်မှုမရှိ” ဟုဆိုကာ တရားဝင်ကြေငြာချက်တစ်ခုမှ ပျက်ပြယ်သွားခဲ့ကြောင်း The New Stack ၏ ဖော်ပြချက်အရ သိရသည်။ သူက AGI ကို စာချုပ်အရ အစပျိုးခြင်းထက် "မစ်ရှင်သဘောတရား သို့မဟုတ် ဝိညာဉ်ရေးရာအယူအဆ" အဖြစ် ဖော်ပြခဲ့သည်။
OpenAI သုတေသီ Aidan Clark က Astra သည် ယနေ့အထိ ကုမ္ပဏီ၏ အကြီးဆုံး လေ့ကျင့်ရေး အပြေးဖြစ်ပြီး - Texas ရှိ Stargate site တွင် GPU ပေါင်း 100,000 ကျော်အတွက် ပထမဆုံး ကြိုတင် လေ့ကျင့်ထားသည့် OpenAI နှင့် အစောပိုင်း မော်ဒယ်များသည် လေ့ကျင့်ရေး လုပ်ငန်းစဉ်ကို ကြီးကြပ်ရာတွင် အရေးပါသော အခန်းကဏ္ဍမှ ပါဝင်ခဲ့သည့် ပထမဆုံး OpenAI ဖြစ်သည်ဟု ပြောကြားခဲ့သည်။ အသုံးပြုခွင့်ကို အဆင့်သတ်မှတ်ထားဆဲဖြစ်သည်- လာမည့်ရက်များတွင် ကတိပြုထားသည့် Plus၊ Pro၊ လုပ်ငန်းနှင့် လုပ်ငန်းဆိုင်ရာရရှိနိုင်မှုအပြင် API နှင့် AWS အသုံးပြုခွင့်တို့နှင့်အတူ Daybreak ပရိုဂရမ်ရှိ လုပ်ငန်းဖောက်သည်များမှ စတင်သည်။
ရမှတ်ပေါ်ရှိ ခရေပွင့်
မျက်နှာစာများစွာတွင် သတိပေးထားသည်။ Astra ၏ ARC-AGI-3 စွမ်းဆောင်ရည်သည် ခေါင်းစီးနံပါတ်နှစ်ခုကိုပြသထားသောကြောင့် ကြိုးစည်းဖွဲ့စည်းပုံပေါ်တွင် များစွာမူတည်နေပြီး မော်ဒယ်အခြေအနေအား ထိန်းသိမ်းထားသည့် စိတ်ကြိုက်ကြိုးများသည် စံသတ်မှတ်ချက်အငြင်းပွားမှုများတွင် ထပ်တလဲလဲငြင်းခုံနေသည့်အချက်ဖြစ်သည်။ New Stack ၏ ခွဲခြမ်းစိတ်ဖြာချက်အရ Astra "အထူးပြုလုပ်ငန်းများအတွက် ကြီးကြီးမားမား အမြတ်များ တိုးမြင့်လာသော်လည်း ၎င်းသည် ပရီမီယံဖြင့် လာကာ coding pack ကို ရှင်းရှင်းလင်းလင်း မပို့ဆောင်နိုင်သည်" ဟူသော သတိပေးချက်တစ်ခု - အေးဂျင့်ပဟေဠိစံနှုန်းများနှင့် နေ့စဉ်လုပ်ငန်းဆောင်တာများသည် မတူညီသောအရာများကို တိုင်းတာကြောင်း သတိပေးချက်တစ်ခုဖြစ်သည်။
ARC Prize ကိုယ်တိုင်က လက်ရှိ AI နှင့် AGI အကြား "ကျန်နေတဲ့ ကွာဟချက်" ကို တိုင်းတာပြီး လေ့ကျင့်ခန်းကို လူသားတစ်ယောက်တတ်နိုင်သလောက် ကျွမ်းကျင်သလောက် AGI ကို ရယူနိုင်စွမ်းအဖြစ် AGI ကို သတ်မှတ်ပါတယ်။ ကောင်းသောအခြေအနေများအောက်တွင် ပြီးပြည့်စုံသောရမှတ်သည် ထိုကွာဟချက်ကို သူ့ဘာသာသူ မပိတ်ပါ။ အကဲဖြတ်မှုတစ်ခုလျှင် $17,000 မှ $50,000 တွင်၊ ကောင်းမွန်သောအရင်းအမြစ်ရှိသောဓာတ်ခွဲခန်းများကသာ ဤစကေးတွင်စံနှုန်းကို run ရန် တတ်နိုင်သည် — ARC Prize ၏ကုန်ကျစရိတ်ဒေတာသည် ပိုမိုထက်မြက်သောကျိုးကြောင်းဆင်ခြင်ခြင်းက ငွေတောင်းခံလွှာကို အမှန်တကယ်ကျုံ့သွားစေနိုင်သည်။
##ဘာကြောင့်အရေးကြီးတာလဲ။
လုပ်ဆောင်ချက်ထိရောက်မှုသည် နှိုင်းယှဉ်မှု၏ဝင်ရိုးအသစ်ဖြစ်သည်။ အဆင့်တိုင်းကို ဖြေရှင်းပေးသော်လည်း ခေါ်ဆိုမှု ထောင်ပေါင်းများစွာကို ဖြုန်းတီးပစ်သည့် ပုံစံသည် Astra ကဲ့သို့ ဤနေရာတွင် လုပ်ဆောင်သည့်ပုံစံထက် အသုံးဝင်မှု နည်းပါးသည် — နှင့် ပို၍စျေးကြီးသည် — မင်မင်စူးစမ်းလေ့လာခြင်း၊ သင်ယူခြင်းများကို ချုံ့ပြီး လုပ်ဆောင်ခြင်းထက် အဆင့်တိုင်းကို ဖြေရှင်းနိုင်သော မော်ဒယ်တစ်ခု။ AGI စကားရည်လုပွဲနှင့်ပတ်သက်၍ နိဂုံးချုပ်ထားသမျှ ARC Prize ဒေတာသည် ယခုအခါတွင် နယ်ခြားစောင့်အေဂျင်စီများသည် ဆန်းသစ်သောပြဿနာများကို ဖြေရှင်းနိုင်သည်ဆိုသည်ကိုသာမက ၎င်းတို့ကို စီးပွားရေးအရ မည်သို့ဖြေရှင်းနိုင်သည်ဖြစ်စေ လူသားများနှင့် ကိုက်ညီနေကြောင်း ပြသနေသည်။
AI ထက်သာလွန်နေပါစေ။
စံနှုန်းရလဒ်တိုင်း၊ မော်ဒယ်မိတ်ဆက်ပွဲနှင့် ဘေးကင်းရေး ဆွေးနွေးငြင်းခုံမှုများကို ခြေရာခံလိုက်သည် — ပိုမို AI သတင်း →
