GPT-6 Astra ya OpenAI imechapisha matokeo ya hali ya juu kwenye ARC-AGI-3, alama ya kufikirika ya kufikirika iliyoundwa kupima akili ya wakala, kulingana na matokeo yaliyochapishwa Jumatano na Wakfu wa Tuzo ya ARC. Muundo huu ulipata asilimia 62.7 kwenye Kiwango cha Nusu Faragha kilichowekwa chini ya Kuunganisha Kawaida ya msingi, na 99.9% ulipotathminiwa kwa kutumia Adapta ya Mtoa Huduma ambayo huhifadhi hali ya ndani ya muundo wa hoja kati ya maombi.

Matokeo yalipatikana siku moja baada ya OpenAI kuanza utangazaji kwa hatua wa Astra, mtindo bora ambao kampuni hiyo imeunda kama mwanzo wa enzi mpya. Kwa wasomaji wanaojaribu kuweka alama kadri kigezo cha biashara cha maabara za mipaka kinavyoendelea, ukurasa wa maendeleo ya hivi punde ya AI hufuatilia kila toleo kuu kadri linavyotokea.

Harnees Mbili, Alama Mbili Tofauti Sana

Pengo kati ya nambari mbili za kichwa cha Astra ndio maelezo muhimu zaidi katika ripoti. ARC Prize hutathmini mawakala chini ya viunga tofauti, na kila mmoja hubadilisha kile ambacho kielelezo kinaruhusiwa kufanya na muktadha wake.

Chini ya Uunganisho wa Kawaida, kielelezo kinaweza kupeleka mbele madokezo ambayo inachagua kuhifadhi inapofanya kazi kupitia mazingira. Kwa usanidi huo, Astra kwa bidii ya juu zaidi ya hoja ilipata 62.7%, kwa gharama ya jumla ya $26,098 kwa tathmini. Kwa upande mwingine, kutumia njia sawa na hoja iliyozimwa ilizalisha 35.2% tu huku ikigharimu zaidi - $49,791 - kwa sababu muundo huo ulihitaji hatua nyingi zaidi kufanya maendeleo.

Uunganisho wa Adapta ya Mtoa Huduma ni wa ukarimu zaidi: huhifadhi hali ya kufikiri isiyoeleweka ya mtindo kati ya maombi na hutumia mkato kwa mazungumzo marefu, kuruhusu Astra kutumia tena kazi ya awali. Chini ya uunganisho huo, Astra ilipata 99.9% kwa bidii ya juu ya hoja kwa $18,817, na 98.6% kwa bidii ya juu kwa $17,332. Hata mpangilio wa chini kabisa wa hoja ulifikia 96.7%.

Kwa maneno mengine, tofauti kati ya alama ya sehemu na iliyo karibu-kamili sio uwezo mbichi pekee - ni kiasi gani cha hali ya kufanya kazi ya modeli hubaki kati ya hatua.

Kupiga Binadamu kwenye Ufanisi wa Kitendo

ARC-AGI-3 imejengwa karibu na riwaya, dhahania, mazingira ya mchezo wa zamu. Ni lazima mawakala wachunguze bila maagizo, wabaini jinsi ulimwengu unavyofanya kazi, watambue malengo kutoka kwa zawadi chache na kupanga hatua za hatua nyingi. Mazingira yamesahihishwa ili wanadamu waweze kuyatatua kwa asilimia 100, jambo ambalo hufanya utendaji wa binadamu kuwa msingi wa hatua za kigezo dhidi yake.

Astra haikusuluhisha viwango vingi tu - iliyatatua kwa ufanisi. Kulingana na Tuzo ya ARC, modeli ilitumia vitendo vichache kuliko ile ya wastani iliyojaribiwa binadamu kwenye 96% ya viwango, na kupita kiwango cha msingi cha binadamu katika ufanisi wa vitendo katika seti nzima.

Uchumi wa kulinganisha ni mkali. Washiriki wa jaribio la kibinadamu walilipwa $115 kwa kila kipindi cha dakika 90 pamoja na $5 kwa kila mchezo uliokamilika, wakifanya kazi hadi takriban $12.78 kwa kila mchezo uliojaribu. Uendeshaji kamili wa tathmini ya Astra unagharimu takwimu tano, kulingana na usanidi. Lakini Tuzo ya ARC ilibaini mkunjo usioeleweka: juhudi za juu zaidi za kufikiria kwa ujumla hugharimu kidogo, kwa sababu Astra ilitatua michezo kwa vitendo vichache, na kupunguza jumla ya simu za modeli na tokeni zinazochomwa kwa kila kukimbia.

Mfano Unaojenga Lugha Yake Mwenyewe

Zaidi ya alama, Tuzo la ARC liliangazia tabia ya ubora ambayo timu iliona. Astra mara kwa mara iligeuza mazingira yasiyofahamika kuwa miundo ya kiishara ya ulimwengu - inayowakilisha mechanics ya mchezo kama sheria za kimantiki, na kuunda mkato wake mahususi wa kikoa ili kufuatilia hali na kupanga vitendo.

Hiyo ndiyo hasa ujuzi wa ARC-AGI-3 uliundwa kuchunguza. Ambapo vizazi vya awali vya kielelezo vilivyojaribiwa ufikirio wa majimaji juu ya mifumo ya riwaya, kizazi cha tatu hujaribu kama wakala anaweza kuchunguza, kuiga mfano, kuweka malengo na kutekeleza mipango katika mazingira ambayo haijawahi kuona - vipengele vya Tuzo ya ARC huorodhesha kama uchunguzi, uundaji wa mfano, kuweka malengo, na kupanga na kutekeleza.

Mandhari ya AGI-Era

Matokeo ya ulinganisho yalifika huku kukiwa na matamshi ya juu kutoka kwa OpenAI yenyewe. Katika mkutano na wanahabari kabla ya kuzinduliwa kwa Alhamisi, rais wa kampuni Greg Brockman alisema "si jambo la busara kuhisi kuwa sasa tuko katika enzi ya AGI," huku akiacha kufupisha tamko rasmi, kulingana na habari ya The New Stack ya uzinduzi huo. Alielezea AGI kama "dhana ya misheni au dhana ya kiroho" badala ya kichocheo cha mkataba.

Mtafiti wa OpenAI Aidan Clark alisema Astra ilikuwa mafunzo makubwa zaidi ya kampuni yaliyoendeshwa hadi sasa - ya kwanza kupata mafunzo ya awali juu ya zaidi ya GPU 100,000 kwenye tovuti ya Stargate huko Texas - na toleo la kwanza la OpenAI ambalo miundo ya awali ilichukua jukumu muhimu katika kusimamia mchakato wa mafunzo. Ufikiaji unasalia kwa hatua: uchapishaji huanza na wateja wa biashara katika mpango wa Asubuhi, na upatikanaji wa Plus, Pro, Business na Enterprise pamoja na ufikiaji wa API na AWS ulioahidiwa katika siku zijazo.

Nyota kwenye Alama

Tahadhari inahitajika katika nyanja kadhaa. Utendaji wa ARC-AGI-3 wa Astra unategemea sana usanidi wa kuunganisha, kama nambari mbili za vichwa vya habari zinavyoonyesha, na vaniti maalum ambazo huhifadhi hali ya kielelezo zimekuwa hoja ya mara kwa mara katika mizozo ya viwango. Uchanganuzi wa New Stack wa uzinduzi ulibainisha kuwa Astra "huchapisha faida kubwa kwa kazi maalum, lakini huja kwa malipo ya juu na haileti kifurushi cha usimbaji" - ukumbusho kwamba vigezo vya mafumbo ya mawakala na mzigo wa kila siku wa kibiashara hupima mambo tofauti.

Tuzo ya ARC yenyewe inapanga zoezi hilo kama kupima "pengo la mabaki" kati ya AI ya sasa na AGI, ikifafanua AGI kama uwezo wa kupata ujuzi wowote ambao mwanadamu anaweza, kwa ufanisi kadri mwanadamu anavyoweza. Alama iliyo karibu-kamili chini ya hali nzuri haizibi pengo hilo peke yake. Na kwa $17,000 hadi $50,000 kwa kila tathmini inayoendeshwa, ni maabara zenye nyenzo nzuri pekee ndizo zinaweza kumudu kutekeleza kigezo kwa kiwango hiki - ingawa data ya gharama ya ARC Tuzo inaonyesha mawazo nadhifu yanaweza kupunguza bili.

Kwanini Ni Muhimu

Ufanisi wa vitendo ni mhimili mpya wa kulinganisha. Muundo unaosuluhisha kila kiwango lakini upoteze maelfu ya simu ukiifanya haufai - na ni ghali zaidi - kuliko ule unaofanya kazi kama Astra ilifanya hapa: kuchunguza kwa makusudi, kushinikiza kile inachojifunza, na kukifanyia kazi. Chochote ambacho mtu anahitimisha kuhusu mjadala wa AGI, data ya Tuzo ya ARC inaonyesha mawakala wa mipaka sasa wanalingana na wanadamu sio tu kama wanaweza kutatua matatizo mapya, lakini jinsi wanavyoyatatua kiuchumi.

Kaa Mbele ya AI

Kila matokeo ya kielelezo, uzinduzi wa muundo na mjadala wa usalama, unaofuatiliwa jinsi unavyofanyika — soma habari zaidi za AI →