OpenAI's GPT-6 Astra wis ngirim asil paling canggih ing ARC-AGI-3, patokan penalaran abstrak sing dirancang kanggo ngukur intelijen agen, miturut asil sing diterbitake Rebo dening ARC Prize Foundation. Model kasebut ngetung 62,7% ing set Semi-Private pathokan miturut sabuk standar yayasan, lan 99,9% nalika dievaluasi nganggo sabuk Penyedia Adaptor sing njaga kahanan pertimbangan internal model ing antarane panjalukan.
Asil kasebut ndharat sedina sawise OpenAI miwiti peluncuran Astra, model unggulan sing digawe perusahaan minangka wiwitan jaman anyar. Kanggo para pamaca sing nyoba njaga skor nalika pathokan dagang lab frontier, kaca pangembangan AI paling anyar nglacak saben rilis utama nalika kedadeyan kasebut.
Loro Sabuk, Loro Skor sing Beda banget
Jurang antarane rong nomer judhul Astra minangka rincian paling penting ing laporan kasebut. ARC Prize ngevaluasi agen ing macem-macem harnesses, lan saben ngganti apa model diijini kanggo nindakake karo konteks dhewe.
Ing sabuk standar, model bisa nerusake cathetan sing dipilih kanggo disimpen nalika bisa digunakake ing lingkungan. Kanthi persiyapan kasebut, Astra kanthi upaya nalar maksimal ngetung 62,7%, kanthi total biaya $ 26,098 kanggo evaluasi. Ing mburi ngelawan, nganggo sabuk padha karo alesan dipateni mung diprodhuksi 35,2% nalika biaya luwih - $49,791 - amarga model mbutuhake luwih akeh tumindak kanggo nggawe kemajuan.
Sabuk Adaptor Panyedhiya luwih murah: njaga kahanan penalaran opaque model ing antarane panjaluk lan nggunakake pemadatan kanggo obrolan sing luwih dawa, ngidini Astra nggunakake maneh karya sadurunge. Ing sabuk kasebut, Astra ngetung 99,9% ing upaya penalaran dhuwur kanggo $ 18,817, lan 98,6% ing gaweyan maksimal $ 17,332. Malah setelan nalar sing paling murah tekan 96,7%.
Ing tembung liyane, prabédan antarane skor sebagean lan sing cedhak-sampurna ora mung kemampuan mentahan - iku carane akeh saka negara apa model kang bisa urip antarane langkah.
Ngalahake Manungsa ing Efisiensi Tumindak
ARC-AGI-3 dibangun ing babagan novel, abstrak, lingkungan game adhedhasar giliran. Agen kudu njelajah tanpa instruksi, nyimpulake cara kerjane jagad, ngenali tujuan saka ganjaran sing jarang, lan ngrancang tumindak multi-langkah. Lingkungan kasebut dikalibrasi supaya manungsa bisa ngatasi 100%, sing ndadekake kinerja manungsa minangka garis dasar sing ditindakake.
Astra ora mung ngrampungake tingkat paling akeh - nanging ngrampungake kanthi efisien. Miturut ARC Prize, model kasebut nggunakake tumindak sing luwih sithik tinimbang manungsa sing diuji rata-rata ing 96% tingkat, ngluwihi garis dasar manungsa ing efisiensi tumindak ing set kasebut.
Perbandingan ekonomi pancen angel banget. Peserta tes manungsa dibayar $ 115 saben sesi 90 menit plus $ 5 saben game sing wis rampung, bisa nganti $ 12,78 saben game sing dicoba. Evaluasi lengkap Astra regane limang angka, gumantung saka konfigurasi. Nanging ARC Prize nyathet kerut counterintuitive: gaweyan pertimbangan sing luwih dhuwur umume luwih murah, amarga Astra ngrampungake game kanthi tumindak sing luwih sithik, nyuda jumlah panggilan model lan token sing diobong saben roto.
Model Sing Mbangun Basane
Ngluwihi skor, ARC Prize nyorot prilaku kualitatif sing diamati tim. Astra terus-terusan nguripake lingkungan sing ora pati ngerti dadi model donya simbolis sing kompak - makili mekanika game minangka aturan logis, lan ngembangake shorthand khusus domain dhewe kanggo nglacak tindakan negara lan rencana.
Sing sabenere skill ARC-AGI-3 dirancang kanggo probe. Ing ngendi generasi sadurunge pathokan nguji pertimbangan cairan babagan pola novel, generasi katelu nguji apa agen bisa njelajah, model, nyetel gol lan nglakokake rencana ing lingkungan sing durung nate dideleng - komponen ARC Prize didaftar minangka eksplorasi, modeling, nyetel gol, lan perencanaan lan eksekusi.
Latar mburi AGI-Era
Asil benchmark teka ing tengah-tengah retorika maksimal saka OpenAI dhewe. Ing taklimane pers sadurunge diluncurake Kamis, presiden perusahaan Greg Brockman ujar manawa "ora wajar yen kita saiki ana ing jaman AGI," nalika mandheg saka deklarasi resmi, miturut jangkoan The New Stack babagan peluncuran kasebut. Dheweke nggambarake AGI minangka "konsep misi utawa konsep spiritual" tinimbang pemicu kontrak.
Peneliti OpenAI Aidan Clark ujar manawa Astra minangka latihan paling gedhe ing perusahaan nganti saiki - sing wis dilatih luwih saka 100.000 GPU ing situs Stargate ing Texas - lan rilis OpenAI pisanan sing model sadurunge duwe peran penting kanggo ngawasi proses latihan. Akses tetep ditindakake: rollout diwiwiti karo pelanggan perusahaan ing program Daybreak, kanthi kasedhiyan Plus, Pro, Business lan Enterprise ditambah akses API lan AWS sing dijanjekake ing dina sing bakal teka.
Tanda bintang ing Skor
Ati-ati diwenehake ing sawetara aspek. Kinerja ARC-AGI-3 Astra gumantung banget marang konfigurasi sabuk, kaya sing dituduhake ing rong nomer judhul, lan sabuk khusus sing njaga status model wis dadi titik kontroversi sing terus-terusan ing perselisihan pathokan. Analisis New Stack babagan peluncuran kasebut nyathet yen Astra "ngunggahake hasil gedhe kanggo tugas khusus, nanging regane premium lan ora mimpin paket coding kanthi jelas" - pangeling yen pathokan teka-teki agen lan beban kerja komersial saben dina ngukur macem-macem.
ARC Prize dhewe nggambarake latihan kasebut minangka ngukur "celah sisa" antarane AI lan AGI saiki, nemtokake AGI minangka kemampuan kanggo entuk katrampilan apa wae sing bisa ditindakake manungsa, kanthi efisien kaya manungsa. Skor sing meh sampurna ing kahanan sing cocog ora nutup celah kasebut dhewe. Lan ing $17,000 nganti $50,000 saben evaluasi, mung laboratorium sing duwe sumber daya sing bisa ngetrapake pathokan ing skala iki - sanajan data biaya ARC Prize nuduhake pertimbangan sing luwih cerdas bisa nyuda tagihan kasebut.
Apa Sing Penting
Efisiensi tumindak minangka sumbu perbandingan sing anyar. Model sing ngrampungake saben level nanging mbuwang ewonan telpon kanthi nindakake iku kurang migunani - lan luwih larang - tinimbang sing tumindak kaya Astra ing kene: njelajah kanthi sengaja, ngompres apa sing disinaoni, lan tumindak. Apa wae sing disimpulake babagan debat AGI, data ARC Prize nuduhake agen perbatasan saiki cocog karo manungsa ora mung babagan apa bisa ngatasi masalah novel, nanging babagan cara ekonomi ngatasi masalah kasebut.
Tetep Ahead saka AI
Saben asil pathokan, peluncuran model lan debat safety, dilacak nalika kedadeyan - waca warta AI liyane →
