GPT-6 Astra OpenAI telah menyiarkan keputusan terkini pada ARC-AGI-3, penanda aras penaakulan abstrak yang direka untuk mengukur kecerdasan agen, menurut keputusan yang diterbitkan pada hari Rabu oleh Yayasan Hadiah ARC. Model ini mendapat markah 62.7% pada set Separa Persendirian penanda aras di bawah abah-abah Standard yayasan, dan 99.9% apabila dinilai dengan abah-abah Penyesuai Penyedia yang mengekalkan keadaan penaakulan dalaman model antara permintaan.
Keputusan mendarat sehari selepas OpenAI memulakan pelancaran berperingkat Astra, model utama yang telah dirangka syarikat itu sebagai permulaan era baharu. Bagi pembaca yang cuba mengekalkan markah semasa penanda aras dagangan makmal sempadan semakin meningkat, halaman perkembangan AI terkini menjejaki setiap keluaran utama semasa ia berlaku.
Dua Abah-abah, Dua Markah Yang Sangat Berbeza
Jurang antara dua nombor tajuk utama Astra adalah butiran paling penting dalam laporan itu. ARC Prize menilai ejen di bawah abah-abah yang berbeza, dan masing-masing mengubah perkara yang dibenarkan untuk dilakukan oleh model dengan konteksnya sendiri.
Di bawah abah-abah Standard, model boleh membawa nota ke hadapan yang dipilih untuk disimpan semasa ia berfungsi melalui persekitaran. Dengan persediaan itu, Astra pada usaha penaakulan maksimum menjaringkan 62.7%, dengan jumlah kos $26,098 untuk larian penilaian. Sebaliknya, menjalankan abah-abah yang sama dengan penaakulan dimatikan menghasilkan hanya 35.2% manakala kos lebih tinggi — $49,791 — kerana model itu memerlukan lebih banyak tindakan untuk mencapai kemajuan.
Harness Penyesuai Penyedia adalah lebih murah: ia mengekalkan keadaan penaakulan legap model antara permintaan dan menggunakan pemadatan untuk perbualan yang lebih lama, membenarkan Astra menggunakan semula kerja sebelumnya. Di bawah abah-abah itu, Astra memperoleh 99.9% pada usaha penaakulan tinggi untuk $18,817 dan 98.6% pada usaha maksimum untuk $17,332. Malah tetapan penaakulan terendah mencapai 96.7%.
Dalam erti kata lain, perbezaan antara skor separa dan skor yang hampir sempurna bukanlah keupayaan mentah sahaja — ia ialah berapa banyak keadaan kerja model bertahan antara langkah.
Menewaskan Manusia atas Kecekapan Tindakan
ARC-AGI-3 dibina berdasarkan persekitaran permainan novel, abstrak dan berasaskan giliran. Ejen mesti meneroka tanpa arahan, membuat kesimpulan cara dunia berfungsi, mengenal pasti matlamat daripada ganjaran yang jarang, dan merancang tindakan berbilang langkah. Persekitaran ini ditentukur supaya manusia dapat menyelesaikan 100% daripadanya, yang menjadikan prestasi manusia sebagai garis dasar sebagai langkah penanda aras.
Astra bukan sahaja menyelesaikan kebanyakan peringkat — ia menyelesaikannya dengan cekap. Menurut Hadiah ARC, model itu menggunakan lebih sedikit tindakan daripada median yang diuji manusia pada 96% tahap, mengatasi garis dasar manusia dalam kecekapan tindakan merentas set.
Ekonomi perbandingan adalah nyata. Peserta ujian manusia dibayar $115 setiap sesi 90 minit ditambah $5 setiap permainan yang telah selesai, mencapai kira-kira $12.78 setiap percubaan permainan. Penilaian penuh Astra bernilai lima angka, bergantung pada konfigurasi. Tetapi ARC Prize mencatatkan kedutan yang berlawanan dengan intuisi: usaha penaakulan yang lebih tinggi biasanya kosnya lebih rendah, kerana Astra menyelesaikan permainan dalam tindakan yang lebih sedikit, mengurangkan jumlah panggilan model dan token yang dibakar setiap larian.
Model Yang Membina Bahasanya Sendiri
Di luar markah, Hadiah ARC menyerlahkan tingkah laku kualitatif yang diperhatikan oleh pasukan. Astra secara konsisten menukar persekitaran yang tidak dikenali menjadi model dunia simbolik padat — mewakili mekanik permainan sebagai peraturan logik, dan membangunkan trengkas khusus domainnya sendiri untuk menjejaki keadaan dan merancang tindakan.
Itulah tepatnya kemahiran ARC-AGI-3 direka untuk menyiasat. Di mana generasi awal penanda aras menguji penaakulan cair ke atas corak baru, generasi ketiga menguji sama ada ejen boleh meneroka, memodelkan, menetapkan matlamat dan melaksanakan rancangan dalam persekitaran yang tidak pernah dilihatnya — komponen ARC Prize disenaraikan sebagai penerokaan, pemodelan, penetapan matlamat dan perancangan serta pelaksanaan.
Latar Belakang Era AGI
Keputusan penanda aras tiba di tengah-tengah retorik maksimum dari OpenAI sendiri. Pada taklimat akhbar sebelum pelancaran Khamis, presiden syarikat Greg Brockman berkata adalah "tidak munasabah untuk merasakan bahawa kita kini berada dalam era AGI," sambil berhenti daripada pengisytiharan rasmi, menurut liputan The New Stack mengenai pelancaran itu. Beliau menyifatkan AGI sebagai "konsep misi atau konsep rohani" dan bukannya pencetus kontrak.
Penyelidik OpenAI Aidan Clark berkata Astra ialah latihan terbesar syarikat setakat ini — pra-latihan pertama pada lebih 100,000 GPU di tapak Stargate di Texas — dan keluaran OpenAI pertama yang model terdahulu memainkan peranan penting dalam menyelia proses latihan. Akses kekal berperingkat: pelancaran bermula dengan pelanggan perusahaan dalam program Daybreak, dengan ketersediaan Plus, Pro, Perniagaan dan Perusahaan serta akses API dan AWS dijanjikan dalam beberapa hari akan datang.
Asterisk pada Markah
Berhati-hati diperlukan dalam beberapa aspek. Prestasi ARC-AGI-3 Astra sangat bergantung pada konfigurasi abah-abah, seperti yang ditunjukkan oleh dua nombor tajuk, dan abah-abah tersuai yang mengekalkan keadaan model telah menjadi titik perbalahan yang berulang dalam pertikaian penanda aras. Analisis New Stack mengenai pelancaran menyatakan bahawa Astra "menyiarkan keuntungan besar pada tugas khusus, tetapi ia datang pada harga premium dan tidak jelas mendahului pek pengekodan" — peringatan bahawa tanda aras teka-teki agen dan beban kerja komersil setiap hari mengukur perkara yang berbeza.
ARC Prize sendiri merangka latihan itu sebagai mengukur "jurang baki" antara AI dan AGI semasa, mentakrifkan AGI sebagai keupayaan untuk memperoleh apa-apa kemahiran yang manusia boleh, secekap manusia boleh. Skor yang hampir sempurna di bawah keadaan yang menggalakkan tidak menutup jurang itu dengan sendirinya. Dan pada $17,000 hingga $50,000 setiap penilaian dijalankan, hanya makmal yang mempunyai sumber yang baik mampu menjalankan penanda aras pada skala ini — walaupun data kos ARC Prize menunjukkan penaakulan yang lebih bijak sebenarnya boleh mengecilkan bil.
Mengapa Ia Penting
Kecekapan tindakan ialah paksi perbandingan yang benar-benar baharu. Model yang menyelesaikan setiap peringkat tetapi membazir beribu-ribu panggilan melakukannya adalah kurang berguna — dan lebih mahal — berbanding model yang bertindak seperti Astra lakukan di sini: meneroka dengan sengaja, memampatkan perkara yang dipelajarinya dan bertindak mengikutnya. Walau apa pun yang disimpulkan tentang perbahasan AGI, data Hadiah ARC menunjukkan ejen sempadan kini memadankan manusia bukan sahaja sama ada mereka boleh menyelesaikan masalah baru, tetapi tentang cara ekonomi mereka menyelesaikannya.
Kekal Mendahului AI
Setiap keputusan penanda aras, pelancaran model dan perbahasan keselamatan, dijejaki semasa ia berlaku — baca lebih banyak berita AI →
