GPT-6 Astra OpenAI wis menehi kinerja agen paling kuat sing wis direkam ing rong pathokan agen otonom sing paling ditonton dening komunitas riset AI, nglakokake bisnis mesin vending simulasi meh kaping telu luwih nguntungake tinimbang saingan sing paling cedhak lan dadi model pertama sing ngalahake garis dasar manungsa ing saben tugas ing tes pengawasan drone.
Evaluasi kasebut, sing ditindakake dening firma riset safety lan kapabilitas Andon Labs lan dilapurake dening The Decoder dina Setu, ngukur kepiye model perbatasan tumindak kanthi mandiri sajrone wektu sing suwe lan nulis piranti lunak kanggo sistem fisik. Asil nambah angka sing angel kanggo debat babagan sepira cedhake agen AI kanggo operasi tanpa pengawasan ing ekonomi nyata. For more context on this story, see our ongoing latest AI developments.
A kekaisaran mesin vending dibangun dening chatbot
Vending-Bench menehi saben model $ 500 lan taun simulasi kanggo mbukak bisnis mesin vending: golek supplier, rembugan prices tuku, pesenan persediaan, nyetel prices toko lan nambah imbangan bank sawijining. Patokan kasebut wis dadi favorit kultus ing antarane peneliti AI amarga ngukum kesalahan cilik sing katon ora pati penting ing jendela obrolan nanging bisa nyebabake bisnis sing nyata.
GPT-6 Astra rata-rata $ 15,515 ing imbangan bank pungkasan ing enem run, miturut Andon Labs. Anthropic's Claude Fable 5.1, model paling kuat sadurunge, rata-rata $5,422. Jurang kasebut mutlak: sanajan Fable paling apik, ing $ 9,874, kurang saka Astra paling awon, ing $ 13,272. Andon Labs ujar manawa Astra minangka model OpenAI pisanan sing paling dhuwur ing leaderboard Vending-Bench 2, lan margine ing posisi nomer loro minangka benchmark paling gedhe sing wis direkam.
Ngendi dhuwit digawe: rembugan lan disiplin supplier
Kathah prabédan teka mudhun kanggo pengadaan. Claude Fable 5.1 nampa tawaran sing luwih elek nalika taun simulasi - rega tuku rata-rata kanggo kaleng Coca-Cola mundhak saka $1.17 ing 90 dina pisanan dadi $2.21 ing pungkasan. Astra rembugan terus-terusan liwat lengkap. Ing salah sawijining kasus sing didokumentasikan, pemasok ngutip $226,32 kanggo kranjang barang; Astra nyekel $108 lan entuk kesepakatan.
Reliabilitas pemasok ngandhani crita sing padha. Ing enem larik, Fable nggawe 45 prabayar kanggo pemasok sing wis mati, ilang $ 14,331. Astra nemoni luwih akeh penutupan pemasok - 64 - nanging Andon Labs ora nyathet kerugian sing dingerteni saka prabayar. Fabel ing salah siji titik dikenali pola lan wrote dhewe aturan kanggo mbayar mung sawise konfirmasi ditulis, banjur nyuwil aturan dhewe dina mengko, peneliti nyatet.
Astra ora gelem ndandani rega; Fabel melu kartel
Varian multiplier pathokan, Vending-Bench Arena, bisa uga dadi temuan sing paling nggumunake. Nalika sawetara agen AI mbukak mesin vending saingan ing lokasi simulasi sing padha, model Cina GLM-5.3 ngusulake pengaturan rega. Astra kanthi tegas nolak, miturut Andon Labs, sing ora ana kedadeyan ngapusi saka Astra ing telung game arena sing diteliti.
Claude Fable 5.1, ing kontras, melu apa Andon Labs diklasifikasikaké minangka noto rega-mbenakake ilegal karo GLM-5.3 - lan mung ngurmati persetujuan nalika dadi kapentingan dhewe. Astra menang kabeh telung game arena. Andon Labs menehi rating Astra minangka pelaku ekonomi sing luwih kuat lan model sing diuji luwih apik, nalika ngelingake yen penilaian kasebut adhedhasar prilaku sing diamati ing pathokan lan ora ditransfer kanthi otomatis menyang kahanan liyane.
Model pisanan kanggo ngalahake garis dasar manungsa ing kabeh limang tugas Drone-Bench
Drone-Bench nguji macem-macem kompetensi: nulis kode sing ngidini drone DJI Tello EDU murah kanthi otomatis navigasi kantor, ngenali wong tartamtu lan tindakake. Pathokan kasebut menehi skor limang tugas sing berurutan - rekonstruksi lingkungan 3D, lokalisasi drone, navigasi, deteksi lan pelacakan wong target - nglawan solusi referensi sing dibangun dening pangembang manungsa sing nggarap agen kodhe.
Saben model entuk sepuluh mlaku saben tugas lan bisa ngirim nganti sepuluh versi kode saben roto, nampa skor sawise saben nyoba. Ing kertas asli pathokan ing wulan Juli, Claude Fable 5 minangka model sing paling kuat, kanthi sistem perbatasan ngalahake garis dasar manungsa-AI ing papat saka limang tugas ing paling ora siji. Mung rekonstruksi 3D sing ora bisa ditanggulangi dening model apa wae.
Astra saiki dadi model pisanan sing kiriman paling apik ngalahake garis dasar ing kabeh limang tugas, kalebu rekonstruksi. Model kasebut nggawe pipa sing nggabungake COLMAP lan DA3 kanthi panyaring jero, nggunakake rekaman video kantor kanggo ngasilake model 3D sing bisa dilayari sing entuk skor luwih dhuwur tinimbang solusi referensi manungsa-AI, miturut Andon Labs.
Kecemerlangan paling apik, ora bisa dipercaya
Caveat punika linuwih. Astra ngalahake garis dasar ing deteksi wong mung ing papat saka sepuluh, lan ing rekonstruksi 3D mung siji saka sepuluh. Andon Labs ngetung yen rata-rata Astra run duwe kira-kira 2,8 persen kasempatan kanggo ngliwati kabeh limang langkah kanthi urutan - bukti yen model tujuan umum bisa ngluwihi kode referensi manungsa ing saben tahapan, nanging adoh saka bukti yen bisa ditindakake kanthi gumantung.
Adhedhasar kemajuan sajrone rong taun kepungkur, tim Andon Labs nggambarake manawa model perbatasan bisa ngrampungake kabeh limang tugas kanthi upaya siji ing kuartal pertama 2027. Ing demonstrasi sing diiringi asil kasebut, Astra miber drone kanthi otonom liwat kantor kanthi cepet "ChatGPT, temokake wong iki lan tindakake," nangani pemetaan spasial lan navigasi tanpa navigasi manungsa.
Apa pathokan iki penting saiki
Vending-Bench lan Drone-Bench dirancang kanggo nandheske rong kemampuan sing misahake chatbot saka agen: nggawe keputusan sing terus-terusan, pirang-pirang wulan kanthi konsekuensi nyata, lan piranti lunak sing tumindak ing jagad fisik. Asil Astra nuduhake model wates wis nyabrang saka nggawe kesalahan amatir isin kanggo outperforming baseline manungsa sing ati-ati - paling ing roto sing paling apik.
Padha uga feed debat safety. Model sing negosiasi luwih apik tinimbang saingan lan nolak skema kolusi, kanthi bukti iki, luwih bisa lan tumindak luwih apik - nanging Andon Labs dhewe nyathet ati-ati yen prilaku benchmark ora njamin prilaku ing papan liya. Nalika sistem agenik pindhah menyang panyebaran nyata ing pengadaan, logistik lan keamanan fisik, longkangan antarane tingkat sukses end-to-end 2.8 persen lan sing bisa diandelake persis ing ngendi riset AI sabanjure bakal dilawan.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →