GPT-6 Astra OpenAI mungkin bergelut dengan masalah kepercayaan pengguna di bahagian pengekodan, tetapi pada penanda aras robotik baharu ia menyiarkan nombor yang membuat penyelidik bercakap tentang lonjakan kualitatif. Pada StationeryBench, ujian yang dibina di sekeliling objek meja biasa, Astra menyelesaikan sepenuhnya 7 daripada 100 tugasan manakala MolmoAct2 Ai2, model yang ditandinginya, menyelesaikan sifar.
Penanda aras, yang diterangkan oleh The Decoder, meletakkan kedua-dua model itu antara satu sama lain dalam lima tugasan objek meja - membuka penutup penanda, menuang klip kertas atau melepasi pembaris antara dua lengan robot. Kedua-dua model mengawal robot YAM dwi-lengan yang sama merentasi 200 percubaan, reka bentuk kawalan yang bertujuan untuk mengasingkan keupayaan model daripada perbezaan perkakasan. Semua hasil carian, video dan kod telah diterbitkan di GitHub. Untuk lebih banyak liputan penyelidikan seperti ini, semak [hab berita AI] kami(https://aibuzzwire.news).
Satu 'Perubahan Langkah,' Menurut Penyelidik
Yoav Artzi, penyelidik AI di Cornell dan Google DeepMind, menggelar prestasi Astra sebagai "perubahan langkah dalam penaakulan spatial" — jenis hasil penanda aras bahasa yang jarang diperolehi. Pada penanda aras yang masih belum diterbitkan dipanggil REMAP, Astra mencapai ketepatan hampir dengan tahap manusia, walaupun Artzi menyatakan bahawa "malah Astra tidak mencapai apa yang manusia lakukan dalam senario lain."
Skor kemajuan median Astra mencecah 46 daripada 100, berbanding dengan 12 untuk MolmoAct2 — jurang yang lebih penting daripada yang dicadangkan oleh nombor penyiapan tajuk. Tugas robotik dinilai berdasarkan kemajuan separa serta kejayaan penuh, dan tiga kali ganda skor median saingan menunjukkan model itu secara konsisten semakin jauh melalui urutan manipulasi dan bukannya berjaya dengan nasib pada beberapa percubaan.
Mengapa Penaakulan Ruang Tiba-tiba Penting
Hasilnya membayangkan bagaimana Astra dilatih. Artzi mengesyaki OpenAI melatih model pada sejumlah besar data 3D, seperti adegan Blender, yang akan selaras dengan kekuatan khusus model pada tugasan 3D. Jika bacaan itu betul, ia mencadangkan persekitaran 3D sintetik — lebih murah dan lebih selamat daripada pengumpulan data dunia sebenar — menjadi laluan yang berdaya maju kepada kecekapan dunia fizikal, salah satu kesesakan yang paling lama wujud dalam robotik.
Reka bentuk penanda aras juga mengatakan sesuatu tentang ke mana penilaian robotik menuju. Tugas StationeryBench sengaja dilakukan — membuka penutup penanda, menuang klip kertas, menyerahkan pembaris — kerana manipulasi setiap hari, bukan prestasi sinematik, yang memisahkan demo makmal daripada mesin yang berguna. Menggredkan kedua-dua model pada perkakasan YAM dwi-lengan yang sama merentas 200 percubaan, dan menerbitkan setiap video, adalah persediaan yang luar biasa telus untuk tuntutan keupayaan yang melibatkan perdana makmal sempadan.
MolmoAct2, model perbandingan dari Institut Allen untuk AI (Ai2), yang tidak menyelesaikan satu pun tugas adalah jenis datumnya sendiri: ia mencadangkan jurang antara model sempadan tujuan am dan model robotik yang dibina khas bukan lagi hanya menutup tetapi menyongsangkan, sekurang-kurangnya pada manipulasi berat penaakulan.
Ia juga sesuai dengan cita-cita OpenAI yang dinyatakan: syarikat itu mempunyai rancangan jangka panjang untuk membina robot penggunanya sendiri, menurut laporan yang dipetik oleh The Decoder. Model bahasa sempadan yang boleh membuat alasan tentang objek, tangan dan trajektori ialah separuh perisian daripada nada itu. Separuh perkakasan masih tidak dapat diselesaikan, tetapi penanda aras seperti StationeryBench ialah cara cerita itu diukur.
Konteks: Model Dengan Minggu yang Rumit
Hasilnya mendarat dalam kitaran berita pelik untuk OpenAI. Model yang sama di tengah-tengah penanda aras ini telah menghabiskan masa seminggu menghadapi aduan pengguna bahawa ia telah menjadi bodoh sejak pelancaran — aduan OpenAI dikesan kepada tiga kecacatan yang dinamakan, daripada kemahiran salah tembak kepada eksperimen konteks yang salah laku, sebelum menetapkan semula had penggunaan Codex. Model yang tersandung dalam pengeluaran semasa menyiarkan keputusan perubahan langkah dalam makmal ialah ketepatan industri AI semasa: keupayaan dan kebolehpercayaan semakin meningkat pada jam yang berbeza.
Ia juga mendarat di tengah-tengah perdebatan keselamatan yang disertai oleh kepimpinan OpenAI sendiri. Ketua saintis syarikat telah memberi amaran bahawa tiada makmal telah menyelesaikan kawalan ke atas sistem yang semakin autonomi, dan Ketua Pegawai Eksekutif Anthropic telah menyeru agar industri memperlahankan pembangunan sempadan sama sekali. Penanda aras yang menunjukkan model yang memanipulasi dunia fizikal — walaupun dunia hanyalah sebuah meja yang ditutupi dengan alat tulis — betul-betul jenis hasil yang dipetik oleh kedua-dua eksekutif apabila mereka berhujah bahawa kadar kemajuan adalah mengatasi pengawasan.
Intinya
Tujuh tugasan yang telah siap sepenuhnya daripada 100 tidak akan meletakkan robot di atas meja anda esok. Tetapi beralih daripada sifar pesaing kepada tujuh, dengan skor kemajuan median tiga kali lebih tinggi, adalah jenis ketidaksinambungan yang mengubah carta keupayaan dalam pemahaman bahasa dua tahun lalu. Persoalan terbuka ialah sama ada model yang sama boleh menyampaikan kecekapan itu secara pasti, di luar penanda aras, pada harga yang sanggup dibayar oleh pemaju.
Kekal Mendahului AI
Penanda aras, kejayaan dan perlumbaan ke arah mesin yang bertindak — diikuti setiap hari.
Baca lebih banyak berita AI →