Anthropic telah menerbitkan penyelidikan yang menunjukkan bahawa sistem AI automatik boleh membaiki kegagalan penjajaran model dengan pasti, hasil yang boleh membentuk semula cara kerja keselamatan di pusat industri AI dilakukan. Makalah itu, bertajuk "Penyelidik Automatik Boleh Mengurangkan Kegagalan Penjajaran dengan Amanah," dikeluarkan pada hari Jumaat dan diperincikan oleh TechCrunch.
Penyelidikan itu keluar daripada program felo Anthropic dan diketuai oleh Chen Yueh-Han. Tuntutan utamanya adalah menarik: apabila sistem penyelidikan automatik syarikat ditunjuk pada sepuluh penanda aras yang mengukur gelagat tidak sejajar tertentu, mereka meningkatkan prestasi pada setiap satu — tanpa merendahkan keupayaan keseluruhan model. Untuk bidang yang telah bergelut untuk memastikan kerja keselamatan mengikut langkah dengan skala model, itu adalah hasil yang ketara. For more context on this story, see our ongoing latest AI developments.
Kisah itu mendarat semasa regangan yang sibuk untuk liputan keselamatan AI. Ia berikutan musim panas di mana salah laku ejen telah mendominasi tajuk utama, daripada laporan dalaman OpenAI mengenai ejen penggodam ganjaran hinggalah kepada penyiasatan bebas mengenai pelanggaran Hugging Face. Kertas kerja baharu Anthropic menghampiri masalah dari arah yang bertentangan: bukannya bertanya bagaimana ejen berkelakuan buruk, ia bertanya sama ada ejen lain boleh dipercayai untuk membetulkannya.
Apa Yang Sebenarnya Dilaporkan oleh Kertas
Sistem yang diterangkan dalam kertas itu dipanggil Penyelidik Penjajaran Automatik, atau AAR. Daripada menggantikan proses penyelidikan, AAR mereplikasi sebahagian besar daripadanya: setiap sistem automatik mencari literatur yang tersedia, mencadangkan kaedah dan melatih model menggunakan kaedah itu selama kira-kira 30 minit. Proses itu kemudiannya berulang merentasi beberapa lelaran.
Mekanisme pemilihan adalah mudah. Kaedah yang menggerakkan penanda aras dipelihara; kaedah yang tidak dibuang. Gelung itu membolehkan sistem beroperasi dengan cepat dan pada skala yang tidak dapat dipadankan oleh pasukan manusia, menguji banyak arah penyelidikan secara selari dan hanya mengekalkan apa yang berfungsi.
Menurut kertas itu, hasilnya konsisten di seluruh papan. Pada kesemua sepuluh penanda aras yang meliputi gelagat tidak sejajar tertentu, sistem automatik menghasilkan peningkatan yang boleh diukur tanpa menjejaskan prestasi model keseluruhan — pertukaran biasa yang menyukarkan penjajaran.
"Secara keseluruhan, keputusan ini memberikan bukti awal bahawa penjajaran automatik selepas latihan boleh menjadi praktikal dalam jangka masa terdekat, " kata kertas itu.
Menewaskan Manusia, pada 1/37hb Kosnya
Petikan yang paling banyak dipetik dalam kertas itu adalah yang membandingkan AAR secara langsung dengan rakan manusianya. Anthropic tidak melindung nilai perbandingan itu.
"Kaedah AAR terbaik mengatasi apa yang dicadangkan oleh manusia berpengalaman, secara purata dalam masa enam jam, " tulis kertas itu. Ia menambah, dengan jelas, bahawa "arah penyelidikan berpandukan manusia tidak membawa kepada prestasi yang lebih kukuh."
Ekonomi sama tumpul. "AAR berharga kira-kira $4 sejam dalam inferens API berbanding $150 sejam yang kami bayar kepada penyelidik manusia kami," tulis penulis. Itu adalah pembezaan kos hampir 40 kali ganda, dan ia menerangkan sebab makmal mengambil serius penyelidikan automatik sebagai lebih daripada rasa ingin tahu.
Mengapa Jurang Kos Penting
Penyelidikan penjajaran adalah mahal dengan cara yang mudah dipandang rendah. Setiap campur tangan calon perlu dilaksanakan, dilatih, dan dinilai berdasarkan penanda aras, dan kebanyakan calon gagal. Jika sistem boleh menjalankan gelung carian itu secara berterusan untuk harga panggilan API, kos marginal mencuba satu idea lagi menghampiri sifar. Kekangan beralih daripada kiraan kepala kepada pengiraan.
Batasan Anthropic Itu Sendiri Ditanda
Kertas itu berterus-terang tentang apa yang tidak ditentukan oleh hasilnya. Sistem automatik hanya berfungsi setakat penanda aras sebenarnya mencerminkan matlamat penjajaran yang penting — dan membina serta mengekalkan penanda aras yang menangkap salah laku dunia sebenar kekal sebagai masalah terbuka di lapangan.
Terdapat juga pergantungan yang mudah terlepas: penyelidik automatik menggunakan literatur kaedah sedia ada. Mengekalkan dan mengembangkan kesusasteraan itu sendiri adalah kerja yang penting, dan sistem yang hanya mengadun semula teknik yang diketahui mungkin mencapai siling yang tidak dapat dicapai oleh kreativiti manusia.
Kaveat tersebut penting kerana kepentingan jangka panjang penyelidikan bergantung kepada mereka. Jika penanda aras mengukur perkara yang salah, AAR boleh mengoptimumkan laluannya kepada nombor yang kukuh manakala risiko asas kekal tidak disentuh. Pembingkaian Anthropic — "bukti awal," bukan penyelesaian - mencerminkan ketidakpastian itu.
Satu Langkah Ke Arah Pembaikan Diri Rekursif
Makalah itu juga memberi perdebatan yang lebih besar tentang peningkatan diri secara rekursif, idea bahawa sistem AI akhirnya boleh meningkatkan proses latihan yang menghasilkannya. Melatih model AI dengan model AI lain telah menjadi matlamat popular untuk makmal sempadan, dan keputusan Anthropic ialah pandangan awal yang konkrit tentang rupa yang kelihatan dalam domain yang sempit.
Logiknya langsung. Jika model boleh meningkatkan latihan penjajaran mereka sendiri dengan pasti, jentera yang sama boleh ditunjuk pada amalan latihan secara lebih meluas — termasuk kerja keupayaan. TechCrunch mencatatkan implikasi bahawa penyelidik AI manusia akhirnya mungkin menjadi kurang penting kepada proses itu, kemungkinan kertas itu sendiri terlibat dan bukannya mengelak.
Perkara yang Perlu Dilihat Seterusnya
Tiga soalan akan menentukan sama ada keputusan ini digeneralisasikan. Pertama, sama ada pendekatan itu berada di luar sepuluh penanda aras yang diuji Anthropic, pada mod kegagalan yang lebih kucar-kacir dan kurang jelas. Kedua, sama ada masalah penyelenggaraan penanda aras boleh diselesaikan dengan cukup pantas untuk memastikan penyelidikan automatik jujur. Ketiga, sama ada makmal lain menerbitkan hasil yang setanding, yang akan mengubah satu kertas menjadi hala tuju industri.
Buat masa ini, penemuan itu sempit tetapi nyata: pada tugas penjajaran khusus yang diuji Anthropic, penyelidik automatik mengatasi manusia berpengalaman, lebih pantas dan jauh lebih murah. Bahagian keselamatan industri AI mungkin merupakan tempat pertama di mana penyelidik AI - bukan manusia - melakukan kebanyakan kerja.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →