Pasukan penyelidik dari FAIR di Meta, University of Oxford dan University College London telah memperkenalkan Model Keutamaan Penyelidikan AI (RPM), kaedah untuk menentukan eksperimen pembelajaran mesin mana yang harus dijalankan oleh ejen penyelidikan autonomi. Daripada meramalkan cara percubaan akan mendapat markah, RPM meletakkan calon yang tidak dilaksanakan dan memilih yang paling menjanjikan, anjakan yang dikatakan pasukan menangani kesesakan sebenar dalam penyelidikan dipacu AI: pengiraan pengesahan, menurut laporan MarkTechPost tentang kerja itu.
Idea ini muncul pada saat ejen penyelidikan sudah boleh mencadangkan, melaksanakan dan menjaringkan eksperimen mereka sendiri. Penjanaan idea adalah murah; pelaksanaan tidak. Melatih calon tunggal boleh mengambil masa berjam-jam hingga berhari-hari masa GPU, jadi ejen tidak dapat tidak mencadangkan lebih banyak percubaan daripada yang mampu dijalankan. Calon-calon yang akan dilaksanakan adalah, seperti yang dirangka oleh pasukan, tuil sebenar kepada kemajuan penyelidikan. Untuk makmal yang melihat bil pengiraan mereka meningkat, pembingkaian itulah sebabnya kerja ini menarik perhatian merentasi perkembangan AI terkini dalam automasi penyelidikan.
Mengapa pemilihan percubaan menjadi halangan
Pasukan mendapati bahawa model bahasa tidak boleh dipercayai dalam meramalkan metrik mutlak atau hasil pelaksanaan. Model tidak boleh melihat percubaan calon dan meramalkan skor yang akan dicapai dengan tepat. Apa yang boleh dilakukannya, para penyelidik mendapati, adalah menilai yang mana antara dua calon adalah pertaruhan yang lebih baik - perbandingan relatif dan bukannya ramalan mutlak. RPM dibina sepenuhnya berdasarkan perbezaan itu: mereka tidak pernah meramalkan skor, mereka hanya berpangkat.
Sistem ini berjalan di dalam AIRA-dojo, perancah carian pokok evolusi sumber terbuka yang menjana eksperimen pembelajaran mesin melalui pemilihan induk yang tamak dan pengendali Draf, Penambahbaikan dan Nyahpepijat, mengembalikan nod skor pengesahan tertinggi pada penghujungnya. Penanda aras, AIRS-Bench, juga merupakan sumber terbuka. Kedua-dua perancah dan model keutamaan menggunakan Qwen3.6-27B sebagai tulang belakang mereka, yang dicatatkan oleh pasukan sebagai pemberat terbuka.
Bagaimana kejohanan kalah mati berfungsi
Daripada menjana satu eksperimen kanak-kanak dan melaksanakannya, ejen menggunakan operator 15 kali selari untuk menghasilkan 15 calon yang tidak dilaksanakan. RPM kemudiannya membandingkannya secara berpasangan dalam kejohanan kalah mati, dan hanya pemenang dilaksanakan. Setiap perbandingan diasaskan dalam nod konteks yang dikumpul oleh laluan pertama yang luas dari pokok yang diterokai, dengan setiap calon ditunjukkan bersama markah pengesahan nenek moyangnya, jadi hakim membuat alasan daripada sejarah carian sebenar ejen dan bukannya dalam ruang hampa.
Kertas ini menerangkan dua varian dengan belanjawan pengiraan yang berbeza:
- RPM inferens sahaja — LLM-sebagai-hakim yang membandingkan rancangan calon, kod dan sejarah carian dalam satu pas. Gesaannya telah dioptimumkan dengan MIPROv2 daripada rangka kerja DSPy dan menumpu pada apa yang dipanggil oleh pasukan sebagai rubrik penyiasat utama: ia bertolak ansur dengan pepijat yang boleh diperbaiki, memberi ganjaran kepada kebolehlanjutan dan menghukum arahan penyelidikan yang berlebihan. Ketepatan perbandingan luar talian diukur 57.7 hingga 59.0 peratus.
- Agentic RPM — hakim yang sama ditambah kotak pasir yang mengklonkan persekitaran ejen, termasuk GPU H200 tunggal, dengan alatan terhad kepada Python, Bash dan tindakan penyelesaian serah. Ia menjalankan percubaan perintis berskala kecil, kemudian model maklum balas sama ada mencadangkan percubaan seterusnya yang paling bermaklumat atau menamatkan gelung. Juruterbang dihadkan pada 30 dengan ambang 60 saat, dan baki belanjawan masa sengaja dilebih-lebihkan — 2,700 saat dilaporkan berbanding 300 sebenar — jadi ejen tidak berhenti mengoptimumkan awal.
Seorang hakim ditala seperti penyiasat utama
Pembingkaian pengetua-penyiasat adalah bahagian yang menarik secara senyap-senyap. Daripada memberi ganjaran kepada calon yang kelihatan sangat mengagumkan, rubrik yang dioptimumkan mencerminkan cara penyelidik berpengalaman mencuba idea: kod kereta yang boleh diperbaiki mengalahkan kod yang digilap mengejar jalan buntu dan arahan yang menduplikasi pepohon sedia ada bernilai kurang daripada yang baru. Rubrik itu, yang dipelajari melalui pengoptimuman segera dan bukannya penalaan tangan, itulah yang membawa peningkatan, ablasi pasukan mencadangkan.
Keputusan penanda aras pada AIRS-Bench
Penilaian meliputi 20 teks awam dan tugas jadual, dengan setiap tugas diberikan 24 jam pada satu H200 dan 10 biji rawak. Yang penting, tulang belakang Qwen3.6-27B yang sama menjanakan kedua-dua pengendali eksperimen dan model keutamaan, jadi keuntungan datang daripada lapisan pemilihan dan bukannya model hakim yang lebih kukuh. Purata markah ternormal:
- Tiada RPM (pilihan rawak): 0.684
- RPM inferens sahaja: 0.711
- RPM Agentik: 0.729
- Oracle pengesahan (siling): 0.748
- Uji oracle (siling): 0.759
Kebarangkalian penambahbaikan berbanding pemilihan rawak ialah 0.5923 untuk varian inferens sahaja dan 0.5913 untuk varian ejenik, dengan 95 peratus selang keyakinan sempadan bawah 0.5066 dan 0.5018 — melebihi ambang 0.5 untuk kepentingan statistik, walaupun pasukan itu berterus terang bahawa margin dan bukan transformatif adalah sederhana.
Kecekapan adalah hasil yang lebih praktikal. RPM inferens sahaja mencapai skor akhir garis dasar rawak sebanyak 0.684 dalam 14.88 jam, kelajuan 1.61x, manakala varian agen memerlukan 15.50 jam, kelajuan 1.55x. Walaupun mengambil kira overhed inferens hakim yang dihoskan sendiri, nombor yang diselaraskan kekal menggalakkan.
Wajaran terbuka dan kaveat jujur
Pasukan ini sedar bahawa RPM hanya boleh digunakan sebahagiannya hari ini. Komponen terbuka — tulang belakang terlatih beku tanpa penalaan halus, perancah sumber terbuka dan penanda aras, dan model tulang belakang pemberat terbuka — tetapi keperluan kotak pasir varian agenik dan overhed percubaan perintisnya bermakna kebanyakan makmal akan bermula dengan versi inferens sahaja. Para penyelidik juga ambil perhatian bahawa langkah Nyahpepijat kembali kepada pemilihan rawak dalam varian ejen kerana masa perintis bersaing dengan jam ejen sendiri.
Kepentingan yang lebih besar mungkin berarah. Oleh kerana ejen penyelidikan autonomi beralih daripada tunjuk cara kepada penggunaan harian dalam makmal industri, sumber yang terhad bukan lagi idea tetapi jam GPU dan kaedah yang memerah lebih banyak kemajuan daripada kompaun belanjawan pengiraan tetap dari semasa ke semasa. Kedudukan sebelum berlari adalah idea yang mudah, dan nombor AIRS-Bench mencadangkan ia adalah idea yang berfungsi dengan cukup baik.
Kekal Mendahului AI
Ikuti penyelidikan yang membentuk model esok di AI Buzz Wire.
Baca lebih banyak berita AI →