Tim riset saka FAIR ing Meta, Universitas Oxford lan University College London wis ngenalake Model Preferensi Riset AI (RPM), cara kanggo nemtokake eksperimen pembelajaran mesin sing kudu ditindakake agen riset otonom. Tinimbang prédhiksi carane eksperimen bakal menehi skor, RPM menehi rangking calon sing ora dieksekusi lan milih sing paling njanjeni, owah-owahan tim kasebut ngandhani bottleneck nyata ing riset sing didorong AI: komputasi verifikasi, miturut laporan MarkTechPost babagan karya kasebut.
Ide kasebut tiba ing wektu nalika agen riset wis bisa ngusulake, ngleksanakake lan ngetung eksperimen dhewe. Generasi idea murah; eksekusi ora. Nglatih calon siji bisa nggunakake jam nganti dina wektu GPU, mula agen mesthi ngusulake eksperimen sing luwih akeh tinimbang sing bisa ditindakake. Calon sing bakal dieksekusi yaiku, amarga tim kasebut nggawe, pengungkit nyata kanggo kemajuan riset. Kanggo laboratorium sing nonton tagihan komputasi mundhak, framing kasebut pancen sebabe karya iki narik kawigaten babagan pangembangan AI paling anyar ing otomatisasi riset.
Apa pilihan eksperimen dadi bottleneck
Tim kasebut nemokake manawa model basa ora bisa dipercaya nalika ngramal metrik absolut utawa asil eksekusi. Model ora bisa ndeleng eksperimen calon lan prédhiksi kanthi akurat skor sing bakal digayuh. Apa sing bisa ditindakake, para peneliti nemokake, yaiku ngadili endi saka rong calon sing luwih apik - perbandingan relatif tinimbang prediksi mutlak. RPM dibangun ing saubengé prabédan kasebut: ora tau ngramal skor, mung peringkat.
Sistem kasebut mlaku ing AIRA-dojo, scaffold telusuran wit evolusioner open-source sing ngasilake eksperimen pembelajaran mesin liwat pilihan wong tuwa sing rakus lan operator Draft, Improve lan Debug, ngasilake simpul skor validasi paling dhuwur ing pungkasan. Patokan, AIRS-Bench, uga mbukak sumber. Scaffold lan model preferensi nggunakake Qwen3.6-27B minangka backbone, sing tim nyathet bobot mbukak.
Cara kerjane turnamen kalah
Tinimbang ngasilake eksperimen bocah siji lan nglakokake, agen kasebut nggunakake operator 15 kaping podo karo kanggo ngasilake 15 calon sing ora dieksekusi. RPM banjur mbandhingake pasangan kasebut ing turnamen kalah, lan mung pemenang sing dieksekusi. Saben mbandhingake adhedhasar simpul konteks sing diklumpukake kanthi mlaku pisanan saka wit sing ditelusuri, kanthi saben calon ditampilake bebarengan karo skor validasi para leluhure, mula hakim menehi alasan saka riwayat telusuran agen kasebut tinimbang ing vakum.
Makalah kasebut nggambarake rong varian kanthi anggaran komputasi sing beda:
- RPM mung inferensi — LLM-minangka-hakim sing mbandhingake rencana calon, kode lan riwayat telusuran ing siji pass. Pandhuan kasebut dioptimalake karo MIPROv2 saka kerangka DSPy lan gabung karo apa sing diarani tim kasebut minangka rubrik peneliti utama: ngidinke bug sing bisa didandani, menehi ganjaran ekstensibilitas lan ngukum arah riset sing berlebihan. Akurasi perbandingan offline diukur 57,7 nganti 59,0 persen.
- Agentic RPM - hakim padha plus kothak wedhi sing kloning lingkungan agen, kalebu siji H200 GPU, karo pribadi winates kanggo Python, Bash lan tumindak ngirim-solusi. Nganakake eksperimen pilot skala cilik, banjur model umpan balik ngusulake eksperimen sabanjure sing paling informatif utawa mungkasi loop. Pilot dibatesi ing 30 kanthi ambang 60 detik, lan anggaran wektu sing isih ana kanthi sengaja dikalahake - 2,700 detik sing dilapurake nglawan nyata 300 - supaya agen ora mandheg ngoptimalake awal.
Hakim disetel kaya penyidik utama
Framing principal-investigator minangka bagean sing menarik. Tinimbang menehi hadiah kanggo calon sing katon apik banget, rubrik sing dioptimalake nggambarake kepiye peneliti sing berpengalaman nyoba ide: kode buggy sing bisa didandani ngalahake kode polesan sing ngupayakake dalan buntu, lan pituduh sing duplikat wit sing ana regane luwih murah tinimbang sing anyar. Rubrik kasebut, sing disinaoni liwat optimasi kanthi cepet tinimbang nyetel tangan, yaiku sing ndadekake perbaikan, saran tim kasebut.
Hasil pathokan ing AIRS-Bench
Evaluasi kasebut kalebu 20 teks umum lan tugas tabel, kanthi saben tugas diwenehi 24 jam ing siji H200 lan 10 wiji acak. Sing penting, backbone Qwen3.6-27B sing padha nguwasani operator eksperimen lan model pilihan, saengga entuk bathi saka lapisan pilihan tinimbang model hakim sing luwih kuat. Rata-rata skor normal:
- Ora RPM (pilih acak): 0,684
- Inferensi mung RPM: 0,711
- RPM Agen: 0,729
- Oracle Validasi (langit-langit): 0,748
- Oracle Test (langit-langit): 0,759
Kemungkinan asil dandan liwat pilihan acak yaiku 0.5923 kanggo varian mung inferensi lan 0.5913 kanggo sing agenik, kanthi interval kapercayan 95 persen wates ngisor 0.5066 lan 0.5018 - ing ndhuwur ambang 0.5 kanggo signifikansi statistik, sanajan tim kasebut jujur yen margine transformatif.
Efisiensi minangka asil sing luwih praktis. RPM mung inferensi tekan skor akhir garis dasar acak 0.684 ing 14.88 jam, percepatan 1.61x, dene varian agen mbutuhake 15.50 jam, percepatan 1.55x. Malah nyathet nduwur sirah saka kesimpulan hakim sing dadi tuan rumah, jumlah sing wis diatur tetep apik.
Bobot mbukak lan caveats jujur
Tim kasebut ngarepake manawa RPM mung bisa disebarake saiki. Komponen kasebut mbukak - balung mburi sing wis dilatih beku tanpa penyetelan, scaffold lan pathokan sumber terbuka, lan model balung mburi bobot mbukak - nanging syarat kothak wedhi varian agen lan overhead eksperimen pilot tegese umume laboratorium bakal diwiwiti kanthi versi mung inferensi. Peneliti uga nyathet yen langkah Debug bali menyang pilihan acak ing varian agen amarga wektu pilot bersaing karo jam agen kasebut.
Makna sing luwih gedhe bisa dadi arah. Minangka agen riset otonomi pindhah saka demo kanggo nggunakake saben dina ing laboratorium industri, sumber langka iku ora gagasan maneh nanging jam GPU, lan cara sing remet liyane kemajuan metu saka senyawa budget komputasi tetep liwat wektu. Ranking sadurunge mlaku iku idea prasaja, lan nomer AIRS-Bench suggest iku idea sing bisa uga cukup kanggo prakara.
Tetep Ahead of AI
Terusake riset sing bakal nggawe model sesuk ing AI Buzz Wire.
Waca liyane warta AI →