Sakana AI wis nerbitake "Beyond Imitation," sawijining makalah riset ing jurnal Transactions on Machine Learning Research (TMLR) sing njlèntrèhaké sistem review peer sing dibantu LLM sing dibangun ing babagan deteksi kesalahan tinimbang tiruan review manungsa, MarkTechPost kacarita ing Oktober 10. Pitakonan utama sing dijawab dening laboratorium basis Tokyo: tinimbang menehi peringkat reviewer AI babagan review manungsa, kesalahane bisa ditemokake?
Tim kasebut ngirim loro artefak: Benchmark Kontradiksi kanggo ngukur deteksi kesalahan, lan sistem Multi-Layered Review (MLR) sing mimpin saben garis dasar diuji. Asil kasebut teka ing tengah-tengah minat sing tambah akeh kanggo nggunakake AI kanggo nyengkuyung review peer - proses sing ngalami ketegangan amarga volume kiriman sing mundhak. Kanggo luwih lengkap babagan carane AI nggawe maneh riset dhewe, tututi pangembangan AI paling anyar.
Pathokan Kesalahan sing Ditanem
Benchmark Kontradiksi nandur kesalahan menyang kertas nyata lan mriksa manawa para panaliti nyekel. Peneliti nglumpukake 257 makalah sing dilisensi CC saka ACL, AISTATS, CVPR, lan ICML 2025, ditambah NeurIPS 2024, banjur nggunakake Gemini 2.5 Pro kanggo nggawe grafik pengetahuan babagan klaim, bukti, lan metode saben kertas.
Keruwetan ditetepake kanthi struktural: jarak simpul saka "klaim utama" kertas nemtokake manawa kesalahan kasebut. Jarak nul cocog pratelan inti; jarak sing luwih gedhe tekan rincian sing ndhukung. GPT-4.1 banjur nulis ulang siji simpul saben jarak dadi kontradiksi, ngasilake total 1.164 titik data. Hakim o3 menehi skor saben review kaping sepuluh. Ing kertas sing resik, hakim tekan akurasi 99,9%, lan nuduhake sensitivitas 86,8% babagan tangkapan sing dikonfirmasi kanthi manual - tegese skor deteksi sing dilaporake bisa uga konservatif.
Carane Multi-Layered Review Works
MLR minangka sistem agen sing mangertos kertas sadurunge ngritik, dirakit saka telung agen khusus sing mlaku ing model Claude sing ora ana ing rak - ora ana kluster GPU lan ora perlu nyetel apik:
- Agen Lampiran (Claude Haiku 3.5): ngringkes eksperimen lan rincian implementasine saka lampiran.
- Literature Review Agent (Claude Sonnet 4, opsional): nggunakake panelusuran web kanggo nyelehake kertas ing konteks karya sadurunge.
- Review Agent (Claude Sonnet 4): mbukak chain cepet telung pass inspirasi dening ilmuwan komputer S. Keshav kang kondhang "Pendekatan Telu-Pass" - pisanan njelaske nganggo bentuk garis tingkat dhuwur, banjur rinci diwaca flagging kelemahane, asumsi, lan kesenjangan, lan pungkasanipun nggabung kabeh pitakonan, kekirangan, outputs, ado. dhaptar.
PDF diterusake menyang model kanthi langsung, supaya angka lan persamaan bisa diproses. Sistem maca nganti 10 kaca teks utama, lan Sakana ngira regane kira-kira $0,47 saben review.
Asil: Desain lan Pilihan Model Loro-lorone Matter
MLR mimpin kabeh papat sistem sing diuji ing pathokan. Kanthi papat review independen, dheweke entuk 73,43% saka pratelan inti (jarak-nol) kontradiksi lan 40,95% sakabèhé. Baseline paling apik, sistem disebut AgentReview, ngatur mung 14,81% ing claims inti. Malah review MLR siji kejiret 60,79% saka inti-klaim kasalahan.
Sinau ablasi misahake kontribusi desain saka pilihan model. Ngganti GPT-4.1 kanggo Claude Sonnet 4 ing pipa review sing wis ana ngangkat deteksi pratelan inti saka 14,56% dadi 35,40%, dene desain multi-agen MLR nambahake kira-kira 25 poin persentase ing ndhuwur kanggo review siji. Akurasi deteksi tiba nalika kesalahan pindhah saka pratelan utama, sing ujare penulis ndhukung skor keruwetan.
Gambar dadi peteng ing data donya nyata sing messier. Ing WithdrarXiv-Check, sakumpulan 211 sing bener-bener narik kertas arXiv, MLR ngetung 26,07% ing pertandhingan "padha" lan 16,11% ing pertandhingan sing tepat - lan sistem kasebut tetep rentan kanggo injeksi cepet sing didhelikake sing ditanam ing teks naskah. Maca kertas sing ditarik nyata, kanthi tembung liya, luwih angel tinimbang nyekel kontradiksi sintetik.
Apa Tegese kanggo Peer Review
Panaliten sing paling praktis bisa uga paling nggumunake: desain sistem lan pilihan model kanthi material mindhah deteksi kesalahan, lan panemu sing maca sadurunge menehi kritik nemokake kesalahan sing luwih serius tinimbang sing cocog karo pola ing teks review manungsa. Bentenane kasebut penting amarga umume karya sadurunge ing review sing dibantu AI dioptimalake kanggo persetujuan karo pertimbangan manungsa - metrik sing menehi ganjaran konformitas sing yakin tinimbang pengawasan sing asli.
Asil Sakana ora nuduhake AI wis siyap ngganti wasit manungsa - sistem sing paling akeh kesalahane ing kertas sing ditarik asli lan bisa dimanipulasi kanthi pituduh sing diselehake, paling apik dianggep minangka lapisan bantu, dudu wewenang. Kesalahan sintetik pathokan uga luwih resik tinimbang ambiguitas statistik lan interpretasi sing ditandingi sing ndominasi ora setuju nyata ing review peer, saéngga kinerja kontradiksi sing ditanam kudu diwaca minangka langit-langit, dudu janji.
Nanging kira-kira $ 0.47 saben review, kanthi tingkat deteksi kesalahan paling dhuwur ing sistem apa wae sing diuji, MLR nunjukake wektu sing cedhak ing ngendi panaliti AI nangani layar first-pass kanggo kontradiksi nalika panliti manungsa fokus ing pangadilan nelpon mesin kasebut isih ora bisa ditindakake. Jurnal lan panitia konferensi sing nyobi karo review sing dibantu LLM saiki duwe pathokan umum lan garis dasar sing kuat kanggo ngukur sistem dhewe - lan, yen jurang antarane 73,43% lan 14,81% tetep, sinyal sing jelas yen maca arsitektur luwih penting tinimbang ukuran model mentah.
---
Tetep Ahead of AIEntuk warta, analisis, lan terobosan AI paling anyar - kabeh ing sak panggonan.
Waca liyane AI warta →