Sakana AI telah menerbitkan "Beyond Imitation," sebuah makalah penelitian di jurnal Transactions on Machine Learning Research (TMLR) yang menggambarkan sistem tinjauan sejawat berbantuan LLM yang dibangun berdasarkan deteksi kesalahan dan bukan peniruan tinjauan manusia, MarkTechPost melaporkan pada 10 Oktober. Pertanyaan utama yang ingin dijawab oleh laboratorium yang berbasis di Tokyo: alih-alih menilai peninjau AI berdasarkan seberapa mirip keluarannya dengan ulasan manusia, dapatkah ia menemukan kesalahan yang tertanam?

Tim mengirimkan dua artefak: Tolok Ukur Kontradiksi untuk mengukur deteksi kesalahan, dan sistem Tinjauan Berlapis (MLR) yang mengarahkan setiap data dasar diuji. Hasil ini dicapai di tengah meningkatnya minat dalam menggunakan AI untuk mendukung tinjauan sejawat – sebuah proses yang mengalami tekanan akibat melonjaknya volume pengajuan. Untuk mengetahui lebih lanjut tentang bagaimana AI mengubah penelitian itu sendiri, ikuti perkembangan AI terbaru.

Tolok Ukur Kesalahan yang Ditanam

Tolok Ukur Kontradiksi memasukkan kesalahan ke dalam makalah nyata dan memeriksa apakah pengulas menangkapnya. Para peneliti mengumpulkan 257 makalah berlisensi CC dari ACL, AISTATS, CVPR, dan ICML 2025, ditambah NeurIPS 2024, kemudian menggunakan Gemini 2.5 Pro untuk membuat grafik pengetahuan dari setiap klaim, bukti, dan metode makalah.

Tingkat keparahan didefinisikan secara struktural: jarak node dari "klaim utama" makalah menentukan seberapa sentral kesalahan tersebut. Jarak nol mencapai klaim inti; jarak yang lebih jauh mengenai detail pendukung. GPT-4.1 kemudian menulis ulang satu node per jarak menjadi kontradiksi, sehingga menghasilkan total 1.164 titik data. Seorang juri o3 menilai setiap ulasan sepuluh kali. Di kertas bersih, juri mencapai akurasi 99,9%, dan menunjukkan sensitivitas 86,8% pada tangkapan yang dikonfirmasi secara manual — yang berarti skor deteksi yang dilaporkan mungkin sebenarnya konservatif.

Cara Kerja Tinjauan Berlapis

MLR adalah sistem agen yang memahami makalah sebelum mengkritisinya, yang dirakit dari tiga agen khusus yang menjalankan model Claude siap pakai — tidak memerlukan cluster GPU dan tidak memerlukan penyesuaian:

  • Agen Lampiran (Claude Haiku 3.5): merangkum eksperimen dan detail implementasi dari lampiran.
  • Agen Tinjauan Sastra (Claude Sonnet 4, opsional): menggunakan penelusuran web untuk menempatkan makalah dalam konteks karya sebelumnya.
  • Agen Peninjau (Claude Sonnet 4): menjalankan rantai cepat tiga langkah yang terinspirasi oleh "Pendekatan Tiga Langkah" yang terkenal dari ilmuwan komputer S. Keshav — pertama garis besar tingkat tinggi, lalu pembacaan mendetail yang menandai kelemahan, asumsi, dan kesenjangan, dan terakhir penggabungan semua keluaran agen menjadi kekuatan, kelemahan, pertanyaan, rekomendasi, skor, dan daftar tugas.

PDF diteruskan ke model secara langsung, sehingga angka dan persamaan tetap bertahan dalam pemrosesan. Sistem membaca hingga 10 halaman teks utama, dan Sakana memperkirakan biayanya sekitar $0,47 per ulasan.

Hasil: Pilihan Desain dan Model Keduanya Penting

MLR memimpin keempat sistem yang diuji pada benchmark. Dengan empat tinjauan independen, laporan ini menangkap 73,43% kontradiksi klaim inti (jarak nol) dan 40,95% secara keseluruhan. Baseline terbaik, sistem yang disebut AgentReview, hanya mengelola 14,81% klaim inti. Bahkan satu tinjauan MLR menemukan 60,79% kesalahan klaim inti.

Studi ablasi memisahkan kontribusi desain dari pilihan model. Mengganti GPT-4.1 dengan Claude Sonnet 4 di dalam saluran peninjauan yang ada meningkatkan deteksi klaim inti dari 14,56% menjadi 35,40%, sementara desain multi-agen MLR menambahkan sekitar 25 poin persentase tambahan untuk satu peninjauan. Akurasi pendeteksian menurun ketika kesalahan menjauh dari klaim utama, yang menurut penulis mendukung penilaian tingkat keparahan.

Gambarannya menjadi gelap karena data dunia nyata yang lebih berantakan. Pada WithdrarXiv-Check, sekumpulan 211 makalah arXiv yang benar-benar ditarik, MLR mencetak skor 26,07% pada pencocokan "serupa" dan 16,11% pada pencocokan tepat — dan sistem tetap rentan terhadap injeksi cepat tersembunyi yang ditanamkan dalam teks manuskrip. Dengan kata lain, membaca makalah yang ditarik kembali jauh lebih sulit daripada menangkap kontradiksi sintetik.

Apa Artinya Tinjauan Sejawat

Kesimpulan paling praktis dari studi ini mungkin adalah hal yang paling tidak menarik: baik desain sistem maupun pilihan model secara signifikan menggerakkan deteksi kesalahan, dan pengulas yang membaca sebelum menilai menemukan kesalahan yang jauh lebih serius dibandingkan kesalahan yang mencocokkan pola pada teks ulasan manusia. Perbedaan tersebut penting karena sebagian besar penelitian sebelumnya mengenai peninjauan berbantuan AI dioptimalkan untuk kesesuaian dengan penilaian manusia — sebuah metrik yang menghargai kesesuaian yang terdengar percaya diri, bukan pengawasan yang tulus.

Hasil yang diperoleh Sakana tidak menunjukkan bahwa AI siap menggantikan manusia sebagai wasit – sebuah sistem yang tidak mendeteksi sebagian besar kesalahan pada kertas asli yang ditarik dan dapat dimanipulasi dengan perintah yang tertanam, sebaiknya diperlakukan sebagai lapisan bantu, bukan sebagai otoritas. Kesalahan sintetik dari tolok ukur ini juga lebih bersih daripada ambiguitas statistik dan interpretasi yang diperdebatkan yang mendominasi ketidaksepakatan nyata dalam tinjauan sejawat, sehingga kinerja berdasarkan kontradiksi yang ditanamkan harus dibaca sebagai batas tertinggi, bukan janji.

Namun dengan biaya sekitar $0,47 per peninjauan, dengan tingkat deteksi kesalahan tertinggi dibandingkan sistem apa pun yang diuji, MLR mengarah pada jangka pendek di mana peninjau AI akan menangani screening first-pass untuk mencari kontradiksi, sementara peninjau manusia fokus pada keputusan penilaian yang masih belum dapat dibuat oleh mesin. Jurnal dan penyelenggara konferensi yang bereksperimen dengan tinjauan yang dibantu LLM kini memiliki tolok ukur publik dan dasar yang kuat untuk mengukur sistem mereka sendiri — dan, jika kesenjangan antara 73,43% dan 14,81% bertahan, ini merupakan sinyal yang jelas bahwa membaca arsitektur lebih penting daripada ukuran model mentah.

---

Tetap Terdepan dalam AI

Dapatkan berita, analisis, dan terobosan AI terkini — semuanya di satu tempat.

Baca berita AI selengkapnya →