MarkTechPost'un 10 Ekim'de bildirdiğine göre, Sakana AI, Transactions on Machine Learning Research (TMLR) dergisinde, insan incelemelerini taklit etmek yerine hata tespiti üzerine kurulu bir LLM destekli akran değerlendirme sistemini anlatan bir araştırma makalesi olan "Taklit Edinin Ötesinde" yayınladı. Tokyo merkezli laboratuvarın cevaplamaya çalıştığı temel soru: Bir AI incelemecisini, çıktılarının insan incelemeleriyle ne kadar yakından eşleştiğine göre derecelendirmek yerine, yerleşik bir hata bulabilir mi?
Ekip iki eser gönderdi: hata tespitini ölçmek için bir Çelişki Karşılaştırması ve test edilen her temel çizgiyi yönlendiren Çok Katmanlı İnceleme (MLR) sistemi. Sonuçlar, akran incelemesini desteklemek için yapay zeka kullanımına olan ilginin arttığı bir dönemde geldi; bu süreç, artan gönderim hacimleri nedeniyle baskı altında. Yapay zekanın araştırmayı nasıl yeniden şekillendirdiği hakkında daha fazla bilgi için en son yapay zeka gelişmelerini takip edin.
Yerleşik Hataların Karşılaştırması
Çelişki Karşılaştırması, hataları gerçek makalelere yerleştirir ve hakemlerin bunları yakalayıp yakalamadığını kontrol eder. Araştırmacılar ACL, AISTATS, CVPR ve ICML 2025'ten 257 CC lisanslı makalenin yanı sıra NeurIPS 2024'ü topladılar ve ardından her makalenin iddiaları, kanıtları ve yöntemlerine ilişkin bir bilgi grafiği oluşturmak için Gemini 2.5 Pro'yu kullandılar.
Ciddiyet yapısal olarak tanımlanır: Bir düğümün makalenin "ana iddiasına" olan uzaklığı, hatanın ne kadar merkezi olduğunu belirler. Sıfır mesafe temel bir iddiaya isabet ediyor; daha büyük mesafeler destekleyici ayrıntılara çarpıyor. GPT-4.1 daha sonra mesafe başına bir düğümü bir çelişkiye yeniden yazarak toplamda 1.164 veri noktası üretiyor. Bir o3 hakemi her incelemeyi on kez puanlar. Temiz kağıtlarda hakem %99,9 doğruluğa ulaştı ve manuel olarak onaylanan yakalamalarda %86,8 hassasiyet gösterdi; bu, rapor edilen tespit puanlarının gerçekte ihtiyatlı olabileceği anlamına geliyor.
Çok Katmanlı İnceleme Nasıl Çalışır?
MLR, bir makaleyi eleştirmeden önce anlayan, kullanıma hazır Claude modelleri üzerinde çalışan üç özel aracıdan oluşan aracılı bir sistemdir; GPU kümesi ve ince ayar gerektirmez:
- Ek Aracısı (Claude Haiku 3.5): ekteki deneyleri ve uygulama ayrıntılarını özetler.
- Literatür Tarama Aracısı (Claude Sonnet 4, isteğe bağlı): makaleyi önceki çalışma bağlamına yerleştirmek için web aramasını kullanır.
- İnceleme Temsilcisi (Claude Sonnet 4): Bilgisayar bilimcisi S. Keshav'ın ünlü "Üç Geçişli Yaklaşımı"ndan ilham alan üç geçişli bir bilgi zinciri çalıştırır - önce üst düzey bir taslak, ardından zayıf yönleri, varsayımları ve boşlukları işaretleyen ayrıntılı bir okuma ve son olarak tüm aracı çıktılarının güçlü yönler, zayıf yönler, sorular, öneri, puan ve yapılacaklar listesi halinde birleştirilmesi.
PDF doğrudan modellere aktarılır, böylece şekiller ve denklemler işlenmeye devam eder. Sistem, 10 sayfaya kadar ana metni okuyor ve Sakana, inceleme başına maliyetin yaklaşık 0,47 ABD doları olduğunu tahmin ediyor.
Sonuçlar: Tasarım ve Model Seçimi Her İkisi de Önemlidir
MLR, kıyaslamada test edilen dört sistemin tamamını yönetti. Dört bağımsız incelemeyle temel iddia (sıfır mesafe) çelişkilerinin %73,43'ünü ve genel olarak %40,95'ini yakaladı. En iyi temel olan AgentReview adlı sistem, temel hak taleplerinin yalnızca %14,81'ini yönetti. Tek bir MLR incelemesi bile temel hak talebi hatalarının %60,79'unu yakaladı.
Ablasyon çalışması tasarımın katkısını model seçiminden ayırır. Mevcut bir inceleme kanalında GPT-4.1'in Claude Sonnet 4 ile değiştirilmesi, temel hak talebi tespitini %14,56'dan %35,40'a yükseltirken, MLR'nin çoklu aracı tasarımı tek bir inceleme için kabaca yüzde 25 puan daha ekledi. Hatalar ana iddiadan uzaklaştıkça tespit doğruluğu düşüyor ve yazarlar bunun önem derecesine göre puanlamayı desteklediğini söylüyor.
Resim daha karmaşık, gerçek dünya verileriyle kararıyor. Gerçekten geri çekilen 211 arXiv belgesinden oluşan WithdrarXiv-Check'te MLR, "benzer" eşleşmelerde %26,07 ve tam eşleşmelerde %16,11 puan aldı ve sistem, taslak metne yerleştirilen gizli istem enjeksiyonuna karşı savunmasız olmaya devam ediyor. Başka bir deyişle, geri çekilmiş gerçek makaleleri okumak, sentetik çelişkileri yakalamaktan çok daha zordur.
Akran Değerlendirmesi İçin Ne İfade Ediyor?
Çalışmanın en pratik çıkarımı en az çekici olanı olabilir: hem sistem tasarımı hem de model seçimi maddi olarak hata tespitini harekete geçirir ve yargılamadan önce okuyan incelemeciler, insan tarafından yapılan inceleme metninde kalıpla eşleşenlerden çok daha ciddi hatalar bulur. Bu ayrım önemlidir, çünkü yapay zeka destekli incelemeye ilişkin önceki çalışmaların çoğu, insan yargılarıyla uyum için optimize edilmiştir; bu, gerçek inceleme yerine kendinden emin görünen uygunluğu ödüllendiren bir ölçümdür.
Sakana'nın sonuçları, yapay zekanın insan hakemlerin yerini almaya hazır olduğunu göstermiyor; gerçek geri çekilmiş kağıtlardaki hataların çoğunu gözden kaçıran ve gömülü yönlendirmelerle yönlendirilebilen bir sistem, bir otorite olarak değil, yardımcı bir katman olarak ele alınmalıdır. Karşılaştırmalı değerlendirmenin sentetik hataları, hakem değerlendirmesinde gerçek anlaşmazlıklara hakim olan istatistiksel belirsizliklerden ve tartışmalı yorumlardan da daha temizdir; dolayısıyla yerleşik çelişkilere ilişkin performans bir vaat olarak değil, bir tavan olarak okunmalıdır.
Ancak inceleme başına kabaca 0,47 ABD Doları tutarındaki ve test edilen tüm sistemler arasında en yüksek hata tespit oranına sahip olan MLR, yapay zeka incelemecilerinin çelişkiler için ilk geçiş taramasıyla uğraştığı, insan incelemecilerin ise makinelerin hâlâ yapamadığı kararlara odaklandığı yakın bir döneme işaret ediyor. Yüksek Lisans destekli incelemeyi deneyen dergiler ve konferans organizatörleri artık hem kamuya açık bir kıyaslamaya hem de kendi sistemlerini ölçebilecekleri güçlü bir temele sahipler; ve eğer %73,43 ile %14,81 arasındaki fark devam ederse, mimariyi okumanın ham model boyutundan daha önemli olduğuna dair açık bir sinyal var.
---
Yapay Zekanın Önünde OlunEn son AI haberlerini, analizlerini ve buluşlarını tek bir yerden alın.
Daha fazla AI haberini okuyun →