Sakana AI har publicerat "Beyond Imitation", en forskningsartikel i tidskriften Transactions on Machine Learning Research (TMLR) som beskriver ett LLM-assisterat peer review-system byggt kring feldetektering snarare än imitation av mänskliga recensioner, rapporterade MarkTechPost den 10 oktober. Den centrala frågan som det Tokyo-baserade labbet satte sig för att svara på: i stället för att jämföra hur nära en växtrecension kan en fabriksrecension hitta?

Teamet skickade två artefakter: ett motsägelseriktmärke för mätning av feldetektering och ett Multi-Layered Review (MLR)-system som ledde varje baslinje som testades. Resultaten kommer mitt i det växande intresset för att använda AI för att stödja peer review - en process som är ansträngd från ökande inlämningsvolymer. För mer om hur AI omformar forskningen själv, följ vår senaste AI-utveckling.

Ett riktmärke för planterade misstag

The Contradiction Benchmark planterar fel i riktiga tidningar och kontrollerar om granskarna fångar dem. Forskarna samlade in 257 CC-licensierade papper från ACL, AISTATS, CVPR och ICML 2025, plus NeurIPS 2024, och använde sedan Gemini 2.5 Pro för att bygga en kunskapsgraf över varje pappers påståenden, bevis och metoder.

Allvarlighet definieras strukturellt: en nods avstånd från tidningens "huvudkrav" avgör hur centralt felet är. Avstånd noll träffar ett kärnanspråk; större avstånd träffar stöddetaljer. GPT-4.1 skriver sedan om en nod per avstånd till en motsägelse, vilket ger 1 164 datapunkter totalt. En o3-domare poängsätter varje recension tio gånger. På rena papper nådde domaren 99,9 % noggrannhet, och den visade 86,8 % känslighet på manuellt bekräftade fångster – vilket betyder att de rapporterade upptäcktspoängen faktiskt kan vara konservativa.

Hur flerskiktsgranskning fungerar

MLR är ett agentsystem som förstår ett papper innan man kritiserar det, sammansatt av tre specialiserade agenter som körs på vanliga Claude-modeller - inget GPU-kluster och ingen finjustering krävs:

  • Bilagaagent (Claude Haiku 3.5): sammanfattar experiment och implementeringsdetaljer från bilagan.
  • Litterature Review Agent (Claude Sonnet 4, valfritt): använder webbsökning för att placera tidningen i ett tidigare arbete.
  • Recensionsagent (Claude Sonnet 4): driver en promptkedja med tre pass inspirerad av datavetaren S. Keshavs välkända "Three-Pass Approach" - först en översikt på hög nivå, sedan en detaljerad läsning som flaggar svagheter, antaganden och luckor, och slutligen en sammanslagning av alla styrkor, frågor, resultat, resultat och resultat från agenter, resultat och resultat. att göra-lista.

PDF:en skickas direkt till modellerna, så att figurer och ekvationer överlever bearbetningen. Systemet läser upp till 10 sidor huvudtext, och Sakana uppskattar kostnaden till cirka 0,47 USD per recension.

Resultat: Både design och modellval är viktiga

MLR ledde alla fyra system som testades på benchmark. Med fyra oberoende recensioner fångade den 73,43 % av motsägelserna i kärnanspråk (avstånd-noll) och 40,95 % totalt. Den bästa baslinjen, ett system som kallas AgentReview, hanterade endast 14,81 % på kärnanspråk. Till och med en enda MLR-granskning fångade 60,79 % av kärnanspråksfelen.

En ablationsstudie skiljer designens bidrag från valet av modell. Genom att byta ut GPT-4.1 mot Claude Sonnet 4 i en befintlig granskningspipeline höjdes upptäckten av kärnanspråk från 14,56 % till 35,40 %, medan MLR:s multiagentdesign lade till ungefär 25 procentenheter till för en enda recension. Detektionsnoggrannheten sjunker när fel flyttar bort från huvudpåståendet, vilket författarna säger stöder svårighetsgraden.

Bilden mörknar på stökigare, verkliga data. På WithdrarXiv-Check, en uppsättning av 211 faktiskt indragna arXiv-papper, fick MLR 26,07% på "liknande" matchningar och 16,11% på exakta matchningar - och systemet förblir sårbart för dolda promptinjektion planterade i manuskripttext. Att läsa riktiga indragna papper är med andra ord mycket svårare än att fånga syntetiska motsägelser.

Vad det betyder för referentgranskning

Studiens mest praktiska takeaway kan vara den minst glamorösa: både systemdesign och modellval flyttar materiellt feldetektering, och granskare som läser innan de dömer hittar mycket allvarligare fel än de som mönstermatchar på mänsklig recensionstext. Den distinktionen är viktig eftersom de flesta tidigare arbeten med AI-assisterad granskning optimerades för överensstämmelse med mänskliga bedömningar – ett mått som belönar självsäkert klingande överensstämmelse snarare än äkta granskning.

Sakanas resultat tyder inte på att AI är redo att ersätta mänskliga domare – ett system som missar de flesta fel på äkta indragna papper och som kan manipuleras av inbäddade uppmaningar behandlas bäst som ett hjälplager, inte en auktoritet. Riktmärkets syntetiska fel är också renare än de statistiska oklarheter och omtvistade tolkningar som dominerar verklig oenighet i sakkunniggranskning, så prestation på planterade motsägelser bör läsas som ett tak, inte ett löfte.

Men till ungefär $0,47 per recension, med den högsta feldetekteringsfrekvensen av alla testade system, pekar MLR mot en nära sikt där AI-granskare hanterar en första-pass-skärm för motsägelser medan mänskliga granskare fokuserar på bedömningssamtal som maskinerna fortfarande inte kan göra. Tidskrifter och konferensarrangörer som experimenterar med LLM-assisterad granskning har nu både ett offentligt riktmärke och en stark baslinje att mäta sina egna system mot – och, om gapet mellan 73,43 % och 14,81 % håller i sig, en tydlig signal om att läsning av arkitektur är viktigare än rå modellstorlek.

---

Stay ahead of AI

Få de senaste AI-nyheterna, analyserna och genombrotten – allt på ett ställe.

Läs mer AI-nyheter →