Sakana AI heeft 'Beyond Imitation' gepubliceerd, een onderzoekspaper in het tijdschrift Transactions on Machine Learning Research (TMLR) waarin een LLM-ondersteund peer review-systeem wordt beschreven dat is opgebouwd rond foutdetectie in plaats van imitatie van menselijke beoordelingen, meldde MarkTechPost op 10 oktober. De centrale vraag die het in Tokio gevestigde laboratorium wilde beantwoorden: in plaats van een AI-recensent te beoordelen op hoe goed zijn output overeenkomt met menselijke beoordelingen, kan het een geplante fout vinden?
Het team heeft twee artefacten verzonden: een Contradiction Benchmark voor het meten van foutdetectie, en een Multi-Layered Review (MLR)-systeem dat ervoor zorgde dat elke basislijn werd getest. De resultaten komen voort uit een groeiende belangstelling voor het gebruik van AI om peer review te ondersteunen – een proces dat onder druk staat door de stijgende inzendingsvolumes. Voor meer informatie over hoe AI het onderzoek zelf hervormt, volgt u onze nieuwste AI-ontwikkelingen.
Een maatstaf voor gemaakte fouten
De Contradiction Benchmark plant fouten in echte papieren en controleert of reviewers deze ontdekken. De onderzoekers verzamelden 257 CC-gelicentieerde artikelen van ACL, AISTATS, CVPR en ICML 2025, plus NeurIPS 2024, en gebruikten vervolgens Gemini 2.5 Pro om een kennisgrafiek samen te stellen van de beweringen, het bewijsmateriaal en de methoden van elk artikel.
De ernst wordt structureel gedefinieerd: de afstand van een knooppunt tot de ‘hoofdclaim’ van het artikel bepaalt hoe centraal de fout is. Afstand nul raakt een kernclaim; grotere afstanden raken ondersteunende details. GPT-4.1 herschrijft vervolgens één knooppunt per afstand in een tegenstrijdigheid, wat in totaal 1.164 datapunten oplevert. Een o3-jurylid scoort elke recensie tien keer. Op schone papieren bereikte de rechter een nauwkeurigheid van 99,9% en een gevoeligheid van 86,8% bij handmatig bevestigde vangsten – wat betekent dat de gerapporteerde detectiescores in feite conservatief kunnen zijn.
Hoe meerlaagse beoordeling werkt
MLR is een agentisch systeem dat een artikel begrijpt voordat het er kritiek op levert, samengesteld uit drie gespecialiseerde agenten die draaien op kant-en-klare Claude-modellen - geen GPU-cluster en geen fijnafstelling vereist:
- Appendix Agent (Claude Haiku 3.5): vat experimenten en implementatiedetails uit de bijlage samen.
- Literature Review Agent (Claude Sonnet 4, optioneel): gebruikt internetzoekopdrachten om het artikel in de context van eerder werk te plaatsen.
- Review Agent (Claude Sonnet 4): voert een promptketen van drie stappen uit, geïnspireerd door de bekende "Three-Pass Approach" van computerwetenschapper S. Keshav - eerst een overzicht op hoog niveau, vervolgens een gedetailleerd leesverslag waarin zwakke punten, aannames en hiaten worden gemarkeerd, en ten slotte een samenvoeging van alle agentoutputs in sterke punten, zwakke punten, vragen, een aanbeveling, een score en een takenlijst.
De PDF wordt rechtstreeks aan de modellen doorgegeven, zodat cijfers en vergelijkingen de verwerking overleven. Het systeem leest maximaal tien pagina's hoofdtekst en Sakana schat de kosten op ongeveer $ 0,47 per recensie.
Resultaten: ontwerp en modelkeuze zijn allebei belangrijk
MLR leidde alle vier de geteste systemen op de benchmark. Met vier onafhankelijke beoordelingen kon het 73,43% van de tegenstrijdigheden in de kernclaims (afstand nul) opsporen en 40,95% in het algemeen. De beste basislijn, een systeem genaamd AgentReview, beheerde slechts 14,81% van de kernclaims. Zelfs bij één enkele MLR-beoordeling werd 60,79% van de fouten in de kernclaims ontdekt.
Een ablatiestudie scheidt de bijdrage van het ontwerp van de keuze van het model. Door GPT-4.1 te vervangen door Claude Sonnet 4 binnen een bestaande beoordelingspijplijn steeg de detectie van kernclaims van 14,56% naar 35,40%, terwijl het multi-agentontwerp van MLR ongeveer 25 procentpunten extra toevoegde voor een enkele beoordeling. De nauwkeurigheid van de detectie neemt af naarmate fouten afwijken van de hoofdclaim, die volgens de auteurs de ernstscore ondersteunt.
Het beeld wordt donkerder bij rommeligere gegevens uit de echte wereld. Op WithdrarXiv-Check, een set van 211 feitelijk ingetrokken arXiv-papieren, scoorde MLR 26,07% op ‘soortgelijke’ overeenkomsten en 16,11% op exacte overeenkomsten – en het systeem blijft kwetsbaar voor verborgen promptinjectie in manuscripttekst. Met andere woorden: het lezen van echte ingetrokken artikelen is veel moeilijker dan het ontdekken van synthetische tegenstrijdigheden.
Wat het betekent voor peer review
De meest praktische conclusie van het onderzoek is misschien wel de minst glamoureuze: zowel het systeemontwerp als de modelkeuze beïnvloeden de foutdetectie wezenlijk, en reviewers die lezen voordat ze oordelen, ontdekken veel ernstiger fouten dan fouten die overeenkomen met de patronen van menselijke recensieteksten. Dat onderscheid is van belang omdat het meeste eerdere werk op het gebied van AI-ondersteunde beoordeling is geoptimaliseerd voor overeenstemming met menselijke oordelen – een maatstaf die zelfverzekerd klinkende conformiteit beloont in plaats van oprecht onderzoek.
De resultaten van Sakana suggereren niet dat AI klaar is om menselijke scheidsrechters te vervangen; een systeem dat de meeste fouten op echte ingetrokken papieren mist en kan worden gemanipuleerd door ingebedde aanwijzingen, kan het beste worden behandeld als een ondersteunende laag en niet als een autoriteit. De synthetische fouten van de benchmark zijn ook duidelijker dan de statistische dubbelzinnigheden en omstreden interpretaties die echte meningsverschillen bij peer review domineren. Prestaties op het gebied van geplante tegenstrijdigheden moeten dus worden gelezen als een plafond en niet als een belofte.
Maar met ongeveer $ 0,47 per recensie, met het hoogste foutdetectiepercentage van alle geteste systemen, wijst MLR op een korte termijn waarin AI-recensenten een first-pass-screening uitvoeren op tegenstrijdigheden, terwijl menselijke reviewers zich concentreren op oordelen die de machines nog steeds niet kunnen maken. Tijdschriften en organisatoren van conferenties die experimenteren met LLM-ondersteunde beoordeling hebben nu zowel een publieke benchmark als een sterke basislijn om hun eigen systemen aan te meten – en, als de kloof tussen 73,43% en 14,81% standhoudt, een duidelijk signaal dat het lezen van architectuur belangrijker is dan de ruwe modelgrootte.
---
Blijf AI een stap voorOntvang het laatste AI-nieuws, analyses en doorbraken – allemaal op één plek.
Lees meer AI-nieuws →