Sakana AI hat „Beyond Imitation“ veröffentlicht, einen Forschungsartikel in der Fachzeitschrift Transactions on Machine Learning Research (TMLR), der ein LLM-gestütztes Peer-Review-System beschreibt, das auf Fehlererkennung und nicht auf der Nachahmung menschlicher Bewertungen basiert, berichtete MarkTechPost am 10. Oktober. Die zentrale Frage, die das in Tokio ansässige Labor beantworten wollte: Kann ein KI-Rezensent einen künstlichen Fehler finden, anstatt ihn danach zu bewerten, wie gut seine Ausgabe mit menschlichen Bewertungen übereinstimmt?

Das Team lieferte zwei Artefakte: einen Widerspruchs-Benchmark zur Messung der Fehlererkennung und ein Multi-Layered-Review-System (MLR), das jede getestete Baseline leitete. Die Ergebnisse kommen vor dem Hintergrund des wachsenden Interesses an der Verwendung von KI zur Unterstützung von Peer-Reviews an – ein Prozess, der durch die steigenden Einreichungsmengen unter Druck steht. Um mehr darüber zu erfahren, wie KI die Forschung selbst verändert, folgen Sie unseren neuesten KI-Entwicklungen.

Ein Maßstab für gepflanzte Fehler

Der Contradiction Benchmark fügt Fehler in reale Arbeiten ein und prüft, ob Gutachter diese erkennen. Die Forscher sammelten 257 CC-lizenzierte Artikel von ACL, AISTATS, CVPR und ICML 2025 sowie NeurIPS 2024 und erstellten dann mit Gemini 2.5 Pro ein Wissensdiagramm der Behauptungen, Beweise und Methoden jedes Artikels.

Der Schweregrad wird strukturell definiert: Die Entfernung eines Knotens vom „Hauptanspruch“ der Arbeit bestimmt, wie zentral der Fehler ist. Distanz Null trifft einen Kernanspruch; größere Entfernungen treffen unterstützende Details. GPT-4.1 schreibt dann einen Knoten pro Distanz in einen Widerspruch um und erzeugt insgesamt 1.164 Datenpunkte. Ein o3-Richter bewertet jede Bewertung zehnmal. Auf sauberen Papieren erreichte der Richter eine Genauigkeit von 99,9 % und zeigte eine Sensitivität von 86,8 % bei manuell bestätigten Fängen – was bedeutet, dass die gemeldeten Erkennungswerte tatsächlich konservativ sein könnten.

So funktioniert die mehrschichtige Überprüfung

MLR ist ein Agentensystem, das einen Aufsatz versteht, bevor er ihn kritisiert. Es besteht aus drei spezialisierten Agenten, die auf handelsüblichen Claude-Modellen laufen – kein GPU-Cluster und keine Feinabstimmung erforderlich:

  • Anhang Agent (Claude Haiku 3.5): fasst Experimente und Implementierungsdetails aus dem Anhang zusammen.
  • Literature Review Agent (Claude Sonnet 4, optional): nutzt die Websuche, um den Artikel in den Kontext früherer Arbeiten einzuordnen.
  • Review Agent (Claude Sonnet 4): führt eine dreistufige Eingabeaufforderungskette aus, die vom bekannten „Three-Pass Approach“ des Informatikers S. Keshav inspiriert ist – zunächst eine grobe Gliederung, dann eine detaillierte Lektüre, in der Schwächen, Annahmen und Lücken hervorgehoben werden, und schließlich eine Zusammenführung aller Agentenausgaben in Stärken, Schwächen, Fragen, eine Empfehlung, eine Bewertung und eine To-Do-Liste.

Das PDF wird direkt an die Modelle übergeben, sodass Zahlen und Gleichungen die Verarbeitung überleben. Das System liest bis zu 10 Seiten Haupttext und Sakana schätzt die Kosten auf etwa 0,47 US-Dollar pro Rezension.

Ergebnisse: Design und Modellauswahl sind beide wichtig

MLR führte alle vier im Benchmark getesteten Systeme an. Bei vier unabhängigen Überprüfungen wurden 73,43 % der Widersprüche im Kernanspruch (Distanz Null) und 40,95 % insgesamt erfasst. Die beste Baseline, ein System namens AgentReview, schaffte nur 14,81 % der Kernansprüche. Selbst bei einer einzigen MLR-Überprüfung wurden 60,79 % der Kernanspruchsfehler festgestellt.

Bei einer Ablationsstudie wird der Beitrag des Designs von der Modellauswahl getrennt. Der Austausch von GPT-4.1 gegen Claude Sonnet 4 innerhalb einer bestehenden Bewertungspipeline steigerte die Kernanspruchserkennung von 14,56 % auf 35,40 %, während das Multi-Agent-Design von MLR etwa 25 weitere Prozentpunkte für eine einzelne Bewertung hinzufügte. Die Erkennungsgenauigkeit nimmt ab, wenn sich die Fehler vom Hauptanspruch entfernen, was nach Ansicht der Autoren die Bewertung des Schweregrads stützt.

Bei chaotischeren Daten aus der realen Welt wird das Bild dunkler. Bei WithdrarXiv-Check, einem Satz von 211 tatsächlich zurückgezogenen arXiv-Papieren, erzielte MLR 26,07 % bei „ähnlichen“ Übereinstimmungen und 16,11 % bei genauen Übereinstimmungen – und das System bleibt anfällig für versteckte Eingabeaufforderungen, die in Manuskripttexte eingebaut werden. Mit anderen Worten, das Lesen echter zurückgezogener Artikel ist viel schwieriger als das Erfassen synthetischer Widersprüche.

Was es für Peer Review bedeutet

Die praktischste Schlussfolgerung der Studie ist möglicherweise die am wenigsten glamouröse: Sowohl das Systemdesign als auch die Modellauswahl beeinflussen die Fehlererkennung erheblich, und Prüfer, die lesen, bevor sie urteilen, finden weitaus schwerwiegendere Fehler als solche, die in menschlichen Rezensionstexten übereinstimmen. Diese Unterscheidung ist wichtig, da die meisten früheren Arbeiten zur KI-gestützten Überprüfung auf die Übereinstimmung mit menschlichen Urteilen optimiert sind – eine Kennzahl, die selbstbewusst klingende Konformität statt echter Prüfung belohnt.

Die Ergebnisse von Sakana deuten nicht darauf hin, dass KI bereit ist, menschliche Gutachter zu ersetzen – ein System, das die meisten Fehler bei echten zurückgezogenen Papieren übersieht und durch eingebettete Eingabeaufforderungen manipuliert werden kann, sollte am besten als unterstützende Ebene und nicht als Autorität behandelt werden. Die synthetischen Fehler des Benchmarks sind außerdem sauberer als die statistischen Mehrdeutigkeiten und umstrittenen Interpretationen, die bei echten Meinungsverschiedenheiten bei Peer-Reviews dominieren. Daher sollte die Leistung bei eingepflanzten Widersprüchen als Obergrenze und nicht als Versprechen verstanden werden.

Aber mit etwa 0,47 US-Dollar pro Rezension und der höchsten Fehlererkennungsrate aller getesteten Systeme deutet MLR darauf hin, dass in naher Zukunft KI-Rezensenten eine Erstprüfung auf Widersprüche durchführen, während sich menschliche Rezensenten auf Urteilsentscheidungen konzentrieren, die Maschinen immer noch nicht treffen können. Zeitschriften und Konferenzorganisatoren, die mit der LLM-gestützten Begutachtung experimentieren, verfügen nun sowohl über einen öffentlichen Benchmark als auch über eine starke Basis, an der sie ihre eigenen Systeme messen können – und wenn die Lücke zwischen 73,43 % und 14,81 % bestehen bleibt, ist das ein klares Signal dafür, dass das Lesen der Architektur wichtiger ist als die reine Modellgröße.

---

Der KI einen Schritt voraus sein

Erhalten Sie die neuesten KI-Nachrichten, Analysen und Durchbrüche – alles an einem Ort.

Weitere KI-Neuigkeiten lesen →