Sakana AI a publicat „Beyond Imitation”, o lucrare de cercetare în jurnalul Transactions on Machine Learning Research (TMLR) care descrie un sistem de evaluare inter pares, asistat de LLM, construit în jurul detectării erorilor, mai degrabă decât a imitației recenziilor umane, a raportat MarkTechPost pe 10 octombrie. greseala?
Echipa a livrat două artefacte: un Benchmark de contradicție pentru măsurarea detectării erorilor și un sistem de revizuire multistrat (MLR) care a condus fiecare linie de referință testată. Rezultatele ajung pe fondul interesului crescând pentru utilizarea AI pentru a susține evaluarea inter pares – un proces supus tensiunii din cauza creșterii volumului de trimiteri. Pentru mai multe despre modul în care AI modifică cercetarea în sine, urmăriți cele mai recente evoluții AI.
Un etalon de greșeli plantate
Indicatorul de referință pentru contradicții plasează erorile în lucrări reale și verifică dacă recenzenții le prind. Cercetătorii au colectat 257 de lucrări cu licență CC de la ACL, AISTATS, CVPR și ICML 2025, plus NeurIPS 2024, apoi au folosit Gemini 2.5 Pro pentru a construi un grafic de cunoștințe al revendicărilor, dovezilor și metodelor fiecărei lucrări.
Severitatea este definită structural: distanța unui nod față de „pretenția principală” a hârtiei determină cât de centrală este eroarea. Distanța zero atinge o revendicare de bază; distanțe mai mari lovesc detaliile de susținere. GPT-4.1 rescrie apoi un nod pe distanță într-o contradicție, producând 1.164 de puncte de date în total. Un judecător o3 acordă punctaj de zece ori pentru fiecare revizuire. Pe hârtiile curate, judecătorul a atins o acuratețe de 99,9% și a arătat o sensibilitate de 86,8% la capturile confirmate manual - ceea ce înseamnă că scorurile de detecție raportate pot fi de fapt conservatoare.
Cum funcționează recenzia pe mai multe straturi
MLR este un sistem agentic care înțelege o lucrare înainte de a o critica, asamblat din trei agenți specializați care rulează pe modele Claude de la raft - fără cluster GPU și nu este necesară reglarea fină:
- Apendice Agent (Claude Haiku 3.5): rezumă experimentele și detaliile de implementare din anexă.
- Literature Review Agent (Claude Sonnet 4, opțional): folosește căutarea pe web pentru a plasa lucrarea în contextul lucrării anterioare.
- Review Agent (Claude Sonnet 4): rulează un lanț de prompt în trei treceri inspirat de binecunoscuta „Abordare în trei treceri” a informaticianului S. Keshav - mai întâi o schiță de nivel înalt, apoi o lectură detaliată care semnalează punctele slabe, ipotezele și lacune și, în cele din urmă, recomandăm o îmbinare a tuturor întrebărilor, punctelor, rezultatelor, punctelor, punctelor, punctelor forte și punctelor forte. lista de sarcini.
PDF-ul este transmis direct modelelor, astfel încât cifrele și ecuațiile supraviețuiesc procesării. Sistemul citește până la 10 pagini de text principal, iar Sakana estimează costul la aproximativ 0,47 USD per recenzie.
Rezultate: Designul și alegerea modelului contează ambele
MLR a condus toate cele patru sisteme testate pe benchmark. Cu patru recenzii independente, a prins 73,43% dintre contradicțiile cu revendicarea de bază (distanță-zero) și 40,95% în total. Cea mai bună valoare de bază, un sistem numit AgentReview, a gestionat doar 14,81% din cererile de bază. Chiar și o singură revizuire MLR a surprins 60,79% dintre erorile de revendicare de bază.
Un studiu de ablație separă contribuția designului de alegerea modelului. Schimbarea GPT-4.1 cu Claude Sonnet 4 într-o conductă de revizuire existentă a crescut detectarea reclamațiilor de bază de la 14,56% la 35,40%, în timp ce designul multi-agent al MLR a adăugat aproximativ 25 de puncte procentuale suplimentare pentru o singură revizuire. Precizia detectării scade pe măsură ce erorile se îndepărtează de afirmația principală, despre care autorii spun că susține scorul de severitate.
Imaginea se întunecă pe date mai dezordonate, din lumea reală. Pe WithdrarXiv-Check, un set de 211 lucrări arXiv retractate, MLR a obținut 26,07% la potriviri „similare” și 16,11% la potriviri exacte - iar sistemul rămâne vulnerabil la injecția promptă ascunsă plantată în textul manuscrisului. Citirea unor lucrări reale retractate, cu alte cuvinte, este mult mai grea decât a prinde contradicții sintetice.
Ce înseamnă pentru evaluarea inter pares
Cea mai practică concluzie a studiului poate fi cea mai puțin plină de farmec: atât designul sistemului, cât și alegerea modelului mută în mod material detectarea erorilor, iar recenzenții care citesc înainte de a judeca găsesc erori mult mai grave decât cele care se potrivesc cu modelul în textul de recenzie umană. Această distincție contează, deoarece majoritatea lucrărilor anterioare privind evaluarea asistată de IA au fost optimizate pentru acordul cu judecățile umane - o măsură care răsplătește conformitatea care sună încrezător, mai degrabă decât controlul autentic.
Rezultatele lui Sakana nu sugerează că AI este gata să înlocuiască arbitrii umani – un sistem care ratează cele mai multe erori de pe hârtiile retractate autentice și poate fi manipulat prin indicații încorporate este cel mai bine tratat ca un strat de asistență, nu o autoritate. Erorile sintetice ale benchmark-ului sunt, de asemenea, mai curate decât ambiguitățile statistice și interpretările contestate care domină dezacordurile reale în evaluarea inter pares, așa că performanța la contradicțiile plantate ar trebui citită ca un plafon, nu o promisiune.
Dar la aproximativ 0,47 USD per revizuire, cu cea mai mare rată de detectare a erorilor dintre orice sistem testat, MLR indică un termen apropiat în care recenzenții AI gestionează un ecran de primă trecere pentru contradicții, în timp ce recenzenții umani se concentrează pe apelurile de judecată pe care aparatele încă nu le pot face. Jurnalele și organizatorii de conferințe care experimentează revizuirea asistată de LLM au acum atât un punct de referință public, cât și o bază puternică pentru a-și măsura propriile sisteme – și, dacă diferența dintre 73,43% și 14,81% va rezista, un semnal clar că arhitectura de citire contează mai mult decât dimensiunea brută a modelului.
---
Rămâneți înaintea AIObțineți cele mai recente știri, analize și descoperiri despre AI - toate într-un singur loc.
Citiți mai multe știri AI →