Sakana AI a publié « Beyond Imitation », un article de recherche dans la revue Transactions on Machine Learning Research (TMLR) décrivant un système d'évaluation par les pairs assisté par LLM, construit autour de la détection des erreurs plutôt que de l'imitation des évaluations humaines, a rapporté MarkTechPost le 10 octobre.
L'équipe a livré deux artefacts : un test de contradiction pour mesurer la détection des erreurs et un système d'examen multicouche (MLR) qui a dirigé chaque test de base. Les résultats arrivent dans un contexte d’intérêt croissant pour l’utilisation de l’IA pour renforcer l’évaluation par les pairs – un processus mis à rude épreuve par l’augmentation des volumes de soumissions. Pour en savoir plus sur la façon dont l'IA remodèle la recherche elle-même, suivez nos derniers développements en matière d'IA.
Une référence des erreurs plantées
Le Contradiction Benchmark intègre des erreurs dans de vrais articles et vérifie si les évaluateurs les détectent. Les chercheurs ont collecté 257 articles sous licence CC d'ACL, AISTATS, CVPR et ICML 2025, ainsi que NeurIPS 2024, puis ont utilisé Gemini 2.5 Pro pour créer un graphique de connaissances des affirmations, preuves et méthodes de chaque article.
La gravité est définie structurellement : la distance entre un nœud et la « revendication principale » du document détermine le caractère central de l'erreur. La distance zéro touche une revendication fondamentale ; des distances plus grandes frappent les détails à l’appui. GPT-4.1 réécrit ensuite un nœud par distance en contradiction, produisant 1 164 points de données au total. Un juge o3 note chaque avis dix fois. Sur des papiers vierges, le juge a atteint une précision de 99,9 % et a montré une sensibilité de 86,8 % sur les captures confirmées manuellement, ce qui signifie que les scores de détection rapportés peuvent en fait être conservateurs.
Comment fonctionne l'examen à plusieurs niveaux
MLR est un système agent qui comprend un article avant de le critiquer, assemblé à partir de trois agents spécialisés fonctionnant sur des modèles Claude prêts à l'emploi — aucun cluster GPU ni aucun réglage précis requis :
- Annexe Agent (Claude Haiku 3.5) : résume les expériences et les détails de mise en œuvre de l'annexe.
- Agent de revue de littérature (Claude Sonnet 4, facultatif) : utilise la recherche sur le Web pour replacer l'article dans le contexte de travaux antérieurs.
- Agent de révision (Claude Sonnet 4) : exécute une chaîne d'invites en trois passes inspirée de la célèbre « approche en trois passes » de l'informaticien S. Keshav : d'abord un aperçu de haut niveau, puis une lecture détaillée signalant les faiblesses, les hypothèses et les lacunes, et enfin une fusion de tous les résultats de l'agent en forces, faiblesses, questions, une recommandation, un score et une liste de choses à faire.
Le PDF est transmis directement aux modèles, de sorte que les figures et les équations survivent au traitement. Le système lit jusqu'à 10 pages de texte principal et Sakana estime le coût à environ 0,47 $ par révision.
Résultats : la conception et le choix du modèle sont tous deux importants
MLR a dominé les quatre systèmes testés sur le benchmark. Avec quatre examens indépendants, il a détecté 73,43 % des contradictions des revendications principales (distance zéro) et 40,95 % au total. La meilleure base de référence, un système appelé AgentReview, n'a géré que 14,81 % des réclamations principales. Même un seul examen MLR a détecté 60,79 % des erreurs de réclamation principales.
Une étude d'ablation sépare la contribution de la conception du choix du modèle. L'échange de GPT-4.1 contre Claude Sonnet 4 dans un pipeline d'examen existant a augmenté la détection des revendications principales de 14,56 % à 35,40 %, tandis que la conception multi-agents de MLR a ajouté environ 25 points de pourcentage supplémentaires pour un seul examen. La précision de la détection diminue à mesure que les erreurs s’éloignent de l’affirmation principale, qui, selon les auteurs, conforte le score de gravité.
Le tableau s’assombrit avec des données plus compliquées et réelles. Sur WithdrarXiv-Check, un ensemble de 211 articles arXiv effectivement rétractés, MLR a obtenu un score de 26,07 % sur les correspondances « similaires » et de 16,11 % sur les correspondances exactes – et le système reste vulnérable aux injections d'invites cachées implantées dans le texte manuscrit. En d’autres termes, lire de véritables articles rétractés est bien plus difficile que déceler des contradictions synthétiques.
Ce que cela signifie pour l'évaluation par les pairs
Le point le plus pratique de l'étude est peut-être le moins glamour : la conception du système et le choix du modèle modifient considérablement la détection des erreurs, et les évaluateurs qui lisent avant de juger trouvent des erreurs bien plus graves que celles qui correspondent à un texte de révision humaine. Cette distinction est importante car la plupart des travaux antérieurs sur l’examen assisté par l’IA ont été optimisés pour être en accord avec les jugements humains – une mesure qui récompense une conformité apparemment confiante plutôt qu’un véritable examen minutieux.
Les résultats de Sakana ne suggèrent pas que l'IA soit prête à remplacer les arbitres humains : un système qui manque la plupart des erreurs sur les documents authentiques rétractés et qui peut être manipulé par des invites intégrées est mieux traité comme une couche d'assistance, et non comme une autorité. Les erreurs synthétiques de l'indice de référence sont également plus nettes que les ambiguïtés statistiques et les interprétations contestées qui dominent les désaccords réels lors de l'évaluation par les pairs, de sorte que les performances sur les contradictions plantées doivent être lues comme un plafond et non comme une promesse.
Mais à environ 0,47 $ par évaluation, avec le taux de détection d'erreurs le plus élevé de tous les systèmes testés, MLR laisse présager un terme proche où les évaluateurs IA géreront un premier passage pour détecter les contradictions tandis que les évaluateurs humains se concentreront sur les jugements que les machines ne peuvent toujours pas faire. Les revues et les organisateurs de conférences qui expérimentent la révision assistée par LLM disposent désormais à la fois d'une référence publique et d'une base de référence solide pour mesurer leurs propres systèmes - et, si l'écart entre 73,43 % et 14,81 % se maintient, un signal clair que l'architecture de lecture compte plus que la taille brute du modèle.
---
Gardez une longueur d'avance sur l'IARecevez les dernières actualités, analyses et avancées en matière d'IA, le tout en un seul endroit.
Lire plus d'actualités sur l'IA →