Η Sakana AI δημοσίευσε το "Beyond Imitation", μια ερευνητική εργασία στο περιοδικό Transactions on Machine Learning Research (TMLR) που περιγράφει ένα σύστημα αξιολόγησης από ομοτίμους με τη βοήθεια LLM που βασίζεται στην ανίχνευση σφαλμάτων και όχι στη μίμηση ανθρώπινων κριτικών, ανέφερε η MarkTechPost στις 10 Οκτωβρίου. κριτικές, μπορεί να βρει ένα φυτεμένο λάθος;

Η ομάδα απέστειλε δύο τεχνουργήματα: ένα σημείο αναφοράς αντίθεσης για την ανίχνευση σφαλμάτων μέτρησης και ένα σύστημα αναθεώρησης πολλαπλών επιπέδων (MLR) που οδήγησε σε κάθε δοκιμή βάσης. Τα αποτελέσματα φτάνουν εν μέσω αυξανόμενου ενδιαφέροντος για τη χρήση τεχνητής νοημοσύνης για την ενίσχυση της αξιολόγησης από ομοτίμους - μια διαδικασία που υπόκειται σε πίεση από τους αυξανόμενους όγκους υποβολών. Για περισσότερα σχετικά με τον τρόπο με τον οποίο η τεχνητή νοημοσύνη αναδιαμορφώνει την ίδια την έρευνα, ακολουθήστε τις πιο πρόσφατες εξελίξεις AI.

Σημείο αναφοράς φυτευμένων λαθών

Το Contradiction Benchmark φυτεύει λάθη σε πραγματικές εργασίες και ελέγχει εάν οι αναθεωρητές τα πιάνουν. Οι ερευνητές συνέλεξαν 257 έγγραφα με άδεια CC από τα ACL, AISTATS, CVPR και ICML 2025, καθώς και το NeurIPS 2024 και στη συνέχεια χρησιμοποίησαν το Gemini 2.5 Pro για να δημιουργήσουν ένα γράφημα γνώσης των ισχυρισμών, των αποδεικτικών στοιχείων και των μεθόδων κάθε χαρτιού.

Η σοβαρότητα ορίζεται δομικά: η απόσταση ενός κόμβου από τον "κύριο ισχυρισμό" του χαρτιού καθορίζει πόσο κεντρικό είναι το σφάλμα. Η απόσταση μηδέν χτυπά μια βασική αξίωση. μεγαλύτερες αποστάσεις χτυπούν υποστηρικτικές λεπτομέρειες. Στη συνέχεια, το GPT-4.1 ξαναγράφει έναν κόμβο ανά απόσταση σε μια αντίφαση, παράγοντας 1.164 σημεία δεδομένων συνολικά. Ένας κριτής o3 βαθμολογεί κάθε κριτική δέκα φορές. Σε καθαρά χαρτιά, ο κριτής έφτασε στο 99,9% της ακρίβειας και έδειξε ευαισθησία 86,8% σε μη αυτόματα επιβεβαιωμένα αλιεύματα - που σημαίνει ότι οι αναφερόμενες βαθμολογίες ανίχνευσης μπορεί να είναι στην πραγματικότητα συντηρητικές.

Πώς λειτουργεί η κριτική πολλαπλών επιπέδων

Το MLR είναι ένα σύστημα αντιπροσώπων που κατανοεί ένα χαρτί πριν το κριτικάρει, συναρμολογημένο από τρεις εξειδικευμένους πράκτορες που εκτελούνται σε μοντέλα Claude εκτός ραφιού — δεν απαιτείται σύμπλεγμα GPU και δεν απαιτείται λεπτομέρεια:

  • Παράρτημα Agent (Claude Haiku 3.5): συνοψίζει πειράματα και λεπτομέρειες υλοποίησης από το παράρτημα.
  • Literature Review Agent (Claude Sonnet 4, προαιρετικό): χρησιμοποιεί την αναζήτηση στον Ιστό για να τοποθετήσει την εργασία στο πλαίσιο προηγούμενης εργασίας.
  • Review Agent (Claude Sonnet 4): εκτελεί μια αλυσίδα προτροπής τριών περασμάτων εμπνευσμένη από τη γνωστή "Προσέγγιση τριών περασμάτων" του επιστήμονα υπολογιστών S. Keshav — πρώτα ένα περίγραμμα υψηλού επιπέδου, στη συνέχεια μια λεπτομερή ανάγνωση που επισημαίνει τις αδυναμίες, τις υποθέσεις και τα κενά όλων των δυνατοτήτων, μια συνένωση αδυναμιών, και τέλος μια σύσταση, μια βαθμολογία και μια λίστα υποχρεώσεων.

Το PDF μεταβιβάζεται απευθείας στα μοντέλα, έτσι οι αριθμοί και οι εξισώσεις επιβιώνουν από την επεξεργασία. Το σύστημα διαβάζει έως και 10 σελίδες κύριου κειμένου και ο Sakana υπολογίζει το κόστος σε περίπου 0,47 $ ανά κριτική.

Αποτελέσματα: Ο σχεδιασμός και η επιλογή μοντέλου έχουν σημασία

Η MLR οδήγησε και τα τέσσερα συστήματα που δοκιμάστηκαν στο σημείο αναφοράς. Με τέσσερις ανεξάρτητες κριτικές, συγκέντρωσε το 73,43% των αντιφάσεων βασικών ισχυρισμών (απόσταση-μηδέν) και το 40,95% συνολικά. Η καλύτερη γραμμή βάσης, ένα σύστημα που ονομάζεται AgentReview, διαχειρίστηκε μόνο το 14,81% στις βασικές αξιώσεις. Ακόμη και μια μεμονωμένη αναθεώρηση MLR εντόπισε το 60,79% των βασικών σφαλμάτων των ισχυρισμών.

Μια μελέτη κατάλυσης διαχωρίζει τη συμβολή του σχεδιασμού από την επιλογή του μοντέλου. Η εναλλαγή του GPT-4.1 για το Claude Sonnet 4 μέσα σε έναν υπάρχοντα αγωγό αναθεώρησης αύξησε την ανίχνευση βασικών αξιώσεων από 14,56% σε 35,40%, ενώ η σχεδίαση πολλαπλών πρακτόρων της MLR πρόσθεσε περίπου 25 περισσότερες ποσοστιαίες μονάδες στην κορυφή για μία μόνο αναθεώρηση. Η ακρίβεια ανίχνευσης μειώνεται καθώς τα σφάλματα απομακρύνονται από τον κύριο ισχυρισμό, ο οποίος σύμφωνα με τους συγγραφείς υποστηρίζει τη βαθμολόγηση σοβαρότητας.

Η εικόνα σκοτεινιάζει με πιο ακατάστατα δεδομένα από τον πραγματικό κόσμο. Στο WithdrarXiv-Check, ένα σύνολο 211 ανακληθέντων χαρτιών arXiv, η MLR σημείωσε 26,07% σε «παρόμοιες» αντιστοιχίσεις και 16,11% σε ακριβείς αντιστοιχίσεις — και το σύστημα παραμένει ευάλωτο στην κρυφή έγχυση έγκαιρης που φυτεύεται σε κείμενο χειρογράφου. Η ανάγνωση πραγματικών ανασυρόμενων χαρτιών, με άλλα λόγια, είναι πολύ πιο δύσκολη από το να πιάσεις συνθετικές αντιφάσεις.

Τι σημαίνει για την αξιολόγηση από ομοτίμους

Το πιο πρακτικό στοιχείο της μελέτης μπορεί να είναι το λιγότερο λαμπερό: τόσο ο σχεδιασμός του συστήματος όσο και η επιλογή μοντέλου μετακινούν ουσιαστικά την ανίχνευση σφαλμάτων και οι αναθεωρητές που διαβάζουν πριν κρίνουν βρίσκουν πολύ πιο σοβαρά σφάλματα από εκείνα που ταιριάζουν με το πρότυπο σε κείμενο ανθρώπινης κριτικής. Αυτή η διάκριση έχει σημασία επειδή οι περισσότερες προηγούμενες εργασίες σχετικά με την αναθεώρηση με τη βοήθεια τεχνητής νοημοσύνης βελτιστοποιήθηκαν για συμφωνία με τις ανθρώπινες κρίσεις - μια μέτρηση που ανταμείβει τη συμμόρφωση που ακούγεται με αυτοπεποίθηση και όχι τον γνήσιο έλεγχο.

Τα αποτελέσματα του Sakana δεν υποδεικνύουν ότι η τεχνητή νοημοσύνη είναι έτοιμη να αντικαταστήσει τους ανθρώπινους διαιτητές - ένα σύστημα που χάνει τα περισσότερα λάθη σε γνήσια ανασυρόμενα χαρτιά και μπορεί να χειραγωγηθεί από ενσωματωμένες προτροπές αντιμετωπίζεται καλύτερα ως βοηθητικό επίπεδο, όχι ως αρχή. Τα συνθετικά σφάλματα του δείκτη αναφοράς είναι επίσης πιο καθαρά από τις στατιστικές ασάφειες και τις αμφισβητούμενες ερμηνείες που κυριαρχούν στην πραγματική διαφωνία στην αξιολόγηση από ομοτίμους, επομένως η απόδοση στις φυτευμένες αντιφάσεις θα πρέπει να θεωρείται ως ανώτατο όριο, όχι ως υπόσχεση.

Αλλά με περίπου 0,47 $ ανά κριτική, με το υψηλότερο ποσοστό ανίχνευσης σφαλμάτων από οποιοδήποτε άλλο σύστημα που έχει δοκιμαστεί, το MLR δείχνει προς ένα βραχυπρόθεσμο σημείο όπου οι αναθεωρητές τεχνητής νοημοσύνης χειρίζονται μια οθόνη πρώτης διέλευσης για αντιφάσεις, ενώ οι ανθρώπινοι αναθεωρητές επικεντρώνονται σε κλήσεις κρίσης που οι μηχανές δεν μπορούν ακόμα να κάνουν. Τα περιοδικά και οι διοργανωτές συνεδρίων που πειραματίζονται με την αναθεώρηση με τη βοήθεια LLM έχουν τώρα τόσο δημόσιο σημείο αναφοράς όσο και ισχυρή βάση για τη μέτρηση των δικών τους συστημάτων — και, αν το χάσμα μεταξύ 73,43% και 14,81% διατηρείται, ένα σαφές μήνυμα ότι η ανάγνωση της αρχιτεκτονικής έχει μεγαλύτερη σημασία από το μέγεθος του πρωτογενούς μοντέλου.

---

Μείνετε μπροστά από την τεχνητή νοημοσύνη

Λάβετε τα πιο πρόσφατα νέα, αναλύσεις και ανακαλύψεις για την τεχνητή νοημοσύνη — όλα σε ένα μέρος.

Διαβάστε περισσότερα νέα AI →