Το OpenAI οπισθοχωρεί αφού το Claude Opus 5 της Anthropic κυριάρχησε στο σημείο αναφοράς ARC-AGI-3, δημοσιεύοντας αποτελέσματα που δείχνουν το δικό του μοντέλο GPT-5.6 Sol να αγγίζει το 38,3 τοις εκατό — με την προϋπόθεση ότι χρησιμοποιείτε τις προτιμώμενες ρυθμίσεις του OpenAI και όχι την επίσημη ζώνη δοκιμής.
Η διαμάχη, η οποία έλαβε χώρα στις 30 Ιουλίου 2026, καταλήγει στην καρδιά ενός αυξανόμενου προβλήματος στην αξιολόγηση της τεχνητής νοημοσύνης: τα σημεία αναφοράς δεν μετρούν πλέον μόνο ένα μοντέλο, αλλά ολόκληρο το τεχνικό ικρίωμα που είναι τυλιγμένο γύρω από αυτό. Για βαθύτερη ανάλυση των [τελευταίων εξελίξεων τεχνητής νοημοσύνης] (https://aibuzzwire.news) και εκδόσεων μοντέλων, το AI Buzz Wire παρακολουθεί την ιστορία.
Οι αριθμοί και τα αλιεύματα
Το OpenAI ανέφερε ότι το GPT-5.6 Sol φτάνει το 38,3 τοις εκατό στο ARC-AGI-3, ξεπερνώντας το Claude Opus 5 της Anthropic, το οποίο σημείωσε 30,2 τοις εκατό αφού προηγουμένως είχε τετραπλασιάσει το ρεκόρ του σημείου αναφοράς. Η προειδοποίηση είναι σημαντική: αυτό το ποσοστό 38,3 τοις εκατό εξαρτάται από δύο συγκεκριμένα χαρακτηριστικά του OpenAI Responses API.
Το πρώτο είναι το Retained Reasoning, το οποίο διατηρεί την αλυσίδα σκέψης του μοντέλου μεταξύ των βημάτων αντί να την απορρίπτει μετά από κάθε ενέργεια. Το δεύτερο είναι το Compaction, το οποίο συνοψίζει το παλαιότερο πλαίσιο αντί να το περικόπτει, επιτρέποντας στο μοντέλο να συνεχίσει να εργάζεται σε μεγάλα προβλήματα χωρίς να χάσει την προηγούμενη λογική.
Εκτελέστε το επίσημο τυποποιημένο λουρί του ARC Prize — το οποίο σκόπιμα αποφεύγει τις συγκεκριμένες ρυθμίσεις του παρόχου για να εξασφαλίσει συγκρίσεις μήλων με μήλα — το GPT-5.6 Sol κατάφερε μόλις το 7,8%. Ο λόγος, υποστηρίζει το OpenAI, είναι ότι η επίσημη εγκατάσταση απορρίπτει τη λογική του μοντέλου μετά από κάθε βήμα, μειώνοντας την απόδοση σε εργασίες που απαιτούν διαρκή σκέψη πολλών βημάτων.
Ένα σημείο αναφοράς που δημιουργήθηκε για την αγνότητα
Το ARC-AGI-3 σχεδιάστηκε από τον François Chollet και την ομάδα του ARC Prize για να διερευνήσει την ικανότητα ενός μοντέλου να λύνει νέους συλλογιστικούς γρίφους που δεν έχει ξαναδεί – ένα τεστ γενικής νοημοσύνης και όχι απομνημονευμένης γνώσης. Για να διατηρούνται δίκαιες οι συγκρίσεις, η επίσημη πλεξούδα αφαιρεί σκόπιμα τα χαρακτηριστικά του παρόχου, μετρώντας την ικανότητα ακατέργαστου μοντέλου σε ουδέτερο περιβάλλον.
Το αντεπιχείρημα του OpenAI είναι ότι αυτή η ουδετερότητα μπορεί να γίνει μειονέκτημα. Η εταιρεία υποστηρίζει ότι η επίσημη εξάρτηση βασιζόταν σε ένα παλαιότερο "API ολοκλήρωσης τύπου OpenAI" που δεν είχε δυνατότητες που προσέφερε ήδη το Claude API, θέτοντας ουσιαστικά το OpenAI σε δομικό μειονέκτημα σε σχέση με το Anthropic στην αρχική σύγκριση.
Στην ουσία, το OpenAI λέει: μετρήσατε το μοντέλο μας με το ένα χέρι δεμένο πίσω από την πλάτη του.
Η απάντηση του Chollet
Ο συνιδρυτής του ARC Prize, François Chollet, απάντησε χαράσσοντας μια σαφή γραμμή μεταξύ δύο ειδών δοκιμών. Οι ιμάντες που «κατασκευάζονται κατά παραγγελία για την επίλυση του σημείου αναφοράς ή που περιέχουν γνώσεις σχετικά με τη μορφή του σημείου αναφοράς» είναι εκτός ορίων, είπε. Αλλά οι ρυθμίσεις API γενικής χρήσης "που δεν αναπτύχθηκαν για το ARC-AGI-3 και που είναι διαθέσιμες σε όλους τους χρήστες API" είναι δίκαιο παιχνίδι.
Στην πραγματικότητα, ο Chollet παραδέχτηκε ότι η βαθμολογία GPT-5.6 Sol του βραβείου ARC έθεσε το OpenAI σε μειονεκτική θέση. Σημείωσε ότι ο οργανισμός είχε «πολλές συζητήσεις με το OpenAI σχετικά με τον καλύτερο τρόπο δοκιμής των μοντέλων του, ειδικά όσον αφορά τη συμπύκνωση» και καλωσόρισε την εταιρεία «που αρχίζει να βρίσκει την απάντηση».
Ο Chollet επισήμανε μια εναπομείνασα ανησυχία. Διαφορετικοί πάροχοι που χρησιμοποιούν διαφορετικές ρυθμίσεις δημιουργούν αυτό που ονόμασε «ένα πιθανό ζήτημα ισοτιμίας» — αλλά το θεωρεί αποδεκτό «εφόσον οι ρυθμίσεις και το κόστος αναφέρονται με σαφήνεια».
Γιατί αυτό έχει σημασία πέρα από το Leaderboard
Το επεισόδιο υπογραμμίζει μια ένταση που αναδιαμορφώνει τον τρόπο με τον οποίο ο κλάδος της τεχνητής νοημοσύνης αξιολογεί την πρόοδο. Καθώς τα μοντέλα αναπτύσσονται όλο και περισσότερο μέσω API πλούσια σε χαρακτηριστικά παρά ως αυτόνομα συστήματα, η γραμμή μεταξύ της εγγενούς ικανότητας ενός μοντέλου και της μηχανικής γύρω από αυτό συνεχίζει να είναι θολή. Ένα σημείο αναφοράς που αγνοεί τη σκαλωσιά μπορεί να υποτιμά την απόδοση του πραγματικού κόσμου. κάποιος που το αγκαλιάζει μπορεί να ανταμείψει τις εταιρείες για το gaming στο τεστ.
Η συζήτηση ARC-AGI-3 είναι απίθανο να είναι η τελευταία. Καθώς τα συνοριακά μοντέλα συγκεντρώνονται κοντά στην κορυφή των καθιερωμένων σημείων αναφοράς, οι διαφωνίες σχετικά με το τι θεωρείται δίκαιη μέτρηση - και ποια η δέσμη πρέπει να θέτει το πρότυπο - θα ενταθούν.
Μείνετε μπροστά από την τεχνητή νοημοσύνη
Θέλετε να παρακολουθήσετε τις έκτακτες ειδήσεις AI σχετικά με τα μοντέλα, τα σημεία αναφοράς και τα εργαστήρια που τα κατασκευάζουν; Το AI Buzz Wire σας καλύπτει.
Διαβάστε περισσότερα νέα AI