Η εταιρεία συγκριτικής αξιολόγησης Artificial Analysis κυκλοφόρησε την έκδοση 4.2 του Intelligence Index της στις 4 Σεπτεμβρίου 2026, μια ενδιάμεση ενημέρωση που επεξεργάζεται εκ νέου τον τρόπο μέτρησης των μοντέλων τεχνητής νοημοσύνης συνόρων — και, σύμφωνα με το νέο leaderboard, το Anthropic's Claude Fable 5.1 κατέχει την πρώτη θέση, με το GPT-6 του OpenAI να κερδίζει τη δεύτερη θέση τεσσάρων βαθμών στο Sol-5 Astra-5.
Η ενημέρωση έρχεται μόλις οκτώ μήνες μετά την κυκλοφορία του Index v4 τον Ιανουάριο, μια ασυνήθιστα γρήγορη ανάκαμψη που η εταιρεία αποδίδει στον ρυθμό των πρόσφατων εκδόσεων συνόρων. «Με τα σύνορα να κινούνται τόσο γρήγορα τις τελευταίες εβδομάδες, πιστεύουμε ότι είναι σημαντικό να παρέχουμε μια άμεση ενδιάμεση ενημέρωση για να διασφαλίσουμε ότι ο δείκτης μας παραμένει τόσο σχετικός και χρήσιμος όσο ποτέ», έγραψε η εταιρεία στην ανακοίνωσή της.
Η κατάταξη των επικεφαλίδων
Σύμφωνα με τα δημοσιευμένα αποτελέσματα, το Anthropic's Claude Fable 5.1 οδηγεί τον δείκτη, ακολουθούμενο από το GPT-6 Astra του OpenAI, το οποίο βελτίωσε τέσσερις βαθμούς έναντι του GPT-5.6 Sol. Το Meta κατατάσσεται ως το τρίτο ισχυρότερο εργαστήριο στον πίνακα κατάταξης, ακολουθούμενο από τα SpaceXAI, Moonshot/Kimi, Z.AI και Google.
Η Anthropic και η OpenAI μοιράζονται επίσης την ενημερωμένη εικόνα κόστους-αποτελεσματικότητας: οι δύο εταιρείες, μαζί με τη Meta και τη Z.AI, καταλαμβάνουν τα όρια Pareto "Κόστος ανά εργασία" του Δείκτη, πράγμα που σημαίνει ότι κανένα άλλο εργαστήριο δεν προσφέρει επί του παρόντος αυστηρά καλύτερη νοημοσύνη για την ίδια τιμή ανά ολοκληρωμένη εργασία.
Όσον αφορά την αποτελεσματικότητα του token, η Artificial Analysis βρήκε το GPT-6 Astra «πιο αποτελεσματικό ως προς το διακριτικό σχεδόν από κάθε άλλο μοντέλο κοντά στα σύνορα της νοημοσύνης», με τους Claude Fable 5.1, Grok 4.5 και Gemini 3.5 Flash-Lite να βρίσκονται σε κάθε άκρο της καμπύλης. Η εταιρεία σημείωσε σε μια συνοδευτική ανάλυση, ωστόσο, ότι η χαμηλότερη χρήση διακριτικών του Astra αντισταθμίζεται από τις υψηλότερες τιμές του - μια υπενθύμιση ότι η ακατέργαστη απόδοση και το συνολικό κόστος δεν κινούνται πάντα μαζί.
Τι άλλαξε στην έκδοση 4.2
Η πιο σημαντική δομική αλλαγή είναι μια σκόπιμη ώθηση ενάντια στα παιχνίδια αναφοράς. Το 40 τοις εκατό της στάθμισης του Δείκτη προέρχεται τώρα από ιδιωτικά σετ δοκιμών - διπλάσια από το μερίδιο στην έκδοση 4.1 - συμπεριλαμβανομένων των AA-Briefcase, AA-Omniscience και λύσεων για το CritPt. Η εταιρεία είπε ότι αυτό το ποσοστό θα αυξηθεί περαιτέρω στο Index v5.
Δύο νέες αξιολογήσεις στηρίζουν την ενημέρωση:
- AA-Briefcase, ένα εσωτερικό σημείο αναφοράς εργασιών γνώσεων για αντιπροσώπους με ιδιωτικό σετ δοκιμών. Τα μοντέλα αξιολογούνται σε επαγγελματικά έργα πολλών εβδομάδων, το καθένα με πολλές συνδεδεμένες εργασίες και χιλιάδες αρχεία πηγής εισόδου, και βαθμολογούνται μέσω ενός συνδυασμού βαθμολόγησης ρουμπρίκων και σύγκρισης κατά ζεύγη που καλύπτει επαληθεύσιμη επιτυχία εργασιών, αναλυτική ποιότητα και ποιότητα παρουσίασης.
- GDP.pdf, που δημιουργήθηκε από το Surge AI, το οποίο δοκιμάζει τη συλλογιστική μιας στροφής σε επαγγελματικά έγγραφα: 100 PDF που εκτείνονται σε δέκα τομείς, με στοιχεία που κατανέμονται σε 4.592 σελίδες κειμένου, πίνακες, γραφήματα και υποσημειώσεις. Οι απαντήσεις βαθμολογούνται με βάση 1.275 ατομικά κριτήρια που έχουν συνταχθεί από ειδικούς και η επικεφαλίδα All-pass Rate πιστώνει μια εργασία μόνο όταν ικανοποιείται κάθε κριτήριο.
Ένα μακροχρόνιο σημείο αναφοράς βρίσκεται στο δρόμο προς τα έξω: το GPQA Diamond, το επιστημονικό τεστ συλλογιστικής σε επίπεδο μεταπτυχιακών σπουδών, έχει αφαιρεθεί επειδή έχει κορεστεί αποτελεσματικά από μοντέλα συνόρων.
Η εταιρεία αναβάθμισε επίσης την υποδομή βαθμολόγησής της, κυκλοφόρησε το AA-LCR v1.1 με ένα νέο σύστημα βαθμολόγησης πλήκτρα προτροπής και διορθωμένης απάντησης, επανατοποθετώντας την κλίμακα Elo για το GDPval-AA v2 και το AA-Briefcase, ώστε οι αξιολογήσεις να παραμένουν σταθερές καθώς φτάνουν νέα μοντέλα και να σκληρύνουν τις βαθμολογίες του SciCode που δεν επιβραδύνουν την βαθμολόγηση ως κουτιά άμμου.
Τι αποκαλύπτουν οι νέες δοκιμές
Τα αποτελέσματα των νέων αξιολογήσεων προσφέρουν μια πιο αναλυτική εικόνα για το πού βρίσκονται πραγματικά τα συνοριακά εργαστήρια.
Στο AA-Briefcase, το Anthropic's Claude Fable 5.1 και το Opus 5 προηγούνται, ακολουθούμενο από το GPT-6 Astra του OpenAI και το Muse Spark 1.3 του Meta. Το GPT-6 Astra σημειώνει περίπου 85 βαθμούς Elo πάνω από το GPT-5.6 Sol στην ίδια αξιολόγηση — ένα σημαντικό άλμα μεταξύ διαδοχικών γενεών OpenAI.
Στο GDP.pdf, η εικόνα ανατρέπεται: το OpenAI προηγείται με το GPT-6 Astra στο 33,2% All-pass Rate, ακολουθούμενο από το GPT-5,6 Sol με 28,2% και τον Claude Fable 5,1 με 26,2%. Η απόκλιση υποδηλώνει ότι η σύνθεση μεγάλου μήκους εγγράφων σε πολύ μεγάλα περιβάλλοντα παραμένει μια σχετική δύναμη για το νεότερο μοντέλο του OpenAI, ακόμη και όταν τα μοντέλα της Anthropic ηγούνται του συνολικού Index και των εργασιακών εργασιών του agent.
Γιατί έχουν σημασία τα ιδιωτικά σετ δοκιμών
Η στροφή προς την παρατεταμένη αξιολόγηση αντανακλά ένα ευρύτερο πρόβλημα αξιοπιστίας στη συγκριτική αξιολόγηση της τεχνητής νοημοσύνης. Καθώς τα μοντέλα έχουν απορροφήσει περισσότερα δημόσια δεδομένα δοκιμών, τα εργαστήρια και οι ανεξάρτητοι παρατηρητές ανησυχούν ολοένα και περισσότερο ότι οι βαθμολογίες των επικεφαλίδων σε γνωστά σημεία αναφοράς αντικατοπτρίζουν την απομνημόνευση ή τη στοχευμένη εκπαίδευση παρά την πραγματική ικανότητα. Διατηρώντας ένα αυξανόμενο μερίδιο από τα σύνολα δοκιμών ιδιωτικά και σταθμίζοντάς τα περισσότερο, η Artificial Analysis προσπαθεί να διατηρήσει το σήμα ότι οι δημόσιοι πίνακες κατάταξης έχουν χάσει.
Η εταιρεία είπε ότι έχει δημιουργήσει στοιχεία του Index v5 «εδώ και μήνες» και σκόπιμα ανέστειλε τις ενημερώσεις για να διατηρήσει τον Δείκτη σταθερό κατά τη διάρκεια του πρόσφατου κύματος λανσαρίσματος μεγάλων μοντέλων. Πέρα από την ενδιάμεση έκδοση του v4.2, σχεδιάζει περισσότερες σταδιακές ενημερώσεις στο εγγύς μέλλον καθώς ολοκληρώνει τη μετάβαση στο v5.
Για τους αγοραστές που επιλέγουν μεταξύ των προηγμένων μοντέλων, το πρακτικό πλεονέκτημα από το v4.2 είναι ότι η κορυφή της αγοράς παραμένει μια κούρσα δύο ίππων μεταξύ Anthropic και OpenAI, με τη Meta να κλείνει το χάσμα — και ότι οι αξιολογήσεις που έχουν σχεδιαστεί για να είναι ανθεκτικές στο gaming κάνουν τώρα περισσότερο τη δουλειά της κατάταξης. Οι χρήστες που παρακολουθούν τις αποφάσεις επιλογής μοντέλων μπορούν να ακολουθήσουν τις τελευταίες εξελίξεις της τεχνητής νοημοσύνης καθώς πλησιάζει η διάθεση του v5.
Μείνετε μπροστά από την τεχνητή νοημοσύνη
Οι ενημερώσεις σημείων αναφοράς όπως αυτή αναδιαμορφώνουν τον τρόπο με τον οποίο ο κλάδος κρίνει την πρόοδο. Διαβάστε περισσότερα νέα AI και μείνετε μπροστά από κάθε κυκλοφορία μοντέλου.
Διαβάστε περισσότερα νέα AI →