Οι ερευνητές της Nvidia κατασκεύασαν ένα σύστημα πρακτόρων που ώθησε το Claude Opus 5 της Anthropic σε μια τέλεια βαθμολογία 100% στο ARC-AGI-3, ένα από τα πιο απαιτητικά διαδραστικά σημεία αναφοράς συλλογισμού στην τεχνητή νοημοσύνη — χρησιμοποιώντας το ίδιο μοντέλο που σκοράρει 30% όταν εκτελείται μόνο του. Το αποτέλεσμα, που δημοσιεύτηκε την Παρασκευή στο Nvidia Technical Blog, είναι η πιο ισχυρή απόδειξη μέχρι τώρα ότι το λογισμικό που είναι τυλιγμένο γύρω από ένα μοντέλο συνόρων έχει σημασία όσο και το ίδιο το μοντέλο. Για όποιον παρακολουθεί [τις πιο πρόσφατες εξελίξεις στην τεχνητή νοημοσύνη] (https://aibuzzwire.news), σηματοδοτεί μια αλλαγή στο πού ζει πραγματικά το ανταγωνιστικό πλεονέκτημα στην τεχνητή νοημοσύνη.
Το σύστημα ονομάζεται AVO, συντομογραφία για το Agentic Variation Operators, και είναι η αντίληψη της Nvidia για μια αρχιτεκτονική γενικής χρήσης για αυτόνομους πράκτορες μεγάλου ορίζοντα - AI που μπορεί να παραμείνει στην εργασία για ώρες ή μέρες αντί να απαντά σε ένα μόνο μήνυμα. Στο δημόσιο σετ ARC-AGI-3, η AVO κατέγραψε βαθμολογία 100,00 RHAE και στα 25 περιβάλλοντα παιχνιδιών, ολοκληρώνοντας και τα 183 επίπεδα σε 6.624 περιβαλλοντικές ενέργειες χρησιμοποιώντας το Claude Opus 5 ως μοντέλο υποστήριξης.
Τι δοκιμάζει πραγματικά το ARC-AGI-3
Το ARC-AGI-3 είναι ένα διαδραστικό σημείο αναφοράς συλλογισμού που δημιουργήθηκε από το ίδρυμα ARC Prize. Ένας πράκτορας απορρίπτεται σε άγνωστα περιβάλλοντα που θυμίζουν παιχνίδι, χωρίς οδηγίες, χωρίς δηλωμένους κανόνες και χωρίς δηλωμένο στόχο. Πρέπει να εξερευνήσει μέσω δοκιμής και λάθους, να συμπεράνει πώς λειτουργεί το περιβάλλον, να καταλάβει τι σημαίνει «κερδίζει» και στη συνέχεια να ενεργήσει αρκετά αποτελεσματικά για να προχωρήσει σε προοδευτικά δυσκολότερα επίπεδα.
Η μέτρηση βαθμολόγησης του σημείου αναφοράς, η σχετική αποτελεσματικότητα ανθρώπινης δράσης (RHAE), συνδυάζει την ολοκλήρωση της εργασίας με το πόσο λίγες ενέργειες σπαταλά ο πράκτορας σε σχέση με τους πρωταθλητές παίκτες. Αυτό το καθιστά ένα βάναυσο τεστ διαρκούς αυτονομίας: ο πράκτορας πρέπει να θυμάται τι έμαθε, να ανακάμψει από τα λάθη και να προϋπολογίσει προσεκτικά τις ενέργειές του σε μια ολόκληρη σειρά.
Ο αριθμός επικεφαλίδας της Nvidia κερδίζει το πλαίσιο από μια σύγκριση. Το VISTA, μια προηγούμενη πλεξούδα άμεσης αλληλεπίδρασης που χρησιμοποιούσε επίσης το Claude Opus 5, ολοκλήρωσε τα ίδια 183 δημόσια επίπεδα σε 7.542 περιβαλλοντικές ενέργειες. Η AVO χρειάστηκε περίπου 12% λιγότερες ενέργειες για να ολοκληρώσει τη δουλειά, σύμφωνα με την ανάρτηση ιστολογίου της Nvidia.
Από πυρήνες GPU σε Άγνωστα Παιχνίδια
Το AVO δεν κατασκευάστηκε για παζλ. Η Nvidia έδειξε για πρώτη φορά την αρχιτεκτονική στη βελτιστοποίηση του πυρήνα GPU, έναν τομέα όπου μικρές αλλαγές κώδικα μπορούν να σπάσουν την ορθότητα, τη συμπεριφορά της μνήμης και την απόδοση με απρόβλεπτους τρόπους. Σε μια μελέτη πυρήνα προσοχής, το AVO έτρεχε συνεχώς για επτά ημέρες, εξερεύνησε περισσότερες από 500 κατευθύνσεις βελτιστοποίησης και δέσμευσε 40 εκδόσεις πυρήνα. Στα συστήματα NVIDIA DGX B200, οι πυρήνες προσοχής πολλαπλών κεφαλών που προέκυψαν ξεπέρασαν το cuDNN έως και 3,5% και το FlashAttention-4 έως και 10,5%. Στη συνέχεια, ο πράκτορας προσάρμοσε τον εξελιγμένο πυρήνα του στην προσοχή ομαδοποιημένων ερωτημάτων σε περίπου 30 λεπτά πρόσθετης αυτόνομης εργασίας.
Ο ίδιος βρόχος πυρήνα — επιθεώρηση, σχεδίαση, υλοποίηση, δοκιμή, αξιολόγηση — κατευθύνθηκε στη συνέχεια στο ARC-AGI-3 με μόνο τη διεπαφή εργασιών να έχει αλλάξει. Δύο μηχανισμοί μεταφέρονται. Η πρώτη είναι η επίμονη μνήμη, η οποία αποθηκεύει προηγούμενες υλοποιήσεις, αποτελέσματα αξιολόγησης, εξόδους μεταγλωττιστή και προφίλ, και συσσωρευμένο συλλογισμό, έτσι ώστε ο πράκτορας να μπορεί να συνεχίσει από την τρέχουσα κατάστασή του αντί να αναδημιουργήσει το περιβάλλον από την αρχή. Ο δεύτερος είναι ένας επόπτης, ένας δεύτερος πράκτορας που παρακολουθεί τη συνολική τροχιά και επεμβαίνει όταν η πρόοδος σταματά.
Ο επόπτης είναι η σημαντική ανακάλυψη
Το TechCrunch, το οποίο πήρε συνέντευξη από τον Adel El Hallak της Nvidia, αντιπρόεδρο προϊόντος στη μονάδα AI της εταιρείας, τόνισε τον επόπτη ως το πιο σημαντικό συστατικό. «Σχεδόν λειτουργεί σαν διευθύνων σύμβουλος για να σπρώχνει τον πράκτορα όταν ξεφεύγει από την κατεύθυνση ή αρχίζει να εξερευνά ένα μονοπάτι που θα μπορούσε να οδηγήσει σε αδιέξοδο ή να εξερευνήσει ξανά ένα μονοπάτι που είχε προηγουμένως πατήσει», είπε ο El Hallak στο δημοσίευμα.
Το χάσμα απόδοσης είναι έντονο. Οι δοκιμές της Nvidia διαπίστωσαν ότι το Claude Opus 5 χωρίς εξελιγμένη πλεξούδα κατάφερε να σκοράρει 30% στο ARC-AGI-3 — το καλύτερο αποτέλεσμα μεταξύ των γυμνών μοντέλων που δοκιμάστηκαν, αλλά πουθενά πλήρους εκτέλεσης. Τα μοντέλα του OpenAI έχουν σημειώσει κάτω από 10% στο σημείο αναφοράς και η εταιρεία δημοσίευσε τη δική της έρευνα τον περασμένο μήνα, δείχνοντας ότι η προσαρμογή μόνο σε δύο ρυθμίσεις πλεξούδας τριπλασίασε τη βαθμολογία της. Καμία διαμόρφωση μόνο για μοντέλο δεν έχει πλησιάσει το 100% που πέτυχε η AVO.
Σημειωτέον, η διαμόρφωση AVO εκτελέστηκε με τρόπο μόνο κειμένου: κάθε παρατήρηση παρεχόταν ως ένα ακριβές πλέγμα κειμένου 64x64, χωρίς εικόνες ή διακριτικά εικόνας να αποστέλλονται στο μοντέλο. Η συλλογιστική δύναμη προήλθε από τον βρόχο γύρω από το μοντέλο, όχι από την πολυτροπική αντίληψη.
Γιατί η βιομηχανία ποντάρει σε ιμάντες
Το εύρημα προσγειώνεται εν μέσω ενός κύματος αποδείξεων ότι η υποδομή πρακτόρων, και όχι η ικανότητα ακατέργαστου μοντέλου, είναι το σημερινό σημείο συμφόρησης για την αυτόνομη τεχνητή νοημοσύνη. Η Databricks δημοσίευσε έρευνα συγκριτικής αξιολόγησης τον Ιούλιο, δείχνοντας ότι η ζώνη επηρεάζει δραματικά τόσο την απόδοση όσο και το κόστος. «Μπορείτε να επιλέξετε το ίδιο μοντέλο αλλά διαφορετικές ιμάντες και έχετε πολύ μεγαλύτερο κόστος εάν χρησιμοποιήσετε λάθος λουρί», δήλωσε στο TechCrunch ο διευθύνων σύμβουλος της Databricks, Ali Ghodsi. "Αυτό μπορεί να διπλασιάσει το κόστος σας."
Ο El Hallak πλαισίωσε το ευρύτερο επιχείρημα της Nvidia όσον αφορά τη διαφάνεια. "Πιστεύουμε ότι η ύπαρξη μιας ανοιχτής στοίβας πρακτόρων - όπου έχετε τον έλεγχο σε όλη την πλεξούδα, σε όλη την υποδομή, σε όλο το χρόνο εκτέλεσης - είναι αυτό που απαιτείται για να οδηγήσουμε το οικοσύστημα προς τα εμπρός και με ασφάλεια", είπε. Η Nvidia διαθέτει ανοιχτού μεγέθους τεχνολογία πλεξούδας υπό την επωνυμία της NeMo και η έρευνα AVO τεκμηριώνεται σε ένα έγγραφο για το arXiv.
Ένα σημείο αναφοράς με μια ιστορία
Το ARC-AGI-3 έχει γίνει σημείο ανάφλεξης στον ανταγωνισμό συνοριακών εργαστηρίων. Το OpenAI ισχυρίστηκε προηγουμένως ισχυρά αποτελέσματα για το μοντέλο GPT-5.6 Sol στο σημείο αναφοράς, εξετάζοντας τις ρυθμίσεις αξιολόγησης που χρησιμοποιήθηκαν. Το αποτέλεσμα της Nvidia παρακάμπτει αυτή τη συζήτηση κατά μία έννοια - δεν διεκδικεί ένα πιο έξυπνο μοντέλο, μόνο έναν καλύτερα σχεδιασμένο πράκτορα γύρω από ένα υπάρχον.
Το μήνυμα για τους προγραμματιστές και τις επιχειρήσεις που κατασκευάζουν προϊόντα αντιπροσώπων είναι άμεσο: η επιλογή μοντέλων εξακολουθεί να έχει σημασία, αλλά ο σχεδιασμός του συστήματος αποφασίζει τώρα εάν ένα μοντέλο συνόρων προσφέρει αποτελέσματα αιχμής. Όπως το θέτει η Nvidia, η αξιολόγηση ενός μοντέλου δεν είναι το ίδιο με την αξιολόγηση ενός πράκτορα — και οι πίνακες αναφοράς του 2026 ανταμείβουν όλο και περισσότερο τους μηχανικούς που κατασκευάζουν τη σκαλωσιά.
Μείνετε μπροστά από την τεχνητή νοημοσύνη
Οι αρχιτεκτονικές πρακτόρων κινούνται πιο γρήγορα από ποτέ και το χάσμα μεταξύ μιας καλής πλεξούδας και μιας κακής μετριέται πλέον σε σημεία αναφοράς και σε πραγματικά δολάρια. Ακολουθήστε το AI Buzz Wire για καθημερινή, επαληθευμένη από πηγές κάλυψη της έρευνας της τεχνητής νοημοσύνης, των σημείων αναφοράς και της κυκλοφορίας προϊόντων.
Διαβάστε περισσότερα νέα έρευνας AI →