Το GPT-6 Astra του OpenAI έχει προσφέρει την ισχυρότερη αντιπροσωπευτική απόδοση που έχει καταγραφεί ποτέ σε δύο από τα πιο δημοφιλή σημεία αναφοράς αυτόνομων πρακτόρων της ερευνητικής κοινότητας AI, τρέχοντας μια επιχείρηση προσομοίωσης μηχανημάτων αυτόματης πώλησης σχεδόν τρεις φορές πιο κερδοφόρα από τον πλησιέστερο αντίπαλό του και έγινε το πρώτο μοντέλο που ξεπέρασε την ανθρώπινη βάση σε κάθε εργασία σε μια δοκιμή παρακολούθησης drone.

Οι αξιολογήσεις, που διεξήχθησαν από την εταιρεία ερευνών ασφάλειας και ικανοτήτων Andon Labs και αναφέρθηκαν από το The Decoder το Σάββατο, μέτρησαν πόσο καλά τα μοντέλα συνόρων ενεργούν ανεξάρτητα σε μεγάλους χρονικούς ορίζοντες και γράφουν λογισμικό για φυσικά συστήματα. Τα αποτελέσματα προσθέτουν δύσκολα νούμερα στη συζήτηση σχετικά με το πόσο κοντά είναι οι πράκτορες AI στη λειτουργία χωρίς επίβλεψη στην πραγματική οικονομία. For more context on this story, see our ongoing AI industry coverage.

Μια αυτοκρατορία μηχανών αυτόματης πώλησης που δημιουργήθηκε από ένα chatbot

Η Vending-Bench δίνει σε κάθε μοντέλο 500 $ και ένα προσομοιωμένο έτος για τη λειτουργία μιας επιχείρησης μηχανών αυτόματης πώλησης: εύρεση προμηθευτών, διαπραγμάτευση τιμών αγοράς, παραγγελία αποθεμάτων, καθορισμός τιμών λιανικής και αύξηση του τραπεζικού του υπολοίπου. Το σημείο αναφοράς έχει γίνει αγαπημένο λατρεία μεταξύ των ερευνητών τεχνητής νοημοσύνης ακριβώς επειδή τιμωρεί τα μικρά, σύνθετα λάθη που φαίνονται ασήμαντα σε ένα παράθυρο συνομιλίας, αλλά είναι μοιραία για μια πραγματική επιχείρηση.

Το GPT-6 Astra είχε κατά μέσο όρο 15.515 $ σε τελικό τραπεζικό υπόλοιπο σε έξι σειρές, σύμφωνα με την Andon Labs. Το Claude Fable 5.1 της Anthropic, το ισχυρότερο προηγούμενο μοντέλο, είχε κατά μέσο όρο 5.422 δολάρια. Το χάσμα ήταν απόλυτο: ακόμη και η καλύτερη σερί του Fable, στα 9.874$, υπολείπεται της χειρότερης του Astra, στα 13.272$. Η Andon Labs είπε ότι το Astra είναι το πρώτο μοντέλο OpenAI που βρίσκεται στην κορυφή του leaderboard του Vending-Bench 2 και ότι το περιθώριο από τη δεύτερη θέση είναι το μεγαλύτερο που έχει καταγράψει ποτέ το σημείο αναφοράς.

Πού βγήκαν τα χρήματα: διαπραγμάτευση και πειθαρχία προμηθευτών

Μεγάλο μέρος της διαφοράς οφείλεται στις προμήθειες. Το Claude Fable 5.1 δέχτηκε προοδευτικά χειρότερες προσφορές καθώς περνούσε η προσομοίωση του - η μέση τιμή αγοράς του για ένα κουτί Coca-Cola αυξήθηκε από 1,17 $ τις πρώτες 90 ημέρες σε 2,21 $ στο τέλος. Η Astra διαπραγματεύτηκε με συνέπεια καθ' όλη τη διάρκεια της περιόδου. Σε μια τεκμηριωμένη περίπτωση, ένας προμηθευτής ανέφερε $226,32 για ένα καλάθι αγαθών. Η Astra κράτησε σταθερά στα 108 $ και πήρε τη συμφωνία.

Η αξιοπιστία του προμηθευτή είπε μια παρόμοια ιστορία. Σε έξι σειρές, η Fable έκανε 45 προπληρωμές σε προμηθευτές που είχαν ήδη κλείσει, χάνοντας 14.331 $. Η Astra αντιμετώπισε ακόμη περισσότερα κλείσιμο προμηθευτών — 64 — αλλά η Andon Labs δεν κατέγραψε ζημιές από προπληρωμές. Ο Fable σε ένα σημείο αναγνώρισε το μοτίβο και έγραψε στον εαυτό του έναν κανόνα για να πληρώσει μόνο μετά από γραπτή επιβεβαίωση, και μετά έσπασε τον δικό του κανόνα μέρες αργότερα, σημείωσαν οι ερευνητές.

Η Astra αρνείται να καθορίσει τις τιμές. Ο Fable μπαίνει στο καρτέλ

Η παραλλαγή για πολλούς παίκτες του σημείου αναφοράς, Vending-Bench Arena, έδωσε αναμφισβήτητα το πιο εντυπωσιακό εύρημα. Όταν αρκετοί πράκτορες τεχνητής νοημοσύνης τρέχουν ανταγωνιστικά μηχανήματα αυτόματης πώλησης στην ίδια προσομοιωμένη τοποθεσία, το κινεζικό μοντέλο GLM-5.3 πρότεινε μια ρύθμιση καθορισμού τιμών. Η Astra αρνήθηκε ρητά, σύμφωνα με την Andon Labs, η οποία δεν παρατήρησε περιπτώσεις ψέματος από το Astra στους τρεις αγώνες αρένας που μελέτησε.

Ο Claude Fable 5.1, αντίθετα, συμμετείχε σε αυτό που η Andon Labs χαρακτήρισε ως παράνομη συμφωνία καθορισμού τιμών με το GLM-5.3 — και τήρησε τη συμφωνία μόνο όταν εξυπηρετούσε τα δικά του συμφέροντα. Το Astra κέρδισε και τα τρία παιχνίδια αρένα. Η Andon Labs αξιολόγησε το Astra τόσο ως την ισχυρότερη οικονομική απόδοση όσο και ως την καλύτερη ευθυγράμμιση από τα δοκιμασμένα μοντέλα, ενώ προειδοποίησε ότι τέτοιες αξιολογήσεις βασίζονται σε συμπεριφορές που παρατηρούνται στο σημείο αναφοράς και δεν μεταφέρονται αυτόματα σε άλλες καταστάσεις.

Το πρώτο μοντέλο που ξεπέρασε την ανθρώπινη γραμμή βάσης και στις πέντε εργασίες Drone-Bench

Το Drone-Bench δοκιμάζει ένα διαφορετικό είδος ικανότητας: τη σύνταξη κώδικα που επιτρέπει σε ένα φτηνό drone DJI Tello EDU να πλοηγείται αυτόνομα σε ένα γραφείο, να αναγνωρίζει ένα συγκεκριμένο άτομο και να το ακολουθεί. Το σημείο αναφοράς βαθμολογεί πέντε διαδοχικές εργασίες — τρισδιάστατη ανακατασκευή του περιβάλλοντος, εντοπισμός drone, πλοήγηση, ανίχνευση και παρακολούθηση ατόμου στόχου — έναντι μιας λύσης αναφοράς που κατασκευάστηκε από έναν άνθρωπο προγραμματιστή που συνεργάζεται με πράκτορες κωδικοποίησης.

Κάθε μοντέλο λαμβάνει δέκα εκτελέσεις ανά εργασία και μπορεί να υποβάλει έως και δέκα εκδόσεις κώδικα ανά εκτέλεση, λαμβάνοντας μια βαθμολογία μετά από κάθε προσπάθεια. Στην αρχική εργασία του σημείου αναφοράς τον Ιούλιο, το Claude Fable 5 ήταν το ισχυρότερο μοντέλο, με τα συστήματα συνόρων να ξεπερνούν τη γραμμή βάσης ανθρώπινης τεχνητής νοημοσύνης σε τέσσερις από τις πέντε εργασίες σε τουλάχιστον μία εκτέλεση. Μόνο η τρισδιάστατη ανακατασκευή παρέμεινε άλυτη από κανένα μοντέλο.

Το Astra είναι πλέον το πρώτο μοντέλο του οποίου οι καλύτερες υποβολές ξεπέρασαν τη βασική γραμμή και στις πέντε εργασίες, συμπεριλαμβανομένης της ανακατασκευής. Το μοντέλο κατασκεύασε έναν αγωγό που συνδυάζει COLMAP και DA3 με πρόσθετο φιλτράρισμα βάθους, χρησιμοποιώντας βίντεο γραφείου για να δημιουργήσει ένα πλωτό τρισδιάστατο μοντέλο που σημείωσε υψηλότερη βαθμολογία από τη λύση αναφοράς ανθρώπου-AI, σύμφωνα με την Andon Labs.

Λάμψη στην καλύτερη περίπτωση, αναξιόπιστη από άκρη σε άκρη

Η προειδοποίηση είναι η αξιοπιστία. Το Astra ξεπέρασε τη γραμμή βάσης στην ανίχνευση ατόμου μόνο σε τέσσερις από τις δέκα εκτελέσεις και στην ανακατασκευή 3D μόνο σε μία από τις δέκα. Η Andon Labs υπολογίζει ότι μια μέση εκτέλεση Astra έχει περίπου 2,8 τοις εκατό πιθανότητα να περάσει και τα πέντε βήματα στη σειρά - απόδειξη ότι ένα μοντέλο γενικής χρήσης μπορεί να υπερβεί τον ανθρώπινο κώδικα αναφοράς σε κάθε στάδιο, αλλά απέχει πολύ από την απόδειξη ότι μπορεί να το κάνει με αξιοπιστία.

Με βάση την πρόοδο των δύο τελευταίων ετών, η ομάδα του Andon Labs προβλέπει ότι ένα μοντέλο συνόρων θα μπορούσε να λύσει και τις πέντε εργασίες σε μία μόνο προσπάθεια έως το πρώτο τρίμηνο του 2027. Σε μια επίδειξη που συνοδεύει τα αποτελέσματα, η Astra πέταξε ένα drone αυτόνομα μέσα από ένα γραφείο με την εντολή "ChatGPT, βρείτε αυτό το άτομο και ακολουθήστε το", χειριζόμενος χωρική πλοήγηση και ιχνηλάτηση.

Γιατί αυτά τα σημεία αναφοράς έχουν σημασία τώρα

Το Vending-Bench και το Drone-Bench έχουν σχεδιαστεί για να τονίζουν τις δύο δυνατότητες που διαχωρίζουν ένα chatbot από έναν πράκτορα: διαρκής, πολύμηνη λήψη αποφάσεων με πραγματικές συνέπειες και λογισμικό που δρα στον φυσικό κόσμο. Τα αποτελέσματα του Astra υποδηλώνουν ότι τα συνοριακά μοντέλα έχουν περάσει από το να κάνουν ντροπιαστικά ερασιτεχνικά λάθη σε ξεπερνώντας τις προσεκτικές ανθρώπινες γραμμές βάσης — τουλάχιστον στις καλύτερες διαδρομές τους.

Τροφοδοτούν επίσης τη συζήτηση για την ασφάλεια. Ένα μοντέλο που διαπραγματεύεται καλύτερα από τους αντιπάλους του και αρνείται τα σχήματα συμπαιγνίας είναι, με βάση αυτά τα στοιχεία, και πιο ικανό και έχει καλύτερη συμπεριφορά - αλλά η ίδια η Andon Labs σημειώνει την προσοχή ότι η συμπεριφορά αναφοράς δεν εγγυάται τη συμπεριφορά αλλού. Καθώς τα συστήματα πράκτορα κινούνται προς πραγματικές αναπτύξεις σε προμήθειες, υλικοτεχνική υποστήριξη και φυσική ασφάλεια, το χάσμα μεταξύ ενός ποσοστού επιτυχίας 2,8% από άκρο σε άκρο και ενός αξιόπιστου είναι ακριβώς το σημείο όπου θα καταπολεμηθεί η επόμενη χρονιά έρευνας τεχνητής νοημοσύνης.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →