Ο Jev, το «μοντέλο απόφασης» που δεν είναι LLM από την startup TypeSafe AI, ολοκλήρωσε το Pokémon Red — παλεύοντας από το Pallet Town στο Hall of Fame σε 37 ώρες και 40 λεπτά παιχνιδιού με συνολικό υπολογιστικό κόστος περίπου 1,65 $, σύμφωνα με την ιστοσελίδα του έργου.
Η σειρά, που δημιουργήθηκε από τον προγραμματιστή Christian Mathiesen, μεταδόθηκε ζωντανά με διακριτικά και κόστη στην οθόνη και με ανοιχτό κώδικα στο GitHub. Έφτασε στην πρώτη σελίδα του Hacker News το Σαββατοκύριακο, συγκεντρώνοντας εκατοντάδες θετικές ψήφους και μια ζωηρή συζήτηση για το τι λέει για το μέλλον των πρακτόρων AI. Το Tom's Hardware κάλυψε το επίτευγμα, σημειώνοντας ότι ένας κινητήρας που δεν ήταν LLM πέτυχε εκεί όπου τα παραδοσιακά chatbots είχαν σταματήσει για μήνες - και ότι ο Claude Opus 5 καθοδήγησε το μοντέλο στα αδιέξοδά του.
The Run by the Numbers
Τα στατιστικά στοιχεία από την παρακολούθηση του ίδιου του έργου δείχνουν πόσο ασυνήθιστη ήταν αυτή η εκτέλεση για ένα σύστημα AI:
- Συνολικός χρόνος: 37 ώρες, 40 λεπτά
- Λήψη αποφάσεων: 16.150
- Διακριτικά εισόδου: περίπου 39,2 εκατομμύρια
- Συνολικό κόστος Jev: περίπου 1,65 $
- Τυπικός χρόνος απόφασης: 0,4 δευτερόλεπτα
- Οι αντίπαλοι πολέμησαν: περίπου 1.660
- Ομαδικά μαντηλάκια: 16
- Elite Four προσπάθειες: 15
- Δυσκολότερη διαδρομή: Δρόμος Νίκης
Η τελευταία ομάδα του Hall of Fame: Charizard στο επίπεδο 83, με την υποστήριξη των Graveler (62), Nidoqueen (45), Beedrill (44), Haunter (39) και Primeape (29).
Τα οικονομικά είναι ο τίτλος. Δεκαέξι χιλιάδες αποφάσεις για λιγότερο από την τιμή ενός καφέ είναι μια εντυπωσιακή αντίθεση με τους πράκτορες παιχνιδιών που βασίζονται στο LLM, οι οποίοι μπορούν να κάψουν δεκάδες δολάρια σε μάρκες σε μεγάλες περιόδους σύνδεσης. Ο Mathiesen είπε ότι επέλεξε τα Pokémon αφού κατέληξε στο συμπέρασμα ότι ο Jev μπορούσε να αποφασίσει γρήγορα, αλλά όχι ακόμα αρκετά γρήγορα για να παίξει Doom.
Γιατί το Pokémon Red είναι δύσκολο για AI
Το Pokémon Red έχει γίνει ένα απίθανο σημείο αναφοράς για το agent AI. Το κλασικό Game Boy του 1996 απαιτεί προγραμματισμό μεγάλου ορίζοντα: λείανση επιπέδων, διαχείριση ενός πάρτι έξι ατόμων, πλοήγηση σε σπηλιές που μοιάζουν με λαβύρινθο χωρίς χάρτη και οπισθοδρόμηση όταν χάθηκε ένα βασικό στοιχείο. Οι πράκτορες των γλωσσικών μοντέλων περιπλανήθηκαν ιστορικά σε κύκλους, κολλήθηκαν σε σπηλιές και έκαψαν τεράστιους προϋπολογισμούς σε περιττές ενέργειες.
Ο Jev ακολουθεί μια θεμελιωδώς διαφορετική προσέγγιση. Αντί να δημιουργεί κείμενο, το μοντέλο επιστρέφει απευθείας βαθμονομημένες αποφάσεις — ένα σχέδιο που το TypeSafe AI κυκλοφόρησε στην αγορά ως εναλλακτική λύση "System One" έναντι της σκόπιμης, βαριάς γλώσσας συλλογισμού μεγάλων μοντέλων. Σύμφωνα με την παλαιότερη κάλυψη του μοντέλου από την Tom's Hardware, η εταιρεία ισχυρίζεται ότι το Jev είναι περίπου 193 φορές ταχύτερο και 445 φορές φθηνότερο από τις εναλλακτικές λύσεις LLM σε εργασίες λήψης αποφάσεων.
Το αλίευμα, παραδέχτηκε ο προγραμματιστής, είναι ότι ο Jev χρειαζόταν βοήθεια. Σύμφωνα με το Tom's Hardware, ο Claude Opus 5 καθοδήγησε το μοντέλο απόφασης στα αδιέξοδά του — μια υβριδική προσέγγιση στην οποία ένα μοντέλο μεγάλης γλώσσας παρέχει στρατηγική καθοδήγηση ενώ το γρήγορο, φθηνό μοντέλο εκτελεί χιλιάδες μεμονωμένες αποφάσεις. Η σελίδα του έργου σημειώνει ειρωνικά ότι ο Jev «ήξερε πού να πάει μετά μόνο επειδή είχε έναν οδηγό».
Τι σημαίνει για τους πράκτορες AI
Το αποτέλεσμα είναι ένα σημείο δεδομένων σε ένα αυξανόμενο επιχείρημα ότι το μέλλον των πρακτόρων τεχνητής νοημοσύνης δεν είναι ένα γιγάντιο μοντέλο που κάνει τα πάντα, αλλά ένας καταμερισμός εργασίας: γρήγορα, φθηνά, εξειδικευμένα μοντέλα που χειρίζονται αποφάσεις υψηλής συχνότητας, με πιο αργά συλλογιστικά μοντέλα που μπαίνουν μόνο όταν η κατάσταση γίνεται ασαφής.
Για τη ρομποτική, τα παιχνίδια και τα συστήματα ελέγχου σε πραγματικό χρόνο - τομείς όπου οι αποφάσεις πρέπει να λαμβάνονται σε χιλιοστά του δευτερολέπτου και οι προϋπολογισμοί μετρώνται σε σεντ - αυτή η αρχιτεκτονική είναι ελκυστική. Ένα ρομπότ αποθήκης, ένα NPC που παίζει παιχνίδι ή ένα σύστημα συναλλαγών δεν μπορούν να αντέξουν οικονομικά ένα ταξίδι μετ' επιστροφής τύπου GPT διάρκειας 2 δευτερολέπτων για κάθε μικρο-ενέργεια.
Οι Skeptics στο Hacker News επεσήμαναν τις επιφυλάξεις του run: το παιχνίδι είναι παλιό δεκαετιών και έχει τεκμηριωθεί πλήρως, το μοντέλο προπονητή έκανε τη στρατηγική άρση βαρέων βαρών και 15 προσπάθειες Elite Four υποδηλώνουν πολλές δοκιμές και λάθη. Αυτά είναι δίκαια σημεία — αλλά χάνουν το πιο ενδιαφέρον μήνυμα. Δεκαέξι χιλιάδες καλές αποφάσεις στα 0,0001 $ η καθεμία είναι ακριβώς το προφίλ κόστους που χρειάζονται οι αυτόνομοι πράκτορες εάν θέλουν να λειτουργήσουν ποτέ σε κλίμακα.
Το TypeSafe AI, που ιδρύθηκε από έναν πρώην ερευνητή του OpenAI RLHF, έχει τοποθετήσει το Jev ως συμπλήρωμα στα γλωσσικά μοντέλα και όχι ως αντικατάσταση. Το έργο Pokémon - κωδικός, ροή και ανάλυση κόστους για όλα τα δημόσια - είναι η πιο ζωντανή επίδειξη του τι μπορεί να κάνει μια στοίβα απόφασης.
Ο πλήρης πηγαίος κώδικας είναι διαθέσιμος στο GitHub και η ολοκληρωμένη εκτέλεση μπορεί να παρακολουθηθεί στο YouTube, συμπεριλαμβανομένου κάθε διαγραφής στο Victory Road.
Μείνετε μπροστά από την τεχνητή νοημοσύνηΑκολουθήστε το AI Buzz Wire για τις τελευταίες εξελίξεις AI.
Διαβάστε περισσότερα νέα AI →