Jev, „model decyzyjny” spoza LLM ze start-upu TypeSafe AI, ukończył Pokémon Red — przedzierając się z Pallet Town do Hall of Fame w 37 godzin i 40 minut gry, a całkowity koszt obliczeniowy wynosi około 1,65 dolara, jak podaje strona internetowa projektu.
Akcja, zbudowana przez programistę Christiana Mathiesena, była transmitowana na żywo z widocznymi tokenami i kosztami oraz dostępna na zasadach open source w GitHub. W weekend trafił na pierwszą stronę Hacker News, zdobywając setki głosów pozytywnych i ożywioną dyskusję na temat tego, co mówi o przyszłości agentów AI. Tom's Hardware opisał to osiągnięcie, zauważając, że silnik inny niż LLM odniósł sukces tam, gdzie tradycyjne chatboty utknęły w martwym punkcie od miesięcy, a Claude Opus 5 przeprowadził model przez ślepe zaułki.
Bieg w liczbach
Statystyki pochodzące z własnego śledzenia projektu pokazują, jak niezwykły był ten przebieg dla systemu AI:
- Czas całkowity: 37 godzin 40 minut
- Podjęte decyzje: 16 150
- Tokeny wejściowe: około 39,2 miliona
- Całkowity koszt Jeva: około 1,65 USD
- Typowy czas decyzji: 0,4 sekundy
- Przeciwnicy walczyli: około 1660
- Chusteczki drużynowe: 16
- Elitarne Cztery próby: 15
- Najtrudniejszy odcinek: Droga Zwycięstwa
Ostateczna drużyna Hall of Fame: Charizard na poziomie 83, wspierany przez Graveler (62), Nidoqueen (45), Beedrill (44), Haunter (39) i Primeape (29).
Tematyka ekonomiczna jest głównym tematem. Szesnaście tysięcy decyzji za mniej niż cena kawy stanowi uderzający kontrast w stosunku do agentów gier opartych na LLM, którzy podczas długich sesji mogą wydać dziesiątki dolarów w tokenach. Mathiesen powiedział, że wybrał Pokémona po tym, jak stwierdził, że Jev może podjąć decyzję szybko, ale nie na tyle szybko, aby zagrać w Dooma.
Dlaczego Pokémon Red jest trudny dla sztucznej inteligencji
Pokémon Red stał się mało prawdopodobnym punktem odniesienia dla agentycznej sztucznej inteligencji. Klasyczna gra Game Boy z 1996 roku wymaga planowania dalekosiężnego: grindowania poziomów, zarządzania sześcioosobową drużyną, poruszania się po jaskiniach przypominających labirynt bez mapy i cofania się w przypadku pominięcia kluczowego elementu. Agenci modelu językowego od dawna błąkali się w kółko, tkwili w jaskiniach i marnowali ogromne budżety na niepotrzebne działania.
Jev przyjmuje zasadniczo odmienne podejście. Zamiast generować tekst, model bezpośrednio zwraca skalibrowane decyzje — projekt TypeSafe AI reklamowany jest jako „System One” będący alternatywą dla celowego, obciążonego językiem rozumowania dużych modeli. Według wcześniejszych opisów modelu Tom's Hardware, firma twierdzi, że Jev jest około 193 razy szybszy i 445 razy tańszy w przypadku zadań decyzyjnych niż alternatywy LLM.
Twórca przyznał, że haczyk polega na tym, że Jev potrzebował pomocy. Według Tom's Hardware Claude Opus 5 przeprowadził model decyzyjny w ślepych zaułkach — podejście hybrydowe, w którym duży model językowy zapewnia strategiczne wskazówki, podczas gdy szybki i tani model wykonuje tysiące indywidualnych decyzji. Na stronie projektu ironicznie zauważa się, że Jev „wiedział, dokąd dalej się udać, tylko dlatego, że miał przewodnik”.
Co to oznacza dla agentów AI
Rezultatem jest punkt danych dla rosnącej argumentacji, że przyszłością agentów AI nie jest jeden gigantyczny model, który robi wszystko, ale podział pracy: szybkie, tanie, wyspecjalizowane modele obsługujące decyzje podejmowane z dużą częstotliwością, z wolniejszymi modelami rozumowania wkraczającymi dopiero wtedy, gdy sytuacja staje się niejednoznaczna.
W przypadku robotyki, gier i systemów sterowania w czasie rzeczywistym – dziedzin, w których decyzje muszą być podejmowane w milisekundach, a budżety mierzone są w centach – taka architektura jest atrakcyjna. Robot magazynowy, NPC grający w grę lub system handlowy nie mogą sobie pozwolić na 2-sekundową podróż w obie strony w stylu GPT dla każdej mikroakcji.
Sceptycy z Hacker News zwrócili uwagę na zastrzeżenia związane z tą grą: gra ma kilkadziesiąt lat i jest dokładnie udokumentowana, model coachingowy wykonał strategiczne wyzwanie, a 15 prób Elite Four sugeruje mnóstwo prób i błędów. To słuszne uwagi, ale pomijają bardziej interesujący sygnał. Szesnaście tysięcy dobrych decyzji po 0,0001 USD każda to dokładnie taki profil kosztów, jakiego potrzebują autonomiczni agenci, jeśli chcą kiedykolwiek działać na dużą skalę.
Sztuczna inteligencja TypeSafe, założona przez byłego badacza OpenAI RLHF, umieściła Jeva jako uzupełnienie modeli językowych, a nie zamiennik. Projekt Pokémon — kod, transmisja strumieniowa i zestawienie kosztów dostępne dla wszystkich — jest najbardziej jasną jak dotąd demonstracją tego, co może zrobić stos podejmujący decyzję.
Pełny kod źródłowy jest dostępny na GitHubie, a ukończoną wersję można obejrzeć na YouTube, łącznie z każdym czyszczeniem na Victory Road.
Wyprzedź sztuczną inteligencjęŚledź AI Buzz Wire, aby uzyskać najnowsze informacje o rozwoju sztucznej inteligencji.
Przeczytaj więcej aktualności o sztucznej inteligencji →