Jev, „modelul de decizie” non-LLM de la startup-ul TypeSafe AI, a finalizat Pokémon Red – luptându-și drumul de la Pallet Town la Hall of Fame în 37 de ore și 40 de minute de joc la un cost total de calcul de aproximativ 1,65 USD, potrivit site-ului web al proiectului.
Runda, construită de dezvoltatorul Christian Mathiesen, a fost transmisă în direct cu jetoane și costuri afișate și open source pe GitHub. A apărut pe prima pagină a Hacker News în weekend, atrăgând sute de voturi pozitive și o discuție plină de viață despre ceea ce spune despre viitorul agenților AI. Tom's Hardware a acoperit realizarea, menționând că un motor non-LLM a reușit acolo unde chatbot-urile tradiționale s-au blocat de luni de zile - și că Claude Opus 5 a condus modelul prin fundăturile sale.
Alergarea după numere
Statisticile din propria urmărire a proiectului arată cât de neobișnuită a fost această rulare pentru un sistem AI:
- Timp total: 37 ore, 40 minute
- Hotărâri luate: 16.150
- Jetoane de intrare: aproximativ 39,2 milioane
- Cost total Jev: aproximativ 1,65 USD
- Timp de decizie tipic: 0,4 secunde
- Oponenții au luptat: aproximativ 1.660
- Șervețele de echipă: 16
- Elită patru încercări: 15
- Cea mai grea porțiune: Drumul Victoriei
Ultima echipă din Hall of Fame: Charizard la nivelul 83, susținut de Graveler (62), Nidoqueen (45), Beedrill (44), Haunter (39) și Primeape (29).
Economia este titlul. Șaisprezece mii de decizii pentru mai puțin decât prețul unei cafele este un contrast izbitor cu agenții de joc bazați pe LLM, care pot arde zeci de dolari în jetoane în sesiuni lungi. Mathiesen a spus că a ales Pokémon după ce a ajuns la concluzia că Jev ar putea decide rapid, dar nu suficient de repede pentru a juca Doom.
De ce Pokémon Red este greu pentru AI
Pokémon Red a devenit un punct de referință puțin probabil pentru AI-ul agentic. Clasicul Game Boy din 1996 necesită o planificare pe orizont lung: niveluri de măcinare, gestionarea unui grup de șase persoane, navigarea în peșteri asemănătoare unui labirint fără o hartă și întoarcerea înapoi atunci când un element cheie a fost ratat. Agenții de model de limbaj au rătăcit istoric în cercuri, au rămas blocați în peșteri și au ars bugete enorme pentru acțiuni redundante.
Jev adoptă o abordare fundamental diferită. În loc să genereze text, modelul returnează decizii calibrate în mod direct - un design TypeSafe AI pe care l-a comercializat ca o alternativă „System One” la raționamentul deliberat, bogat în limbaj al modelelor mari. Conform acoperirii anterioare a modelului de către Tom's Hardware, compania susține că Jev este de aproximativ 193 de ori mai rapid și de 445 de ori mai ieftin decât alternativele LLM în sarcinile de decizie.
Problema, a recunoscut dezvoltatorul, este că Jev avea nevoie de ajutor. Conform Tom’s Hardware, Claude Opus 5 a condus modelul decizional prin punctele fără fund – o abordare hibridă în care un model de limbă mare oferă îndrumări strategice, în timp ce modelul rapid și ieftin execută mii de decizii individuale. Pagina proiectului notează ironic că Jev „știa unde să meargă în continuare doar pentru că avea un ghid”.
Ce înseamnă pentru agenții AI
Rezultatul este un punct de date într-un argument în creștere că viitorul agenților AI nu este un model gigant care face totul, ci o diviziune a muncii: modele rapide, ieftine, specializate care gestionează decizii de înaltă frecvență, cu modele de raționament mai lente care intervin doar atunci când situația devine ambiguă.
Pentru robotică, jocuri și sisteme de control în timp real - domenii în care deciziile trebuie să ajungă în milisecunde și bugetele sunt măsurate în cenți - această arhitectură este atrăgătoare. Un robot de depozit, un NPC care se joacă sau un sistem de tranzacționare nu își pot permite o călătorie dus-întors de 2 secunde în stil GPT pentru fiecare micro-acțiune.
Scepticii de la Hacker News au subliniat avertismentele alergării: jocul este vechi de zeci de ani și este documentat temeinic, modelul de antrenament a făcut eforturile strategice, iar 15 încercări Elite Four sugerează o mulțime de încercări și erori. Acestea sunt puncte corecte - dar ratează semnalul mai interesant. Șaisprezece mii de decizii bune la 0,0001 USD fiecare este exact profilul de cost de care au nevoie agenții autonomi dacă vor să ruleze vreodată la scară.
TypeSafe AI, fondată de un fost cercetător OpenAI RLHF, a poziționat Jev ca o completare a modelelor de limbaj, mai degrabă decât un înlocuitor. Proiectul Pokémon - cod, flux și defalcare a costurilor public - este cea mai vie demonstrație de până acum a ceea ce poate face o stivă care primește o decizie.
Codul sursă complet este disponibil pe GitHub, iar rularea finalizată poate fi vizionată pe YouTube, inclusiv fiecare ștergere de pe Victory Road.
Rămâneți înaintea AIUrmăriți AI Buzz Wire pentru cele mai recente evoluții AI.
Citiți mai multe știri AI →