Jev, het niet-LLM ‘beslissingsmodel’ van startup TypeSafe AI, heeft Pokémon Red voltooid – zich een weg banend van Pallet Town naar de Hall of Fame in 37 uur en 40 minuten spelen met een totale rekenkost van ongeveer $ 1,65, volgens de website van het project.

De run, gebouwd door ontwikkelaar Christian Mathiesen, werd live gestreamd met tokens en kosten tentoongesteld en open source op GitHub. Het verscheen afgelopen weekend op de voorpagina van Hacker News en trok honderden stemmen en een levendige discussie over wat het zegt over de toekomst van AI-agenten. Tom's Hardware berichtte over de prestatie en merkte op dat een niet-LLM-engine succesvol was waar traditionele chatbots maandenlang stil hadden gestaan ​​- en dat Claude Opus 5 het model door de impasse heen loodste.

De run op nummer

De statistieken van de eigen tracking van het project laten zien hoe ongebruikelijk deze run was voor een AI-systeem:

  • Totale tijd: 37 uur, 40 minuten
  • Genomen beslissingen: 16.150
  • Invoertokens: ongeveer 39,2 miljoen
  • Totale Jev-kosten: ongeveer $ 1,65
  • Typische beslissingstijd: 0,4 seconden
  • Tegenstanders vochten: ongeveer 1.660
  • Teamdoekjes: 16
  • Elite Vier pogingen: 15
  • Zwaarste stuk: Victory Road

Het laatste Hall of Fame-team: Charizard op niveau 83, ondersteund door Graveler (62), Nidoqueen (45), Beedrill (44), Haunter (39) en Primeape (29).

De economie is de kop. Zestienduizend beslissingen voor minder dan de prijs van een kopje koffie vormen een opvallend contrast met op LLM gebaseerde game-playing agents, die tijdens lange sessies tientallen dollars aan tokens kunnen verbranden. Mathiesen zei dat hij Pokémon had gekozen nadat hij had geconcludeerd dat Jev snel kon beslissen, maar nog niet snel genoeg om Doom te spelen.

Waarom Pokémon Red moeilijk is voor AI

Pokémon Red is een onwaarschijnlijke maatstaf geworden voor agent-AI. De Game Boy-klassieker uit 1996 vereist planning met een lange horizon: niveaus verscherpen, een groep van zes beheren, door doolhofachtige grotten navigeren zonder kaart, en teruggaan wanneer een belangrijk item is gemist. Taalmodelagenten hebben van oudsher in cirkels rondgezworven, zijn vastgelopen in grotten en hebben enorme budgetten verspild aan overtollige acties.

Jev hanteert een fundamenteel andere aanpak. In plaats van tekst te genereren, retourneert het model direct gekalibreerde beslissingen – een ontwerp dat TypeSafe AI op de markt heeft gebracht als een ‘System One’-alternatief voor de doelbewuste, taalrijke redenering van grote modellen. Volgens Tom's Hardware's eerdere berichtgeving over het model beweert het bedrijf dat Jev ongeveer 193 keer sneller en 445 keer goedkoper is dan LLM-alternatieven op het gebied van beslissingstaken.

Het addertje onder het gras, zo erkende de ontwikkelaar, is dat Jev hulp nodig had. Volgens Tom's Hardware heeft Claude Opus 5 het beslissingsmodel door de impasses geloodst: een hybride aanpak waarbij een groot taalmodel strategische begeleiding biedt, terwijl het snelle, goedkope model duizenden individuele beslissingen uitvoert. Op de projectpagina wordt wrang opgemerkt dat Jev "alleen wist waar hij heen moest omdat hij een gids had."

Wat het betekent voor AI-agenten

Het resultaat is een datapunt in een groeiend argument dat de toekomst van AI-agenten niet één gigantisch model is dat alles doet, maar een taakverdeling: snelle, goedkope, gespecialiseerde modellen die hoogfrequente beslissingen afhandelen, waarbij langzamere redeneermodellen alleen ingrijpen als de situatie dubbelzinnig wordt.

Voor robotica, gaming en real-time controlesystemen – domeinen waar beslissingen in milliseconden moeten komen en budgetten in centen worden gemeten – is die architectuur aantrekkelijk. Een magazijnrobot, een game-playing NPC of een handelssysteem kunnen zich voor elke micro-actie een retourtje in GPT-stijl van 2 seconden veroorloven.

Sceptici op Hacker News wezen op de kanttekeningen bij de run: het spel is tientallen jaren oud en grondig gedocumenteerd, het coachingsmodel deed het strategische zware werk en 15 Elite Four-pogingen suggereren veel vallen en opstaan. Dat zijn eerlijke punten, maar ze missen het interessantere signaal. Zestienduizend goede beslissingen van $ 0,0001 per stuk zijn precies het kostenprofiel dat autonome agenten nodig hebben als ze ooit op grote schaal willen werken.

TypeSafe AI, opgericht door een voormalige OpenAI RLHF-onderzoeker, heeft Jev gepositioneerd als aanvulling op taalmodellen in plaats van als vervanging. Het Pokémon-project – coderen, streamen en kostenoverzicht allemaal openbaar – is de meest levendige demonstratie tot nu toe van wat een beslissingsstapel kan doen.

De volledige broncode is beschikbaar op GitHub en de voltooide run kan worden bekeken op YouTube, inclusief elke veeg op Victory Road.

Blijf AI een stap voor

Volg AI Buzz Wire voor de laatste AI-ontwikkelingen.

Lees meer AI-nieuws →