Jev, den icke-LLM "beslutsmodellen" från startup TypeSafe AI, har slutfört Pokémon Red — kämpar sig från Pallet Town till Hall of Fame på 37 timmar och 40 minuters spel till en total beräkningskostnad på cirka $1,65, enligt projektets hemsida.
Körningen, byggd av utvecklaren Christian Mathiesen, streamades live med tokens och kostnader på visning och öppen källkod på GitHub. Det sköts upp på förstasidan av Hacker News under helgen, drog hundratals uppröstningar och en livlig diskussion om vad den säger om framtiden för AI-agenter. Tom's Hardware täckte prestationen och noterade att en icke-LLM-motor lyckades där traditionella chatbots hade stannat i månader - och att Claude Opus 5 coachade modellen genom dess återvändsgränder.
The Run by the Numbers
Statistiken från projektets egen spårning visar hur ovanlig denna körning var för ett AI-system:
- Total tid: 37 timmar, 40 minuter
- Beslut fattade: 16 150
- Inmatningstokens: ungefär 39,2 miljoner
- Total Jev-kostnad: cirka 1,65 USD
- Typisk beslutstid: 0,4 sekunder
- Modståndare slogs: cirka 1 660
- Teamservetter: 16
- Elite fyra försök: 15
- Tuffaste sträckan: Victory Road
Det sista Hall of Fame-laget: Charizard på nivå 83, uppbackad av Graveler (62), Nidoqueen (45), Beedrill (44), Haunter (39) och Primeape (29).
Ekonomin är rubriken. Sexton tusen beslut för mindre än priset för en kaffe är en slående kontrast till LLM-baserade spelagenter, som kan bränna genom tiotals dollar i tokens under långa sessioner. Mathiesen sa att han valde Pokémon efter att ha kommit fram till att Jev kunde bestämma sig snabbt, men ännu inte tillräckligt snabbt för att spela Doom.
Varför Pokémon Red är svårt för AI
Pokémon Red har blivit ett osannolikt riktmärke för agent AI. Game Boy-klassikern från 1996 kräver planering med lång horisont: slipa nivåer, hantera ett sällskap på sex, navigera i labyrintliknande grottor utan karta och backa när ett viktigt föremål missades. Språkmodellagenter har historiskt vandrat i cirklar, fastnat i grottor och bränt enorma budgetar på överflödiga handlingar.
Jev tar ett fundamentalt annorlunda tillvägagångssätt. Istället för att generera text, returnerar modellen kalibrerade beslut direkt - en design som TypeSafe AI har marknadsfört som ett "System One"-alternativ till det avsiktliga, språktunga resonemanget hos stora modeller. Enligt Tom's Hardwares tidigare täckning av modellen, hävdar företaget att Jev är ungefär 193 gånger snabbare och 445 gånger billigare än LLM-alternativ när det gäller beslutsuppgifter.
Haken, erkände utvecklaren, är att Jev behövde hjälp. Enligt Tom's Hardware coachade Claude Opus 5 beslutsmodellen genom dess återvändsgränder - en hybrid metod där en stor språkmodell ger strategisk vägledning medan den snabba, billiga modellen exekverar tusentals individuella beslut. Projektsidan noterar snett att Jev "bara visste vart han skulle gå härnäst eftersom den hade en guide."
Vad det betyder för AI-agenter
Resultatet är en datapunkt i ett växande argument att framtiden för AI-agenter inte är en gigantisk modell som gör allt, utan en arbetsfördelning: snabba, billiga, specialiserade modeller som hanterar högfrekventa beslut, med långsammare resonemangsmodeller som bara kliver in när situationen blir tvetydig.
För robotik, spel och kontrollsystem i realtid – domäner där beslut måste komma på millisekunder och budgetar mäts i cent – är den arkitekturen tilltalande. En lagerrobot, en spelande NPC eller ett handelssystem har inte råd med en 2-sekunders tur och retur i GPT-stil för varje mikroåtgärd.
Skeptiker på Hacker News påpekade körningens varningar: spelet är decennier gammalt och väldokumenterat, coachningsmodellen gjorde det strategiska tunga lyftet och 15 Elite Four-försök tyder på massor av trial and error. Det är rättvisa poäng - men de missar den mer intressanta signalen. Sexton tusen bra beslut för $0,0001 vardera är exakt den kostnadsprofil som autonoma agenter behöver om de någonsin ska kunna köra i stor skala.
TypeSafe AI, grundat av en före detta OpenAI RLHF-forskare, har placerat Jev som ett komplement till språkmodeller snarare än en ersättning. Pokémon-projektet – kod, ström och kostnadsfördelning alla offentliga – är den mest levande demonstrationen hittills av vad en beslut-först-stack kan göra.
Den fullständiga källkoden är tillgänglig på GitHub, och den slutförda körningen kan ses på YouTube, inklusive varje radering på Victory Road.
Lägg dig före AIFölj AI Buzz Wire för den senaste AI-utvecklingen.
Läs mer AI-nyheter →