Jev, das Nicht-LLM-„Entscheidungsmodell“ des Startups TypeSafe AI, hat „Pokémon Red“ abgeschlossen und sich laut der Website des Projekts in 37 Stunden und 40 Minuten Spielzeit seinen Weg von Pallet Town in die Hall of Fame erkämpft, wobei die Gesamtrechenkosten bei etwa 1,65 US-Dollar liegen.
Der vom Entwickler Christian Mathiesen erstellte Lauf wurde live mit ausgestellten Token und Kosten gestreamt und als Open-Source-Version auf GitHub bereitgestellt. Es schoss am Wochenende auf die Titelseite von Hacker News und zog Hunderte von positiven Stimmen sowie eine lebhafte Diskussion darüber an, was es über die Zukunft von KI-Agenten sagt. Tom's Hardware berichtete über den Erfolg und stellte fest, dass eine Nicht-LLM-Engine dort erfolgreich war, wo herkömmliche Chatbots monatelang ins Stocken geraten waren – und dass Claude Opus 5 das Modell durch seine Sackgassen gecoacht hat.
Der Lauf der Zahlen
Wie ungewöhnlich dieser Lauf für ein KI-System war, zeigen die Statistiken aus dem projekteigenen Tracking:
- Gesamtzeit: 37 Stunden, 40 Minuten
- Getroffene Entscheidungen: 16.150
- Eingabe-Token: etwa 39,2 Millionen
- Gesamtkosten für Jev: etwa 1,65 $
- Typische Entscheidungszeit: 0,4 Sekunden
- Gegner kämpften: ungefähr 1.660
- Team-Wipes: 16
- Elite Four-Versuche: 15
- Schwierigste Strecke: Victory Road
Das letzte Hall of Fame-Team: Charizard auf Stufe 83, unterstützt von Graveler (62), Nidoqueen (45), Beedrill (44), Haunter (39) und Primeape (29).
Die Wirtschaft ist die Schlagzeile. Sechzehntausend Entscheidungen für weniger als den Preis eines Kaffees sind ein auffälliger Kontrast zu LLM-basierten Spielagenten, die über lange Sitzungen hinweg Token im Wert von mehreren zehn Dollar verbrennen können. Mathiesen sagte, er habe sich für Pokémon entschieden, nachdem er zu dem Schluss gekommen war, dass Jev sich schnell entscheiden könne, aber noch nicht schnell genug, um Doom zu spielen.
Warum Pokémon Rot für die KI schwer ist
Pokémon Red ist zu einem unwahrscheinlichen Maßstab für Agenten-KI geworden. Der Game-Boy-Klassiker von 1996 erfordert eine langfristige Planung: Levels durchspielen, eine Gruppe von sechs Spielern verwalten, durch labyrinthartige Höhlen ohne Karte navigieren und zurückgehen, wenn ein wichtiger Gegenstand übersehen wurde. Sprachmodellagenten sind in der Vergangenheit im Kreis herumgelaufen, in Höhlen steckengeblieben und haben enorme Budgets für überflüssige Aktionen verbrannt.
Jev verfolgt einen grundlegend anderen Ansatz. Anstatt Text zu generieren, gibt das Modell kalibrierte Entscheidungen direkt zurück – ein Design, das TypeSafe AI als „System One“-Alternative zur bewussten, sprachlastigen Argumentation großer Modelle vermarktet hat. Laut der früheren Berichterstattung von Tom's Hardware über das Modell behauptet das Unternehmen, Jev sei bei Entscheidungsaufgaben etwa 193-mal schneller und 445-mal günstiger als LLM-Alternativen.
Der Haken sei, so gab der Entwickler zu, dass Jev Hilfe brauchte. Laut Tom's Hardware hat Claude Opus 5 das Entscheidungsmodell durch seine Sackgassen gecoacht – ein hybrider Ansatz, bei dem ein großes Sprachmodell strategische Orientierung bietet, während das schnelle, kostengünstige Modell Tausende von Einzelentscheidungen ausführt. Die Projektseite stellt ironisch fest, dass Jev „nur wusste, wohin er als nächstes gehen sollte, weil es einen Führer hatte.“
Was es für KI-Agenten bedeutet
Das Ergebnis ist ein Datenpunkt in einem wachsenden Argument, dass die Zukunft der KI-Agenten nicht ein riesiges Modell ist, das alles erledigt, sondern eine Arbeitsteilung: schnelle, billige, spezialisierte Modelle, die hochfrequente Entscheidungen treffen, wobei langsamere Argumentationsmodelle nur dann eingreifen, wenn die Situation unklar wird.
Für Robotik, Spiele und Echtzeitsteuerungssysteme – Bereiche, in denen Entscheidungen in Millisekunden getroffen werden müssen und Budgets in Cent gemessen werden – ist diese Architektur attraktiv. Ein Lagerroboter, ein spielender NPC oder ein Handelssystem können sich nicht für jede Mikroaktion einen 2-Sekunden-Roundtrip im GPT-Stil leisten.
Skeptiker auf Hacker News wiesen auf die Vorbehalte des Laufs hin: Das Spiel ist Jahrzehnte alt und gründlich dokumentiert, das Trainermodell hat die strategische Schwerarbeit geleistet und 15 Elite-Four-Versuche deuten auf eine Menge Versuch und Irrtum hin. Das sind berechtigte Argumente – aber sie verfehlen das interessantere Signal. Sechzehntausend gute Entscheidungen zu je 0,0001 US-Dollar sind genau das Kostenprofil, das autonome Agenten benötigen, wenn sie jemals in großem Maßstab eingesetzt werden sollen.
TypeSafe AI, gegründet von einem ehemaligen OpenAI-RLHF-Forscher, hat Jev als Ergänzung zu Sprachmodellen und nicht als Ersatz positioniert. Das Pokémon-Projekt – Code, Stream und Kostenaufschlüsselung öffentlich – ist die bisher anschaulichste Demonstration dessen, was ein Entscheidungs-First-Stack bewirken kann.
Der vollständige Quellcode ist auf GitHub verfügbar und der abgeschlossene Lauf kann auf YouTube angesehen werden, einschließlich aller Wipes auf Victory Road.
Bleiben Sie der KI immer einen Schritt vorausFolgen Sie AI Buzz Wire für die neuesten KI-Entwicklungen.
Weitere KI-Neuigkeiten lesen →