Jev, „rozhodovací model“ od startupu TypeSafe AI, který není LLM, dokončil Pokémon Red – probojoval se z Pallet Town do Síně slávy za 37 hodin a 40 minut hry s celkovými výpočtovými náklady asi 1,65 $, podle webové stránky projektu.

Run, který vytvořil vývojář Christian Mathiesen, byl živě streamován s vystavenými tokeny a náklady a open source na GitHubu. O víkendu se dostal na titulní stránku Hacker News, získal stovky kladných hlasů a živou diskuzi o tom, co říká o budoucnosti agentů AI. Tom's Hardware pokryl úspěch a poznamenal, že motor bez LLM uspěl tam, kde se tradiční chatboti na měsíce zastavili – a že Claude Opus 5 model protáhl přes slepé uličky.

The Run by the Numbers

Statistiky z vlastního sledování projektu ukazují, jak neobvyklý byl tento běh pro systém AI:

  • Celkový čas: 37 hodin, 40 minut
  • Učinená rozhodnutí: 16 150
  • Vstupní tokeny: zhruba 39,2 milionů
  • Celkové náklady Jev: přibližně 1,65 $
  • Typická doba rozhodování: 0,4 sekundy
  • Soupeři bojovali: přibližně 1 660
  • Týmové ubrousky: 16
  • Pokusy Elite Four: 15
  • Nejtěžší úsek: Cesta vítězství

Poslední tým Síně slávy: Charizard na úrovni 83, za nímž stojí Graveler (62), Nidoqueen (45), Beedrill (44), Haunter (39) a Primeape (29).

Ekonomika je titulek. Šestnáct tisíc rozhodnutí za méně než cenu kávy je nápadný kontrast s herními agenty založenými na LLM, kteří mohou během dlouhých sezení propálit desítky dolarů v tokenech. Mathiesen řekl, že si vybral Pokémona poté, co došel k závěru, že Jev se může rozhodnout rychle, ale ještě ne dostatečně rychle, aby mohl hrát Doom.

Proč je Pokémon Red těžký pro AI

Pokémon Red se stal nepravděpodobným měřítkem pro agentní AI. Klasika Game Boy z roku 1996 vyžaduje plánování s dlouhým horizontem: broušení úrovní, řízení šestičlenné skupiny, navigace v jeskyních podobných bludišti bez mapy a couvání, když se minul klíčový předmět. Agenti podle jazykového modelu historicky putovali v kruzích, uvízli v jeskyních a spálili obrovské rozpočty na nadbytečné akce.

Jev má zásadně odlišný přístup. Spíše než generování textu, model vrací kalibrovaná rozhodnutí přímo – design TypeSafe AI prodával jako „System One“ alternativu k záměrnému, jazykově náročnému uvažování velkých modelů. Podle dřívějšího pokrytí modelu Tom's Hardware společnost tvrdí, že Jev je zhruba 193krát rychlejší a 445krát levnější než alternativy LLM v rozhodovacích úlohách.

Háček, jak vývojář uznal, je v tom, že Jev potřeboval pomoc. Podle Tom's Hardware prošel Claude Opus 5 rozhodovací model přes jeho slepé uličky – hybridní přístup, ve kterém velký jazykový model poskytuje strategické vedení, zatímco rychlý a levný model provádí tisíce jednotlivých rozhodnutí. Stránka projektu ironicky poznamenává, že Jev „věděl, kam jít dál, jen proto, že měl průvodce“.

Co to znamená pro agenty AI

Výsledkem je datový bod v rostoucím argumentu, že budoucnost agentů umělé inteligence není jeden obří model, který dělá všechno, ale dělba práce: rychlé, levné, specializované modely zpracovávající vysokofrekvenční rozhodnutí, přičemž pomalejší modely uvažování zasahují pouze tehdy, když se situace stává nejednoznačnou.

Pro robotiku, hry a řídicí systémy v reálném čase – domény, kde rozhodnutí musí přijít v milisekundách a rozpočty se měří v centech – je tato architektura přitažlivá. Skladový robot, NPC hrající hry nebo obchodní systém si nemohou dovolit 2sekundovou zpáteční cestu ve stylu GPT pro každou mikroakci.

Skeptici na Hacker News poukázali na výhrady běhu: hra je stará desítky let a důkladně zdokumentovaná, model koučování udělal strategickou těžkou práci a 15 pokusů Elite Four naznačuje spoustu pokusů a omylů. To jsou férové ​​body – ale chybí jim zajímavější signál. Šestnáct tisíc dobrých rozhodnutí za 0,0001 $ za každé je přesně ten nákladový profil, který autonomní agenti potřebují, mají-li někdy fungovat ve velkém.

TypeSafe AI, založená bývalým výzkumníkem OpenAI RLHF, umístila Jev spíše jako doplněk k jazykovým modelům než jako náhradu. Projekt Pokémon – kód, stream a rozpis nákladů pro všechny veřejné – je dosud nejnázornější ukázkou toho, co dokáže stack, který se rozhoduje jako první.

Úplný zdrojový kód je k dispozici na GitHubu a dokončený běh lze sledovat na YouTube, včetně každého vymazání na Victory Road.

Zůstaňte napřed před AI

Sledujte AI Buzz Wire, kde najdete nejnovější vývoj AI.

Přečtěte si další zprávy o AI →