Jev, il "modello decisionale" non LLM della startup TypeSafe AI, ha completato Pokémon Rosso, facendosi strada da Biancavilla alla Hall of Fame in 37 ore e 40 minuti di gioco per un costo di calcolo totale di circa $ 1,65, secondo il sito web del progetto.
La corsa, realizzata dallo sviluppatore Christian Mathiesen, è stata trasmessa in streaming in diretta con gettoni e costi in mostra e in open source su GitHub. È finito sulla prima pagina di Hacker News durante il fine settimana, attirando centinaia di voti positivi e una vivace discussione su ciò che dice sul futuro degli agenti IA. Tom's Hardware ha illustrato il risultato, sottolineando che un motore non LLM ha avuto successo laddove i chatbot tradizionali erano rimasti in stallo per mesi e che Claude Opus 5 ha guidato il modello attraverso i suoi vicoli ciechi.
La corsa secondo i numeri
Le statistiche del monitoraggio del progetto mostrano quanto questa corsa fosse insolita per un sistema AI:
- Tempo totale: 37 ore e 40 minuti
- Decisioni prese: 16.150
- Input token: circa 39,2 milioni
- Costo totale Jev: circa $ 1,65
- Tempo di decisione tipico: 0,4 secondi
- Avversari combattuti: circa 1.660
- Cancellazioni di squadra: 16
- Tentativi dei Quattro Elite: 15
- Tratto più difficile: Victory Road
L'ultima squadra della Hall of Fame: Charizard al livello 83, supportato da Graveler (62), Nidoqueen (45), Beedrill (44), Haunter (39) e Primeape (29).
L'economia è il titolo. Sedicimila decisioni per meno del prezzo di un caffè sono in netto contrasto con gli agenti di gioco basati su LLM, che possono bruciare decine di dollari in gettoni in lunghe sessioni. Mathiesen ha detto di aver scelto i Pokémon dopo aver concluso che Jev poteva decidere velocemente, ma non ancora abbastanza velocemente per giocare a Doom.
Perché Pokémon Rosso è difficile per l'intelligenza artificiale
Pokémon Rosso è diventato un improbabile punto di riferimento per l'intelligenza artificiale degli agenti. Il classico per Game Boy del 1996 richiede una pianificazione a lungo orizzonte: superare i livelli, gestire un gruppo di sei persone, esplorare caverne labirintiche senza una mappa e tornare indietro quando si perde un elemento chiave. Storicamente gli agenti del modello linguistico hanno vagato in tondo, sono rimasti bloccati nelle caverne e hanno bruciato enormi budget in azioni ridondanti.
Jev adotta un approccio fondamentalmente diverso. Invece di generare testo, il modello restituisce direttamente decisioni calibrate: un progetto che TypeSafe AI ha commercializzato come alternativa "System One" al ragionamento deliberato e pesantemente linguistico dei modelli di grandi dimensioni. Secondo la precedente copertura del modello di Tom's Hardware, la società afferma che Jev è circa 193 volte più veloce e 445 volte più economico delle alternative LLM nei compiti decisionali.
Il problema, ha riconosciuto lo sviluppatore, è che Jev aveva bisogno di aiuto. Secondo Tom's Hardware, Claude Opus 5 ha guidato il modello decisionale attraverso i suoi vicoli ciechi: un approccio ibrido in cui un ampio modello linguistico fornisce una guida strategica mentre il modello veloce ed economico esegue migliaia di decisioni individuali. La pagina del progetto nota ironicamente che Jev "sapeva dove andare dopo solo perché aveva una guida".
Cosa significa per gli agenti IA
Il risultato è un punto di riferimento in una crescente tesi secondo cui il futuro degli agenti IA non è un modello gigante che fa tutto, ma una divisione del lavoro: modelli veloci, economici e specializzati che gestiscono decisioni ad alta frequenza, con modelli di ragionamento più lenti che intervengono solo quando la situazione diventa ambigua.
Per la robotica, i giochi e i sistemi di controllo in tempo reale – ambiti in cui le decisioni devono arrivare in millisecondi e i budget si misurano in centesimi – quell’architettura è allettante. Un robot di magazzino, un NPC che gioca o un sistema di scambio non possono permettersi un viaggio di andata e ritorno in stile GPT di 2 secondi per ogni micro-azione.
Gli scettici di Hacker News hanno sottolineato gli avvertimenti della corsa: il gioco è vecchio di decenni e accuratamente documentato, il modello di coaching ha svolto il lavoro pesante dal punto di vista strategico e 15 tentativi dei Superquattro suggeriscono un sacco di tentativi ed errori. Questi sono punti giusti, ma perdono il segnale più interessante. Sedicimila buone decisioni a 0,0001 dollari ciascuna sono esattamente il profilo di costo di cui gli agenti autonomi hanno bisogno se vogliono operare su larga scala.
TypeSafe AI, fondata da un ex ricercatore OpenAI RLHF, ha posizionato Jev come complemento ai modelli linguistici piuttosto che come sostituto. Il progetto Pokémon - codice, streaming e ripartizione dei costi tutti pubblici - è la dimostrazione più vivida finora di ciò che può fare uno stack decisionale.
Il codice sorgente completo è disponibile su GitHub e la corsa completata può essere guardata su YouTube, inclusa ogni cancellazione su Victory Road.
Stai al passo con l'intelligenza artificialeSegui AI Buzz Wire per gli ultimi sviluppi dell'intelligenza artificiale.
Leggi altre notizie sull'AI →