Jev, le "modèle de décision" non-LLM de la startup TypeSafe AI, a terminé Pokémon Rouge - se frayant un chemin de Pallet Town au Temple de la renommée en 37 heures et 40 minutes de jeu pour un coût de calcul total d'environ 1,65 $, selon le site Web du projet.

L'exécution, construite par le développeur Christian Mathiesen, a été diffusée en direct avec des jetons et des coûts affichés et open source sur GitHub. Il a fait la une de Hacker News ce week-end, attirant des centaines de votes positifs et une discussion animée sur ce qu'il dit sur l'avenir des agents IA. Tom's Hardware a couvert cette réussite, notant qu'un moteur non-LLM a réussi là où les chatbots traditionnels étaient au point mort depuis des mois – et que Claude Opus 5 a accompagné le modèle dans ses impasses.

La course en chiffres

Les statistiques du propre suivi du projet montrent à quel point cette exécution était inhabituelle pour un système d'IA :

  • Durée totale : 37 heures et 40 minutes
  • Décisions prises : 16 150
  • Jetons d'entrée : environ 39,2 millions
  • Coût total du Jev : environ 1,65 $
  • Temps de décision typique : 0,4 seconde
  • Opposants combattus : environ 1 660
  • Lingettes d'équipe : 16
  • Elite Quatre tentatives : 15
  • Tronçon le plus difficile : Victory Road

La dernière équipe du Temple de la renommée : Charizard au niveau 83, soutenu par Graveler (62), Nidoqueen (45), Beedrill (44), Haunter (39) et Primeape (29).

L’économie fait la une des journaux. Seize mille décisions pour moins que le prix d'un café constituent un contraste frappant avec les agents de jeu basés sur LLM, qui peuvent dépenser des dizaines de dollars en jetons au cours de longues sessions. Mathiesen a déclaré qu'il avait choisi Pokémon après avoir conclu que Jev pouvait décider rapidement, mais pas encore assez vite pour jouer à Doom.

Pourquoi Pokémon Rouge est difficile pour l'IA

Pokémon Rouge est devenu une référence improbable en matière d’IA agentique. Le classique de la Game Boy de 1996 exige une planification à long terme : niveaux de travail, gestion d'un groupe de six personnes, navigation dans des grottes labyrinthiques sans carte et retour en arrière lorsqu'un élément clé a été manqué. Les agents modèles linguistiques ont toujours erré en rond, se sont retrouvés coincés dans des grottes et ont dépensé d’énormes budgets pour des actions redondantes.

Jev adopte une approche fondamentalement différente. Plutôt que de générer du texte, le modèle renvoie directement des décisions calibrées – une conception que TypeSafe AI a commercialisée comme une alternative « System One » au raisonnement délibéré et lourd en langage des grands modèles. Selon une couverture antérieure du modèle par Tom's Hardware, la société affirme que Jev est environ 193 fois plus rapide et 445 fois moins cher que les alternatives LLM sur les tâches de décision.

Le problème, a reconnu le développeur, c'est que Jev avait besoin d'aide. Selon Tom's Hardware, Claude Opus 5 a guidé le modèle de décision jusqu'à ses impasses : une approche hybride dans laquelle un grand modèle de langage fournit des conseils stratégiques tandis que le modèle rapide et bon marché exécute des milliers de décisions individuelles. La page du projet note avec ironie que Jev « ne savait où aller ensuite que parce qu'il avait un guide ».

Ce que cela signifie pour les agents IA

Le résultat est un point de donnée dans un argument croissant selon lequel l’avenir des agents d’IA ne réside pas dans un modèle géant qui fait tout, mais dans une division du travail : des modèles rapides, bon marché et spécialisés gérant des décisions à haute fréquence, avec des modèles de raisonnement plus lents n’intervenant que lorsque la situation devient ambiguë.

Pour la robotique, les jeux et les systèmes de contrôle en temps réel (domaines où les décisions doivent arriver en millisecondes et les budgets sont mesurés en centimes), cette architecture est attrayante. Un robot d'entrepôt, un PNJ joueur ou un système commercial ne peuvent pas se permettre un aller-retour de style GPT de 2 secondes pour chaque micro-action.

Les sceptiques de Hacker News ont souligné les mises en garde de la course : le jeu est vieux de plusieurs décennies et soigneusement documenté, le modèle de coaching a fait le gros du travail stratégique, et 15 tentatives d'Elite Four suggèrent de nombreux essais et erreurs. Ce sont des arguments justes, mais ils passent à côté du signal le plus intéressant. Seize mille bonnes décisions à 0,0001 $ chacune, c'est exactement le profil de coût dont les agents autonomes ont besoin s'ils veulent un jour fonctionner à grande échelle.

TypeSafe AI, fondée par un ancien chercheur d'OpenAI RLHF, a positionné Jev comme un complément aux modèles de langage plutôt que comme un remplaçant. Le projet Pokémon – code, flux et répartition des coûts tous publics – est la démonstration la plus frappante à ce jour de ce qu'une pile décisionnelle peut faire.

Le code source complet est disponible sur GitHub et l'exécution terminée peut être visionnée sur YouTube, y compris chaque effacement sur Victory Road.

Gardez une longueur d'avance sur l'IA

Suivez AI Buzz Wire pour connaître les derniers développements en matière d'IA.

Lire plus d'actualités sur l'IA →