Jev, el "modelo de decisión" que no es LLM de la startup TypeSafe AI, ha completado Pokémon Red, luchando para llegar desde Pueblo Paleta al Salón de la Fama en 37 horas y 40 minutos de juego con un costo total de cómputo de alrededor de $1,65, según el sitio web del proyecto.
La ejecución, creada por el desarrollador Christian Mathiesen, se transmitió en vivo con tokens y costos en exhibición y de código abierto en GitHub. Llegó a la portada de Hacker News durante el fin de semana, generando cientos de votos a favor y una animada discusión sobre lo que dice sobre el futuro de los agentes de IA. Tom's Hardware cubrió el logro y señaló que un motor que no era LLM tuvo éxito donde los chatbots tradicionales se habían estancado durante meses, y que Claude Opus 5 guió al modelo a través de sus callejones sin salida.
La carrera por los números
Las estadísticas del propio seguimiento del proyecto muestran lo inusual que fue esta ejecución para un sistema de IA:
- Tiempo total: 37 horas, 40 minutos
- Decisiones tomadas: 16.150
- Tokens de entrada: aproximadamente 39,2 millones
- Costo total de Jev: alrededor de $1,65
- Tiempo de decisión típico: 0,4 segundos
- Oponentes pelearon: aproximadamente 1,660
- Toallitas del equipo: 16
- Intentos de Élite Cuatro: 15
- Tramo más difícil: Victory Road
El último equipo del Salón de la Fama: Charizard en el nivel 83, respaldado por Graveler (62), Nidoqueen (45), Beedrill (44), Haunter (39) y Primeape (29).
La economía es el titular. Dieciséis mil decisiones por menos del precio de un café es un sorprendente contraste con los agentes de juego basados en LLM, que pueden gastar decenas de dólares en tokens durante largas sesiones. Mathiesen dijo que eligió Pokémon después de concluir que Jev podía decidir rápidamente, pero aún no lo suficiente como para jugar a Doom.
Por qué Pokémon Rojo es difícil para la IA
Pokémon Rojo se ha convertido en un punto de referencia improbable para la IA agente. El clásico de Game Boy de 1996 exige una planificación a largo plazo: superar niveles, gestionar un grupo de seis personas, navegar por cuevas laberínticas sin un mapa y retroceder cuando se pierde un elemento clave. Históricamente, los agentes del modelo del lenguaje han vagado en círculos, se han quedado atrapados en cuevas y han quemado enormes presupuestos en acciones redundantes.
Jev adopta un enfoque fundamentalmente diferente. En lugar de generar texto, el modelo devuelve decisiones calibradas directamente: un diseño que TypeSafe AI ha comercializado como una alternativa del "System One" al razonamiento deliberado y con mucho lenguaje de los modelos grandes. Según la cobertura anterior del modelo por parte de Tom's Hardware, la compañía afirma que Jev es aproximadamente 193 veces más rápido y 445 veces más barato que las alternativas LLM en tareas de decisión.
El problema, reconoció el desarrollador, es que Jev necesitaba ayuda. Según Tom's Hardware, Claude Opus 5 dirigió el modelo de decisión a través de sus callejones sin salida: un enfoque híbrido en el que un modelo de lenguaje grande proporciona orientación estratégica mientras que el modelo rápido y económico ejecuta miles de decisiones individuales. La página del proyecto señala irónicamente que Jev "sólo sabía adónde ir a continuación porque tenía una guía".
Qué significa para los agentes de IA
El resultado es un dato en un argumento creciente de que el futuro de los agentes de IA no es un modelo gigante que lo haga todo, sino una división del trabajo: modelos rápidos, baratos y especializados que manejan decisiones de alta frecuencia, con modelos de razonamiento más lentos que intervienen sólo cuando la situación se vuelve ambigua.
Para la robótica, los juegos y los sistemas de control en tiempo real (dominios donde las decisiones deben llegar en milisegundos y los presupuestos se miden en centavos) esa arquitectura es atractiva. Un robot de almacén, un NPC de juego o un sistema de comercio no pueden permitirse un viaje de ida y vuelta al estilo GPT de 2 segundos para cada microacción.
Los escépticos de Hacker News señalaron las advertencias de la carrera: el juego tiene décadas de antigüedad y está completamente documentado, el modelo de entrenamiento hizo el trabajo pesado estratégico y 15 intentos de Elite Four sugieren mucho ensayo y error. Esos son puntos justos, pero pasan por alto la señal más interesante. Dieciséis mil buenas decisiones a 0,0001 dólares cada una es exactamente el perfil de costos que los agentes autónomos necesitan si alguna vez quieren operar a escala.
TypeSafe AI, fundada por un ex investigador de OpenAI RLHF, ha posicionado a Jev como un complemento a los modelos de lenguaje en lugar de un reemplazo. El proyecto Pokémon (código, transmisión y desglose de costos todo público) es la demostración más vívida hasta ahora de lo que puede hacer una pila de decisiones primero.
El código fuente completo está disponible en GitHub y la ejecución completa se puede ver en YouTube, incluido cada borrado en Victory Road.
Manténgase por delante de la IASiga AI Buzz Wire para conocer los últimos desarrollos en IA.
Leer más noticias sobre IA →