Jev, o “modelo de decisão” não-LLM da startup TypeSafe AI, completou Pokémon Red – abrindo caminho de Pallet Town ao Hall da Fama em 37 horas e 40 minutos de jogo a um custo total de computação de cerca de US$ 1,65, de acordo com o site do projeto.
A execução, desenvolvida pelo desenvolvedor Christian Mathiesen, foi transmitida ao vivo com tokens e custos em exibição e de código aberto no GitHub. Chegou à primeira página do Hacker News no fim de semana, atraindo centenas de votos positivos e uma discussão animada sobre o que diz sobre o futuro dos agentes de IA. Tom's Hardware cobriu a conquista, observando que um mecanismo não LLM teve sucesso onde os chatbots tradicionais ficaram parados por meses - e que Claude Opus 5 treinou o modelo em seus becos sem saída.
A corrida pelos números
As estatísticas do próprio rastreamento do projeto mostram o quão incomum essa execução foi para um sistema de IA:
- Tempo total: 37 horas e 40 minutos
- Decisões tomadas: 16.150
- Tokens de entrada: cerca de 39,2 milhões
- Custo total de Jev: cerca de US$ 1,65
- Tempo de decisão típico: 0,4 segundos
- Oponentes lutaram: aproximadamente 1.660
- Limpezas de equipe: 16
- Elite Quatro tentativas: 15
- Trecho mais difícil: Victory Road
A última equipe do Hall da Fama: Charizard no nível 83, apoiado por Graveler (62), Nidoqueen (45), Beedrill (44), Haunter (39) e Primeape (29).
A economia é a manchete. Dezesseis mil decisões por menos do que o preço de um café são um contraste marcante com os agentes de jogos baseados em LLM, que podem queimar dezenas de dólares em tokens durante longas sessões. Mathiesen disse que escolheu Pokémon depois de concluir que Jev poderia decidir rapidamente, mas ainda não o suficiente para jogar Doom.
Por que Pokémon Red é difícil para IA
Pokémon Red se tornou uma referência improvável para IA agente. O clássico do Game Boy de 1996 exige planejamento de longo horizonte: níveis difíceis, gerenciamento de um grupo de seis pessoas, navegação em cavernas labirínticas sem mapa e retrocesso quando um item importante foi perdido. Os agentes do modelo de linguagem historicamente andaram em círculos, ficaram presos em cavernas e queimaram enormes orçamentos em ações redundantes.
Jev adota uma abordagem fundamentalmente diferente. Em vez de gerar texto, o modelo retorna decisões calibradas diretamente – um design que a TypeSafe AI comercializou como uma alternativa do “Sistema Um” ao raciocínio deliberado e com linguagem pesada de modelos grandes. De acordo com a cobertura anterior do modelo por Tom's Hardware, a empresa afirma que Jev é aproximadamente 193 vezes mais rápido e 445 vezes mais barato do que as alternativas LLM em tarefas de decisão.
O problema, reconheceu o desenvolvedor, é que Jev precisava de ajuda. De acordo com Tom's Hardware, Claude Opus 5 orientou o modelo de decisão através de seus becos sem saída - uma abordagem híbrida na qual um grande modelo de linguagem fornece orientação estratégica enquanto o modelo rápido e barato executa milhares de decisões individuais. A página do projeto observa ironicamente que Jev “só sabia para onde ir porque tinha um guia”.
O que isso significa para os agentes de IA
O resultado é um ponto de dados num argumento crescente de que o futuro dos agentes de IA não é um modelo gigante que faz tudo, mas uma divisão de trabalho: modelos rápidos, baratos e especializados que lidam com decisões de alta frequência, com modelos de raciocínio mais lentos intervindo apenas quando a situação se torna ambígua.
Para robótica, jogos e sistemas de controle em tempo real – domínios onde as decisões devem chegar em milissegundos e os orçamentos são medidos em centavos – essa arquitetura é atraente. Um robô de armazém, um NPC que joga um jogo ou um sistema de negociação não pode se dar ao luxo de uma viagem de ida e volta no estilo GPT de 2 segundos para cada microação.
Os céticos do Hacker News apontaram as advertências da corrida: o jogo tem décadas e está completamente documentado, o modelo de treinamento fez o trabalho estratégico pesado e 15 tentativas da Elite Four sugerem muitas tentativas e erros. Esses são pontos justos – mas perdem o sinal mais interessante. Dezesseis mil boas decisões a US$ 0,0001 cada é exatamente o perfil de custo que os agentes autônomos precisam para operar em grande escala.
TypeSafe AI, fundada por um ex-pesquisador OpenAI RLHF, posicionou Jev como um complemento aos modelos de linguagem, em vez de um substituto. O projeto Pokémon – código, fluxo e detalhamento de custos, todos públicos – é a demonstração mais vívida do que uma pilha de decisão em primeiro lugar pode fazer.
O código-fonte completo está disponível no GitHub, e a execução completa pode ser assistida no YouTube, incluindo cada limpeza no Victory Road.
Fique à frente da IASiga AI Buzz Wire para os mais recentes desenvolvimentos de IA.
Leia mais notícias sobre IA →