Um sistema de IA finalmente conquistou o Stratego, o clássico jogo de tabuleiro que confundiu as máquinas por décadas – e fez isso com um orçamento apertado. Uma equipe de pesquisadores da Carnegie Mellon University, MIT, New York University e Stanford University construiu uma IA chamada Ataraxos que derrotou Pim Niemeijer, amplamente considerado o melhor jogador de Stratego de todos os tempos, por um placar de 15 jogos a 1 com quatro empates, relata Ars Technica.
O resultado é menos impressionante pelo placar do que pelo preço. Ataraxos treinou em apenas 16 GPUs por cerca de uma semana, além de quatro GPUs adicionais por quatro dias para treinar um modelo complementar – uma execução que a equipe diz ter custado apenas alguns milhares de dólares. O DeepNash da DeepMind, o sistema de 2022 que primeiro chamou a atenção da IA para o jogo, treinou por dois a três meses em 1.024 chips TPU especializados do Google, uma execução que a equipe da Ataraxos estima que custaria entre US$ 3 milhões e US$ 4,5 milhões a preços de 2025. Para mais contexto sobre esta história, confira nossa atualizações de inteligência artificial.
Por que a Stratego surpreendeu a IA por décadas
Deep Blue venceu Garry Kasparov no xadrez em 1997. AlphaGo derrotou Lee Sedol no Go em 2016. Os bots de pôquer derrotaram profissionais há anos. A Stratego resistiu – mesmo contra os recursos consideráveis da DeepMind.
A dificuldade do jogo vem de sua combinação incomum de informações ocultas, escala e duração. Cada jogador comanda 40 peças que representam as fileiras militares, desde um marechal até um espião, além de bombas e uma bandeira. Você vence capturando a bandeira do oponente. Seu oponente pode ver onde estão suas peças, mas não o que são. As identidades são reveladas apenas quando duas peças colidem e a peça mais fraca é removida.
“No Stratego, há 40 peças no tabuleiro que podem estar em qualquer ordem”, disse Gabriele Farina, cientista da computação do MIT e coautor do estudo, à Ars Technica. Isso permite mais de um decilhão de configurações possíveis – superando as 1.326 mãos possíveis no Texas Hold'em, um jogo que os computadores quebraram anos atrás. A duração agrava o problema: “No xadrez, normalmente o jogo dura 40 lances, mas no Stratego, um jogo pode facilmente durar 2.000 lances”, disse Farina.
Depois há o blefe. Mover uma peça fraca como se fosse um marechal pode assustar o oponente, mas blefe com muita frequência e as ameaças não significam nada; nunca blefe e você se tornará previsível. Esse ato de equilíbrio foi o que impediu que sistemas anteriores, como o DeepNash, chegassem ao topo.
“Há algo muito distinto no Stratego, que é uma enorme quantidade de informação oculta que se desdobra ao longo de uma escala de tempo muito longa”, disse Eugene Vinitsky, pesquisador da NYU e outro coautor.
Uma segunda rede neural que adivinha
Ataraxos aprendeu da mesma forma básica que DeepNash: jogando contra si mesmo, 163 milhões de jogos no total, reforçando movimentos que levaram a vitórias e amortecendo aqueles que não o fizeram. A primeira melhoria da equipe foi no quanto o sistema se ajustava após cada jogo, porque informações ocultas tendem a enviar algoritmos de autojogo em círculos. Ataraxos fez grandes mudanças estratégicas no início do treinamento e mudanças cada vez mais cuidadosas posteriormente.
O maior avanço foi algo que o DeepNash nunca teve: pensar no futuro antes de cada movimento. O refinamento baseado na pesquisa antes de agir foi o que tornou o AlphaGo poderoso, mas o DeepMind não conseguiu fazê-lo funcionar no Stratego porque o espaço de pesquisa era muito vasto.
A solução foi uma segunda rede neural – um modelo de crenças, treinado para adivinhar as peças ocultas do oponente a partir de como elas estavam se movendo. Em vez de repetir todos os arranjos possíveis, Ataraxos experimenta os possíveis, executa movimentos candidatos em cada um e escolhe com base nos resultados. Os autores principais, Samuel Sokota e Farina, também escreveram um simulador personalizado que executa milhões de movimentos por segundo em placas gráficas, que é como um laboratório acadêmico poderia pagar pelo treinamento. “Na escala em que estamos na academia, não temos acesso a um campo inteiro de GPUs”, disse Farina.
O campeão humano conseguiu um de volta
Niemeijer, que detém quatro campeonatos mundiais e passou mais de 600 semanas como o melhor jogador do mundo, jogou 20 partidas online contra Ataraxos durante três semanas, ganhando US$ 100 por cada vitória. Ele sabia que a IA não se adaptaria a ele, dando-lhe tempo para caçar pontos fracos. Ele conseguiu vencer exatamente uma vez.
Os pesquisadores dizem que a perda única não foi uma falha. Good Stratego requer randomização de sua configuração, então a sorte sempre desempenha um papel. “Mesmo uma estratégia perfeita, às vezes ela simplesmente perde”, disse Farina.
Os jogadores humanos no Campeonato Mundial Stratego de 2025 se saíram muito pior: os participantes que desafiaram Ataraxos venceram apenas 2 dos 40 jogos. O bot até mudou a forma como as pessoas jogam, distorcendo o metajogo com escolhas incomuns, como enfiar sua bandeira em um canto atrás de apenas duas bombas – uma configuração raramente jogada.
O nome do sistema vem da antiga palavra grega para calma, e os pesquisadores dizem que a qualidade fica evidente em seu funcionamento. Embora um humano possa apostar loucamente para se recuperar de um déficit, Ataraxos recupera lenta e metodicamente. “Observávamos o bot ‘blefar’ para voltar a partir de uma probabilidade de vitória de 2%, muito, muito casualmente”, disse Vinitsky.
O que isso significa além do tabuleiro
Vencer os humanos em jogos de informação oculta é mais do que um truque de salão. As técnicas de raciocínio sobre o Estado privado de um oponente sustentam aplicações reais onde a informação é incompleta — sistemas de negociação, segurança cibernética, modelização económica e coordenação multiagentes, para citar alguns.
O ângulo da eficiência pode ser a parte mais influente da história. Um laboratório de fronteira gastou meses computando esse problema em 2022; uma equipe acadêmica replicou e superou o resultado por aproximadamente o preço de um carro usado em 2026. À medida que a pesquisa em IA se torna sinônimo de enormes orçamentos de computação, Ataraxos é um lembrete de que ideias algorítmicas – aqui, um modelo de crença que doma um enorme espaço de pesquisa – ainda podem ser mais importantes do que a escala bruta.
O artigo da equipe descreve uma máquina que permanece calma sob a incerteza, ignora o conhecimento que um ser humano não poderia ignorar e blefa melhor do que os melhores do mundo. Essas são habilidades úteis, dentro e fora do tabuleiro.
---
Fique à Frente da IAAs últimas notícias, análises e avanços em inteligência artificial — tudo em um só lugar.
Ler mais notícias de IA →