Un sistema de inteligencia artificial finalmente ha conquistado Stratego, el clásico juego de mesa que dejó perplejas a las máquinas durante décadas, y lo hizo con un presupuesto reducido. Un equipo de investigadores de la Universidad Carnegie Mellon, el MIT, la Universidad de Nueva York y la Universidad de Stanford construyó una IA llamada Ataraxos que derrotó a Pim Niemeijer, ampliamente considerado como el mejor jugador de Stratego de todos los tiempos, por una puntuación de 15 juegos a 1 con cuatro empates, informa Ars Technica.
El resultado llama la atención menos por el resultado que por el precio. Ataraxos entrenó en solo 16 GPU durante aproximadamente una semana, más cuatro GPU adicionales durante cuatro días para entrenar un modelo complementario, una ejecución que, según el equipo, costó solo unos pocos miles de dólares. DeepNash de DeepMind, el sistema de 2022 que atrajo por primera vez la atención de la IA en el juego, se entrenó durante dos o tres meses en 1.024 chips TPU especializados de Google, una ejecución que el equipo de Ataraxos estima que costaría entre 3 millones y 4,5 millones de dólares a precios de 2025. Para más contexto sobre esta historia, consulta nuestra novedades de IA.
Por qué Stratego dejó perpleja a la IA durante décadas
Deep Blue venció a Garry Kasparov en ajedrez en 1997. AlphaGo derrotó a Lee Sedol en Go en 2016. Los robots de póquer han vencido a los profesionales durante años. Stratego resistió, incluso contra los considerables recursos de DeepMind.
La dificultad del juego proviene de su inusual combinación de información oculta, escala y longitud. Cada jugador controla 40 piezas que representan rangos militares, desde un mariscal hasta un espía, además de bombas y una bandera. Ganas capturando la bandera del oponente. Tu oponente puede ver dónde están tus piezas, pero no qué son. Las identidades se revelan sólo cuando dos piezas chocan y la pieza más débil se elimina.
"En Stratego, hay 40 piezas en el tablero que podrían estar en cualquier orden", dijo a Ars Technica Gabriele Farina, científico informático del MIT y coautor del estudio. Eso permite más de un decillón de configuraciones posibles, eclipsando las 1.326 manos posibles en Texas Hold'em, un juego que las computadoras descifraron hace años. La duración agrava el problema: "En ajedrez, normalmente la partida dura 40 movimientos, pero en Stratego, una partida puede durar fácilmente 2.000 movimientos", dijo Farina.
Luego está el engaño. Mover una pieza débil como si fuera un mariscal puede asustar a un oponente, pero farolear con demasiada frecuencia y las amenazas no significan nada; nunca fanfarronees y te volverás predecible. Ese acto de equilibrio es lo que impidió que sistemas anteriores como DeepNash llegaran a la cima.
"Hay algo muy distintivo en Stratego, que es que es una enorme cantidad de información oculta que se desarrolla a lo largo de una escala de tiempo muy larga", dijo Eugene Vinitsky, investigador de la Universidad de Nueva York y otro coautor.
Una segunda red neuronal que adivina
Ataraxos aprendió de la misma manera básica que lo hizo DeepNash: jugando contra sí mismo, 163 millones de juegos en total, reforzando movimientos que llevaron a victorias y amortiguando aquellos que no. La primera mejora del equipo fue cuánto se ajustaba el sistema después de cada juego, porque la información oculta tiende a enviar algoritmos de autojuego en círculos. Ataraxos hizo grandes cambios de estrategia al principio del entrenamiento y cambios cada vez más cuidadosos más adelante.
El mayor avance fue algo que DeepNash nunca tuvo: pensar en el futuro antes de cada movimiento. El refinamiento basado en la búsqueda antes de actuar es lo que hizo que AlphaGo fuera poderoso, pero DeepMind no pudo hacerlo funcionar en Stratego porque el espacio de búsqueda era demasiado vasto.
La solución fue una segunda red neuronal: un modelo de creencias, entrenado para adivinar las piezas ocultas del oponente a partir de cómo se habían estado moviendo. En lugar de iterar sobre todos los arreglos posibles, Ataraxos toma muestras de los posibles, realiza movimientos candidatos en cada uno y elige en función de los resultados. El autor principal, Samuel Sokota, y Farina también escribieron un simulador personalizado que ejecuta millones de movimientos por segundo en tarjetas gráficas, que es la forma en que un laboratorio académico podría permitirse la ejecución del entrenamiento. "A la escala en la que nos encontramos en el mundo académico, realmente no tenemos acceso a todo un campo de GPU", afirmó Farina.
El campeón humano recuperó uno
Niemeijer, que posee cuatro campeonatos mundiales y ha pasado más de 600 semanas como el jugador mejor clasificado del mundo, jugó 20 juegos en línea contra Ataraxos durante tres semanas, ganando $100 por cada victoria. Sabía que la IA no se adaptaría a él, lo que le daría tiempo para buscar debilidades. Logró ganar exactamente una vez.
Los investigadores dicen que la pérdida única no fue un defecto. Un buen Stratego requiere que tu configuración sea aleatoria, por lo que la suerte siempre juega un papel importante. "Incluso con una estrategia perfecta, a veces simplemente se pierde", dijo Farina.
A los jugadores humanos en el Campeonato Mundial Stratego 2025 les fue mucho peor: los asistentes que desafiaron a Ataraxos ganaron solo 2 de 40 juegos. El robot incluso cambió la forma en que juega la gente, distorsionando el metajuego con opciones inusuales, como colocar su bandera en una esquina detrás de solo dos bombas, una configuración que rara vez se juega.
El nombre del sistema proviene de la antigua palabra griega que significa calma, y los investigadores dicen que la calidad se nota en su funcionamiento. Mientras que un humano puede apostar salvajemente para recuperarse de un déficit, Ataraxos logra recuperarse lenta y metódicamente. "Veríamos cómo el robot 'faroleaba' regresaba con una probabilidad de victoria del dos por ciento, de manera muy, muy casual", dijo Vinitsky.
Qué significa más allá del tablero
Vencer a los humanos en juegos de información oculta es más que un truco de salón. Las técnicas para razonar sobre el Estado privado de un oponente sustentan aplicaciones reales donde la información está incompleta: sistemas de negociación, ciberseguridad, modelos económicos y coordinación de múltiples agentes, por nombrar algunas.
El ángulo de la eficiencia puede resultar la parte más influyente de la historia. Un laboratorio de vanguardia dedicó meses de computación a este problema en 2022; un equipo académico replicó y superó el resultado para aproximadamente el precio de un automóvil usado en 2026. A medida que la investigación en IA se convierte en sinónimo de presupuestos informáticos masivos, Ataraxos es un recordatorio de que las ideas algorítmicas (en este caso, un modelo de creencias que controla un enorme espacio de búsqueda) todavía pueden importar más que la escala bruta.
El artículo del equipo describe una máquina que mantiene la calma en condiciones de incertidumbre, ignora el conocimiento que un humano no podría ignorar y fanfarronea mejor que los mejores del mundo. Esas son habilidades útiles, dentro y fuera del tablero.
---
Mantente al Día con la IALas últimas noticias, análisis y avances de inteligencia artificial, en un solo lugar.
Leer más noticias de IA →