Un système d’IA a finalement conquis Stratego, le jeu de société classique qui a déconcerté les machines pendant des décennies – et il l’a fait avec un budget restreint. Une équipe de chercheurs de l'Université Carnegie Mellon, du MIT, de l'Université de New York et de l'Université de Stanford a construit une IA appelée Ataraxos qui a battu Pim Niemeijer, largement considéré comme le meilleur joueur de Stratego de tous les temps, par un score de 15 matchs à 1 avec quatre nuls, rapporte Ars Technica.

Le résultat est moins frappant par le score que par le prix. Ataraxos s'est entraîné sur seulement 16 GPU pendant environ une semaine, plus quatre GPU supplémentaires pendant quatre jours pour former un modèle compagnon – une exécution qui, selon l'équipe, ne coûte que quelques milliers de dollars. DeepNash de DeepMind, le système de 2022 qui a pour la première fois attiré l'attention sur l'IA sur le jeu, s'est entraîné pendant deux à trois mois sur 1 024 puces TPU spécialisées de Google, une exécution que l'équipe d'Ataraxos estime coûterait entre 3 et 4,5 millions de dollars aux prix de 2025. Pour plus de contexte sur cette histoire, consultez notre tendances IA.

Pourquoi Stratego a bloqué l'IA pendant des décennies

Deep Blue a battu Garry Kasparov aux échecs en 1997. AlphaGo a battu Lee Sedol au Go en 2016. Les robots de poker battent les professionnels depuis des années. Stratego a résisté, même face aux ressources considérables de DeepMind.

La difficulté du jeu vient de sa combinaison inhabituelle d'informations cachées, d'échelle et de longueur. Chaque joueur commande 40 pièces représentant les grades militaires, du maréchal à l'espion, en passant par des bombes et un drapeau. Vous gagnez en capturant le drapeau de l'adversaire. Votre adversaire peut voir où se trouvent vos pièces, mais pas ce qu'elles sont. Les identités ne sont révélées que lorsque deux pièces entrent en collision et la pièce la plus faible est supprimée.

"Dans Stratego, il y a 40 pièces sur le plateau qui peuvent être dans n'importe quel ordre", a déclaré à Ars Technica Gabriele Farina, informaticien du MIT et co-auteur de l'étude. Cela permet plus d'un décillion de configurations possibles, ce qui éclipse les 1 326 mains possibles au Texas Hold'em, un jeu informatique piraté il y a des années. La longueur aggrave le problème : « Aux échecs, une partie dure généralement 40 coups, mais à Stratego, une partie peut facilement durer 2 000 coups », a déclaré Farina.

Ensuite, il y a le bluff. Déplacer une pièce faible comme s'il s'agissait d'un maréchal peut effrayer un adversaire, mais bluffer trop souvent et les menaces ne veulent rien dire ; ne bluffez jamais et vous devenez prévisible. Cet équilibre est ce qui a empêché les systèmes antérieurs comme DeepNash d’atteindre le sommet.

"Il y a quelque chose de très distinctif à propos de Stratego, c'est qu'il s'agit d'une quantité massive d'informations cachées qui se dévoilent sur une très longue échelle de temps", a déclaré Eugene Vinitsky, chercheur à NYU et autre co-auteur.

Un deuxième réseau de neurones qui devine

Ataraxos a appris de la même manière que DeepNash : en jouant contre lui-même, 163 millions de parties au total, en renforçant les mouvements qui ont conduit à des victoires et en atténuant ceux qui n'ont pas abouti. La première amélioration apportée par l'équipe a été l'ajustement du système après chaque partie, car les informations cachées ont tendance à faire tourner en rond les algorithmes d'auto-jeu. Ataraxos a apporté d'importants changements de stratégie au début de l'entraînement et des changements de plus en plus prudents plus tard.

La plus grande avancée a été quelque chose que DeepNash n'a jamais eu : anticiper avant chaque mouvement. Le raffinement basé sur la recherche avant d'agir est ce qui a rendu AlphaGo puissant, mais DeepMind n'a pas pu le faire fonctionner dans Stratego car l'espace de recherche était trop vaste.

La solution était un deuxième réseau neuronal – un modèle de croyance, entraîné pour deviner les pièces cachées de l'adversaire à partir de la façon dont il se déplaçait. Au lieu de parcourir tous les arrangements possibles, Ataraxos échantillonne les arrangements plausibles, joue les mouvements candidats dans chacun et choisit en fonction des résultats. Les auteurs principaux Samuel Sokota et Farina ont également écrit un simulateur personnalisé qui exécute des millions de mouvements par seconde sur des cartes graphiques, ce qui permet à un laboratoire universitaire de se permettre une formation. "A l'échelle où nous sommes dans le monde universitaire, nous n'avons pas vraiment accès à tout un domaine de GPU", a déclaré Farina.

Le champion humain en a récupéré un

Niemeijer, qui détient quatre championnats du monde et a passé plus de 600 semaines en tant que joueur le mieux classé au monde, a disputé 20 matchs en ligne contre Ataraxos pendant trois semaines, gagnant 100 $ pour chaque victoire. Il savait que l’IA ne s’adapterait pas à lui, ce qui lui laisserait le temps de rechercher ses faiblesses. Il a réussi à gagner exactement une fois.

Les chercheurs affirment qu’une seule perte n’était pas un défaut. Un bon Stratego nécessite de randomiser votre configuration, donc la chance joue toujours un rôle. "Même avec une stratégie parfaite, il arrive parfois qu'elle perde", a déclaré Farina.

Les joueurs humains du Championnat du monde Stratego 2025 ont connu un sort bien pire : les participants qui ont défié Ataraxos n'ont remporté que 2 des 40 matchs. Le bot a même changé la façon dont les gens jouent, faussant le méta-jeu avec des choix inhabituels, comme placer son drapeau dans un coin derrière seulement deux bombes – une configuration rarement jouée.

Le nom du système vient du grec ancien signifiant calme, et les chercheurs affirment que la qualité se voit dans son jeu. Alors qu'un humain peut jouer énormément pour se remettre d'un déficit, Ataraxos revient lentement et méthodiquement. "Nous regardions le bot 'bluff' revenir avec une probabilité de victoire d'environ deux pour cent, de manière très, très décontractée", a déclaré Vinitsky.

Ce que cela signifie au-delà du conseil d'administration

Battre des humains dans des jeux d'informations cachées est plus qu'un tour de passe-passe. Les techniques de raisonnement sur l’État privé d’un adversaire sous-tendent des applications réelles où l’information est incomplète : systèmes de négociation, cybersécurité, modélisation économique et coordination multi-agents, pour n’en citer que quelques-unes.

L’aspect efficacité pourrait s’avérer la partie la plus influente de l’histoire. Un laboratoire frontalier a passé des mois à calculer ce problème en 2022 ; une équipe universitaire a reproduit et dépassé le résultat pour à peu près le prix d’une voiture d’occasion en 2026. Alors que la recherche sur l’IA devient synonyme de budgets de calcul massifs, Ataraxos rappelle que les idées algorithmiques – ici, un modèle de croyance qui apprivoise un immense espace de recherche – peuvent encore avoir plus d’importance que l’échelle brute.

L'article de l'équipe décrit une machine qui reste calme dans l'incertitude, ignore les connaissances qu'un humain ne peut ignorer et bluffe mieux que les meilleurs au monde. Ce sont des compétences utiles, au sein du conseil d’administration et en dehors.

---

Restez à la Pointe de l'IA

Les dernières actualités, analyses et percées en IA — au même endroit.

Lire plus d'actualités IA →