Een AI-systeem heeft eindelijk Stratego veroverd, het klassieke bordspel dat machines tientallen jaren lang heeft geplaagd – en dat met een klein budget. Een team van onderzoekers van Carnegie Mellon University, MIT, New York University en Stanford University bouwde een AI genaamd Ataraxos die Pim Niemeijer, algemeen beschouwd als de beste Stratego-speler aller tijden, versloeg met een score van 15 games tegen 1 met vier gelijke spelen, meldt Ars Technica.

Het resultaat is minder opvallend voor de score dan voor het prijskaartje. Ataraxos trainde ongeveer een week op slechts 16 GPU's, plus vier extra GPU's gedurende vier dagen om een ​​begeleidend model te trainen - een run die volgens het team slechts een paar duizend dollar kostte. DeepMind's DeepNash, het systeem uit 2022 dat voor het eerst serieuze AI-aandacht op het spel bracht, trainde twee tot drie maanden op 1.024 van de gespecialiseerde TPU-chips van Google, een run die volgens het Ataraxos-team tussen de $ 3 miljoen en $ 4,5 miljoen zou kosten tegen prijzen van 2025. Voor meer context over dit verhaal, zie ons AI-trends.

Waarom Stratego decennia lang tegen AI heeft gestreden

Deep Blue versloeg Garry Kasparov met schaken in 1997. AlphaGo versloeg Lee Sedol met Go in 2016. Pokerbots verslaan al jaren professionals. Stratego hield stand – zelfs ondanks de aanzienlijke middelen van DeepMind.

De moeilijkheidsgraad van het spel komt voort uit de ongebruikelijke combinatie van verborgen informatie, schaal en lengte. Elke speler bestuurt 40 stukken die militaire rangen vertegenwoordigen, van maarschalk tot spion, plus bommen en een vlag. Je wint door de vlag van de tegenstander te veroveren. Je tegenstander kan zien waar je stukken zijn, maar niet wat ze zijn. Identiteiten worden alleen onthuld als twee stukken botsen en het zwakkere stuk wordt verwijderd.

"In Stratego zijn er 40 stukken op het bord die in elke volgorde kunnen staan", vertelde Gabriele Farina, een MIT-computerwetenschapper en co-auteur van de studie, aan Ars Technica. Dat maakt meer dan een deciljoen mogelijke opstellingen mogelijk – wat de 1.326 mogelijke handen in Texas Hold'em, een spelcomputer die jaren geleden werd gekraakt, in de schaduw stelt. Lengte maakt het probleem nog groter: "Bij schaken duurt het spel meestal 40 zetten, maar bij Stratego kan een spel gemakkelijk 2.000 zetten duren", zei Farina.

Dan is er sprake van bluffen. Het verplaatsen van een zwak stuk alsof het een maarschalk is, kan een tegenstander afschrikken, maar te vaak bluffen en dreigementen betekenen niets; bluf nooit en je wordt voorspelbaar. Die evenwichtsoefening heeft ervoor gezorgd dat eerdere systemen zoals DeepNash de top niet bereikten.

"Er is iets super onderscheidends aan Stratego, namelijk dat het een enorme hoeveelheid verborgen informatie is die zich over een zeer lange tijdschaal ontvouwt", zegt Eugene Vinitsky, een onderzoeker aan NYU en een andere co-auteur.

Een tweede neuraal netwerk dat raadt

Ataraxos leerde op dezelfde manier als DeepNash: door tegen zichzelf te spelen, in totaal 163 miljoen games, waarbij hij zetten versterkte die tot overwinningen leidden en bewegingen die dat niet deden, dempte. De eerste verbetering van het team was de mate waarin het systeem zich na elke game aanpaste, omdat verborgen informatie de neiging heeft om zelfspelende algoritmen in cirkels te sturen. Ataraxos voerde al vroeg in de training grote strategiewijzigingen door en later steeds voorzichtiger.

De grotere doorbraak was iets wat DeepNash nooit heeft gehad: vooruitdenken voor elke zet. Zoekgebaseerde verfijning vóór actie maakte AlphaGo krachtig, maar DeepMind kon het niet laten werken in Stratego omdat de zoekruimte te groot was.

De oplossing was een tweede neuraal netwerk: een geloofsmodel, getraind om de verborgen stukken van de tegenstander te raden op basis van de manier waarop ze bewogen. In plaats van alle mogelijke arrangementen te herhalen, proeft Ataraxos plausibele arrangementen, speelt kandidaat-zetten in elk arrangement uit en kiest op basis van de uitkomsten. Hoofdauteur Samuel Sokota en Farina schreven ook een aangepaste simulator die miljoenen bewegingen per seconde uitvoert op grafische kaarten, waarmee een academisch laboratorium de trainingsrun kon betalen. "Op de schaal waarop we ons in de academische wereld bevinden, hebben we niet echt toegang tot een heel veld aan GPU's", zei Farina.

De menselijke kampioen heeft er één terug

Niemeijer, die vier wereldkampioenschappen op zijn naam heeft staan en al meer dan 600 weken de beste speler ter wereld is, speelde in drie weken tijd twintig online wedstrijden tegen Ataraxos en verdiende $ 100 voor elke overwinning. Hij wist dat de AI zich niet aan hem zou aanpassen, waardoor hij de tijd zou krijgen om op zwakke punten te jagen. Hij wist precies één keer te winnen.

Onderzoekers zeggen dat een enkel verlies geen fout was. Voor een goede Stratego is een willekeurige opstelling nodig, dus geluk speelt altijd een rol. "Zelfs een perfecte strategie zal soms gewoon verliezen", zei Farina.

Menselijke spelers op het Stratego Wereldkampioenschap van 2025 deden het veel slechter: bezoekers die Ataraxos uitdaagden, wonnen slechts 2 van de 40 wedstrijden. De bot veranderde zelfs de manier waarop mensen spelen, door de metagame scheef te trekken met ongebruikelijke keuzes, zoals het in een hoek plaatsen van slechts twee bommen – een opstelling die zelden wordt gespeeld.

De naam van het systeem komt van het oud-Griekse woord voor kalmte, en de onderzoekers zeggen dat kwaliteit terug te zien is in het spel. Terwijl een mens wild kan gokken om van een tekort te herstellen, werkt Ataraxos zich langzaam en methodisch een weg terug. "We zouden de bot heel, heel terloops zien 'bluffen' vanaf een overwinningskans van ongeveer twee procent," zei Vinitsky.

Wat het betekent buiten het bord

Mensen verslaan bij spelletjes met verborgen informatie is meer dan een huiskamertruc. Technieken voor het redeneren over de privéstaat van een tegenstander liggen ten grondslag aan echte toepassingen waarbij de informatie onvolledig is: onderhandelingssystemen, cyberveiligheid, economische modellen en coördinatie tussen meerdere agenten, om er maar een paar te noemen.

De efficiëntie-invalshoek zou wel eens het meest invloedrijke deel van het verhaal kunnen blijken. Een grenslaboratorium heeft in 2022 maandenlang aan dit probleem gewerkt; een academisch team repliceerde en overtrof het resultaat voor ongeveer de prijs van een gebruikte auto in 2026. Nu AI-onderzoek synoniem wordt met enorme rekenbudgetten, herinnert Ataraxos ons eraan dat algoritmische ideeën – hier een geloofsmodel dat een enorme zoekruimte temt – nog steeds belangrijker kunnen zijn dan de ruwe schaal.

Het artikel van het team beschrijft een machine die kalm blijft onder onzekerheid, kennis negeert die een mens niet kan negeren, en beter bluft dan de beste ter wereld. Dat zijn nuttige vaardigheden, zowel op het bord als daarbuiten.

---

Blijf Voorop met AI

Het laatste AI-nieuws, analyses en doorbraken — allemaal op één plek.

Lees meer AI-nieuws →