Ett AI-system har äntligen erövrat Stratego, det klassiska brädspelet som störde maskiner i årtionden – och det gjorde det med en knapp budget. Ett team av forskare från Carnegie Mellon University, MIT, New York University och Stanford University byggde en AI som heter Ataraxos som besegrade Pim Niemeijer, allmänt ansedd som den bästa Stratego-spelaren genom tiderna, med en poäng på 15 matcher till 1 med fyra oavgjorda matcher, rapporterar Ars Technica.

Resultatet är mindre slående för resultatlinjen än för prislappen. Ataraxos tränade på bara 16 GPU:er i ungefär en vecka, plus fyra ytterligare GPU:er under fyra dagar för att träna en följeslagare modell - en körning enligt teamet kostade bara några tusen dollar. DeepMinds DeepNash, 2022-systemet som först väckte seriös AI-uppmärksamhet till spelet, tränades i två till tre månader på 1 024 av Googles specialiserade TPU-chips, en körning som Ataraxos-teamet uppskattar skulle kosta mellan $3 miljoner och $4,5 miljoner till 2025 års priser. For more context on this story, see our ongoing latest AI developments.

Varför Stratego störtade AI i årtionden

Deep Blue slog Garry Kasparov i schack 1997. AlphaGo besegrade Lee Sedol på Go 2016. Pokerbots har slagit proffs i flera år. Stratego höll ut — även mot DeepMinds betydande resurser.

Spelets svårighetsgrad kommer från dess ovanliga kombination av dold information, skala och längd. Varje spelare befaller 40 pjäser som representerar militära led, från en marskalk till en spion, plus bomber och en flagga. Du vinner genom att fånga motståndarens flagga. Din motståndare kan se var dina pjäser är, men inte vad de är. Identiteter avslöjas endast när två bitar kolliderar, och den svagare delen tas bort.

"I Stratego finns det 40 bitar på tavlan som kan vara i vilken ordning som helst," sa Gabriele Farina, en MIT-datavetare och medförfattare till studien, till Ars Technica. Det tillåter mer än en decillion möjliga inställningar – överväldigande de 1 326 möjliga händerna i Texas Hold'em, ett spel som datorer sprack för år sedan. Längden förvärrar problemet: "I schack varar spelet vanligtvis 40 drag, men i Stratego kan ett parti lätt vara i 2 000 drag," sa Farina.

Sedan blir det bluff. Att flytta en svag pjäs som om det vore en marskalk kan skrämma bort en motståndare, men bluffar för ofta och hot betyder ingenting; bluffa aldrig och du blir förutsägbar. Den balansgången är det som hindrade tidigare system som DeepNash från att nå toppen.

"Det är något väldigt utmärkande med Stratego, vilket är att det är en enorm mängd dold information som utspelar sig över en mycket lång tidsskala", säger Eugene Vinitsky, forskare vid NYU och en annan medförfattare.

Ett andra neuralt nätverk som gissar

Ataraxos lärde sig samma grundläggande sätt som DeepNash gjorde: genom att spela mot sig själv, totalt 163 miljoner spel, förstärka drag som ledde till vinster och dämpa de som inte gjorde det. Lagets första förbättring var hur mycket systemet anpassade sig efter varje match, eftersom dold information tenderar att skicka självspelsalgoritmer i cirklar. Ataraxos gjorde stora strategiändringar tidigt i träningen och allt mer försiktiga senare.

Det större genombrottet var något DeepNash aldrig hade: att tänka framåt före varje drag. Sökbaserad förfining före agerande är det som gjorde AlphaGo kraftfullt, men DeepMind kunde inte få det att fungera i Stratego eftersom sökutrymmet var för stort.

Lösningen var ett andra neuralt nätverk - en trosmodell, tränad att gissa motståndarens dolda bitar utifrån hur de hade rört sig. Istället för att iterera genom alla möjliga arrangemang, samplar Ataraxos rimliga, spelar ut kandidatdrag i varje och väljer baserat på resultaten. Huvudförfattaren Samuel Sokota och Farina skrev också en anpassad simulator som kör miljontals drag per sekund på grafikkort, vilket är hur ett akademiskt labb hade råd med träningskörningen. "I den skala som vi är i akademin har vi inte riktigt tillgång till ett helt fält av GPU: er," sa Farina.

Den mänskliga mästaren fick en tillbaka

Niemeijer, som innehar fyra världsmästerskap och har tillbringat mer än 600 veckor som världens topprankade spelare, spelade 20 onlinespel mot Ataraxos under tre veckor och tjänade $100 för varje vinst. Han visste att AI inte skulle anpassa sig till honom, vilket gav honom tid att leta efter svagheter. Han lyckades vinna exakt en gång.

Forskare säger att en enda förlust inte var ett fel. Bra Stratego kräver randomisering av din installation, så turen spelar alltid en roll. "Även en perfekt strategi, ibland kommer den bara att förlora," sa Farina.

Mänskliga spelare vid Stratego World Championship 2025 klarade sig mycket sämre: deltagare som utmanade Ataraxos vann bara 2 av 40 matcher. Boten förändrade till och med hur folk spelar, skev metagamet med ovanliga val som att stoppa in flaggan i ett hörn bakom bara två bomber - en sällan spelad uppsättning.

Systemets namn kommer från det antika grekiska ordet för lugn, och forskarna säger att kvaliteten visar sig i dess lek. Medan en människa kan spela vilt för att återhämta sig från ett underskott, arbetar Ataraxos sig tillbaka långsamt och metodiskt. "Vi skulle se hur boten "bluffar" sin väg tillbaka från två procents sannolikhet för seger, väldigt, väldigt slentrianmässigt, sa Vinitsky.

Vad det betyder bortom styrelsen

Att slå människor i spel med dold information är mer än ett salongstrick. Tekniker för att resonera om en motståndares privata stat stödjer verkliga tillämpningar där informationen är ofullständig – förhandlingssystem, cybersäkerhet, ekonomisk modellering och samordning av flera agenter, för att nämna några.

Effektivitetsvinkeln kan visa sig vara den mest inflytelserika delen av historien. Ett gränslabb tillbringade månader av beräkningar på detta problem 2022; ett akademiskt team replikerade och överträffade resultatet för ungefär priset på en begagnad bil 2026. När AI-forskning blir synonymt med massiva beräkningsbudgetar är Ataraxos en påminnelse om att algoritmiska idéer – här, en trosmodell som tämjer ett enormt sökutrymme – fortfarande kan ha mer betydelse än rå skala.

Teamets papper beskriver en maskin som förblir lugn under osäkerhet, ignorerar kunskap som en människa inte kan ignorera och bluffar bättre än de bästa i världen. Det är användbara färdigheter, både på tavlan och utanför den.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →