Ein KI-System hat endlich Stratego erobert, das klassische Brettspiel, das Maschinen jahrzehntelang überforderte – und das mit einem knappen Budget. Ein Forscherteam der Carnegie Mellon University, des MIT, der New York University und der Stanford University hat eine KI namens Ataraxos entwickelt, die Pim Niemeijer, der weithin als bester Stratego-Spieler aller Zeiten gilt, mit einem Ergebnis von 15 zu 1 und vier Unentschieden besiegte, berichtet Ars Technica.

Das Ergebnis fällt weniger durch die Punktzahl als vielmehr durch den Preis auf. Ataraxos trainierte etwa eine Woche lang auf nur 16 GPUs sowie vier Tage lang auf vier zusätzlichen GPUs, um ein Begleitmodell zu trainieren – ein Lauf, der laut Team nur ein paar tausend Dollar gekostet hat. DeepMinds DeepNash, das System aus dem Jahr 2022, das erstmals ernsthafte KI-Aufmerksamkeit auf das Spiel lenkte, wurde zwei bis drei Monate lang auf 1.024 von Googles speziellen TPU-Chips trainiert, ein Lauf, der nach Schätzungen des Ataraxos-Teams zu Preisen von 2025 zwischen 3 und 4,5 Millionen US-Dollar kosten würde. Weitere Informationen zu dieser Geschichte finden Sie in unserer mehr KI-Geschichten.

Warum Stratego die KI jahrzehntelang überlistete

Deep Blue besiegte Garry Kasparov im Schach im Jahr 1997. AlphaGo besiegte Lee Sedol im Go im Jahr 2016. Poker-Bots schlagen seit Jahren Profis. Stratego hielt durch – selbst gegen die beträchtlichen Ressourcen von DeepMind.

Der Schwierigkeitsgrad des Spiels ergibt sich aus der ungewöhnlichen Kombination aus versteckten Informationen, Umfang und Länge. Jeder Spieler befehligt 40 Figuren, die militärische Ränge repräsentieren, vom Marschall bis zum Spion, sowie Bomben und eine Flagge. Sie gewinnen, indem Sie die Flagge des Gegners erobern. Ihr Gegner kann sehen, wo Ihre Figuren sind, aber nicht, was sie sind. Identitäten werden erst enthüllt, wenn zwei Teile kollidieren und das schwächere Teil entfernt wird.

„In Stratego gibt es 40 Teile auf dem Brett, die in beliebiger Reihenfolge sein können“, sagte Gabriele Farina, MIT-Informatikerin und Co-Autorin der Studie, gegenüber Ars Technica. Das ermöglicht mehr als eine Zehnmilliarde mögliche Setups – was die 1.326 möglichen Hände bei Texas Hold'em, einem Spiel, das vor Jahren von Computern geknackt wurde, in den Schatten stellt. Die Länge verschärft das Problem: „Beim Schach dauert die Partie normalerweise 40 Züge, aber bei Stratego kann eine Partie leicht 2.000 Züge dauern“, sagte Farina.

Dann wird geblufft. Eine schwache Figur zu bewegen, als wäre sie ein Marschall, kann einen Gegner abschrecken, aber zu oft bluffen und Drohungen bedeuten nichts; Bluffen Sie niemals und Sie werden berechenbar. Dieser Balanceakt hat frühere Systeme wie DeepNash davon abgehalten, die Spitze zu erreichen.

„Das Besondere an Stratego ist, dass es sich um eine riesige Menge verborgener Informationen handelt, die sich über einen sehr langen Zeitraum entfalten“, sagte Eugene Vinitsky, Forscher an der NYU und weiterer Co-Autor.

Ein zweites neuronales Netzwerk, das errät

Ataraxos lernte auf die gleiche grundlegende Weise wie DeepNash: Indem es insgesamt 163 Millionen Spiele gegen sich selbst spielte, Züge verstärkte, die zu Siegen führten, und diejenigen dämpfte, die nicht zu Siegen führten. Die erste Verbesserung des Teams bestand darin, wie sehr sich das System nach jedem Spiel anpasste, da versteckte Informationen dazu neigen, Selbstspielalgorithmen im Kreis zu schicken. Ataraxos nahm zu Beginn des Trainings große und später immer vorsichtigere Strategieänderungen vor.

Der größere Durchbruch gelang DeepNash nie: vor jedem Schritt vorauszudenken. Die suchbasierte Verfeinerung vor dem Handeln hat AlphaGo leistungsstark gemacht, aber DeepMind konnte es in Stratego nicht zum Laufen bringen, weil der Suchraum zu groß war.

Die Lösung war ein zweites neuronales Netzwerk – ein Glaubensmodell, das darauf trainiert wurde, die verborgenen Figuren des Gegners anhand ihrer Bewegung zu erraten. Anstatt jede mögliche Anordnung zu durchlaufen, probiert Ataraxos plausible Varianten aus, spielt in jeder möglichen Variante mögliche Züge durch und wählt basierend auf den Ergebnissen eine Auswahl aus. Die Hauptautoren Samuel Sokota und Farina haben außerdem einen benutzerdefinierten Simulator geschrieben, der Millionen von Bewegungen pro Sekunde auf Grafikkarten ausführt, sodass sich ein akademisches Labor den Trainingslauf leisten könnte. „Bei unserem akademischen Maßstab haben wir nicht wirklich Zugang zu einem ganzen Bereich von GPUs“, sagte Farina.

Der menschliche Champion hat einen zurückbekommen

Niemeijer, der viermal Weltmeister ist und mehr als 600 Wochen lang der weltbeste Spieler war, bestritt drei Wochen lang 20 Online-Spiele gegen Ataraxos und verdiente 100 US-Dollar für jeden Sieg. Er wusste, dass sich die KI nicht an ihn anpassen würde, was ihm Zeit gab, nach Schwächen zu suchen. Er konnte genau einmal gewinnen.

Forscher sagen, dass ein einzelner Verlust kein Fehler war. Gutes Stratego erfordert eine zufällige Aufstellung, daher spielt Glück immer eine Rolle. „Selbst eine perfekte Strategie verliert manchmal einfach“, sagte Farina.

Menschliche Spieler schnitten bei der Stratego-Weltmeisterschaft 2025 weitaus schlechter ab: Teilnehmer, die Ataraxos herausforderten, gewannen nur zwei von 40 Spielen. Der Bot veränderte sogar die Art und Weise, wie die Leute spielten, indem er das Metaspiel mit ungewöhnlichen Entscheidungen verzerrte, etwa indem er seine Flagge in eine Ecke hinter nur zwei Bomben steckte – ein selten gespieltes Setup.

Der Name des Systems leitet sich vom altgriechischen Wort für Ruhe ab, und die Forscher sagen, dass sich Qualität in seinem Spiel zeigt. Während ein Mensch wild darauf setzt, sich von einem Defizit zu erholen, arbeitet sich Ataraxos langsam und methodisch wieder zurück. „Wir würden zusehen, wie sich der Bot von einer Siegeswahrscheinlichkeit von etwa zwei Prozent ‚bluffen‘ würde, sehr, sehr beiläufig“, sagte Vinitsky.

Was es über die Tafel hinaus bedeutet

Menschen bei Spielen mit versteckten Informationen zu besiegen, ist mehr als ein Salontrick. Techniken zur Schlussfolgerung über den Privatstaat eines Gegners sind die Grundlage für reale Anwendungen, bei denen die Informationen unvollständig sind – Verhandlungssysteme, Cybersicherheit, Wirtschaftsmodellierung und Multi-Agenten-Koordination, um nur einige zu nennen.

Der Effizienzaspekt könnte sich als der einflussreichste Teil der Geschichte erweisen. Ein Grenzlabor verbrachte im Jahr 2022 monatelange Berechnungen mit diesem Problem. Ein akademisches Team hat das Ergebnis repliziert und übertroffen, und zwar für ungefähr den Preis eines Gebrauchtwagens im Jahr 2026. Da KI-Forschung zum Synonym für enorme Rechenbudgets wird, erinnert Ataraxos daran, dass algorithmische Ideen – hier ein Glaubensmodell, das einen riesigen Suchraum zähmt – immer noch wichtiger sein können als reine Skalierung.

Das Papier des Teams beschreibt eine Maschine, die trotz Unsicherheit ruhig bleibt, Wissen ignoriert, das ein Mensch nicht ignorieren kann, und besser blufft als die Besten der Welt. Das sind nützliche Fähigkeiten, auf und neben dem Brett.

---

Bleib vorne bei KI

Die neuesten KI-Nachrichten, Analysen und Durchbrüche – alles an einem Ort.

Mehr KI-Nachrichten lesen →