Systém umělé inteligence si konečně podmanil Stratego, klasickou deskovou hru, která po celá desetiletí brzdila stroje – a dokázala to s omezeným rozpočtem. Tým výzkumníků z Carnegie Mellon University, MIT, New York University a Stanford University vytvořil AI nazvanou Ataraxos, která porazila Pima Niemeijera, obecně považovaného za nejlepšího hráče Stratego všech dob, skóre 15 zápasů ku 1 se čtyřmi remízami, uvádí Ars Technica.
Výsledek je ohromující méně pro skóre než pro cenovku. Ataraxos trénoval na pouhých 16 GPU po dobu asi jednoho týdne plus čtyři další GPU po dobu čtyř dnů pro trénování doprovodného modelu – běh podle týmu stál jen pár tisíc dolarů. DeepNash společnosti DeepMind, systém z roku 2022, který do hry poprvé přivedl seriózní pozornost AI, byl trénován dva až tři měsíce na 1 024 specializovaných čipech TPU od Googlu, přičemž podle odhadů týmu Ataraxos by cena v roce 2025 stála mezi 3 miliony a 4,5 miliony dolarů. For more context on this story, see our ongoing artificial intelligence updates.
Proč Stratego po celá desetiletí drželo umělou inteligenci
Deep Blue porazil Garryho Kasparova v šachu v roce 1997. AlphaGo porazil Lee Sedol na Go v roce 2016. Pokeroví roboti porážejí profesionály už roky. Stratego obstálo – dokonce i proti značným zdrojům DeepMind.
Obtížnost hry vychází z neobvyklé kombinace skrytých informací, rozsahu a délky. Každý hráč ovládá 40 figurek představujících vojenské hodnosti, od maršála až po špióna, plus bomby a vlajku. Vyhrajete obsazením soupeřovy vlajky. Váš protivník vidí, kde jsou vaše figurky, ale ne jaké jsou. Identity jsou odhaleny pouze tehdy, když se dva kusy srazí a slabší kus je odstraněn.
"Ve Stratego je na desce 40 kusů, které mohou být v libovolném pořadí," řekl Ars Technica Gabriele Farina, počítačový vědec z MIT a spoluautor studie. To umožňuje více než decilion možných nastavení – převyšuje 1 326 možných hand v Texas Hold'em, herním počítači, který byl před lety prolomený. Délka problém zhoršuje: "V šachu hra obvykle trvá 40 tahů, ale ve Strategu může hra klidně trvat 2000 tahů," řekl Farina.
Pak je tu blafování. Pohyb slabé figurky, jako by to byl maršál, může protivníka vyděsit, ale příliš často blafujte a hrozby nic neznamenají; nikdy neblafujte a stanete se předvídatelnými. Tento akt vyvažování brání dřívějším systémům jako DeepNash dosáhnout vrcholu.
"Stratego má něco velmi zvláštního, a to, že je to obrovské množství skrytých informací, které se odhalují ve velmi dlouhém časovém měřítku," řekl Eugene Vinitsky, výzkumník z NYU a další spoluautor.
Druhá neuronová síť, která hádá
Ataraxos se naučil stejným základním způsobem jako DeepNash: hraním proti sobě, celkem 163 milionů her, posilováním tahů, které vedly k výhrám, a tlumením těch, které ne. První vylepšení týmu spočívalo v tom, jak moc se systém přizpůsobil po každé hře, protože skryté informace mají tendenci posílat algoritmy pro samočinné hraní v kruzích. Ataraxos provedl velké změny strategie na začátku tréninku a později byly stále opatrnější.
Větším průlomem bylo něco, co DeepNash nikdy neměl: myslet dopředu před každým pohybem. Upřesnění založené na vyhledávání před provedením akce je to, co učinilo AlphaGo mocným, ale DeepMind nemohl zprovoznit jeho fungování ve Strategu, protože vyhledávací prostor byl příliš rozsáhlý.
Řešením byla druhá neuronová síť – model víry, vycvičený k tomu, aby odhadl skryté části protivníka podle toho, jak se pohybovaly. Místo toho, aby procházel všemi možnými uspořádáními, Ataraxos vzorkuje věrohodná, v každém rozehraje tahy kandidátů a vybírá na základě výsledků. Vedoucí autor Samuel Sokota a Farina také napsali vlastní simulátor, který spouští miliony pohybů za sekundu na grafických kartách, což je způsob, jak si akademická laboratoř může dovolit trénink. "V takovém měřítku, v jakém jsme na akademické půdě, nemáme skutečně přístup k celé oblasti GPU," řekl Farina.
Human Champion dostal jeden zpět
Niemeijer, který je držitelem čtyř světových šampionátů a strávil více než 600 týdnů jako nejlepší světový hráč, odehrál během tří týdnů 20 online her proti Ataraxosu a za každé vítězství vydělal 100 dolarů. Věděl, že AI se mu nepřizpůsobí a dá mu čas na hledání slabin. Podařilo se mu vyhrát přesně jednou.
Výzkumníci říkají, že jediná ztráta nebyla chyba. Good Stratego vyžaduje randomizaci vašeho nastavení, takže vždy hraje roli štěstí. "I dokonalá strategie někdy prostě prohraje," řekl Farina.
Lidští hráči na Mistrovství světa Stratego 2025 dopadli mnohem hůř: účastníci, kteří vyzvali Ataraxos, vyhráli pouze 2 ze 40 her. Bot dokonce změnil způsob, jakým lidé hrají, zkreslil metahru neobvyklými možnostmi, jako je zastrčení vlajky do rohu za pouhé dvě bomby – zřídkakdy hrané nastavení.
Název systému pochází ze starořeckého slova pro klid a podle vědců se v jeho hře projevuje kvalita. Zatímco člověk může divoce hazardovat, aby se zotavil z deficitu, Ataraxos se vrací pomalu a metodicky. "Sledovali bychom, jak bot 'blafuje' na cestu zpět z dvouprocentní pravděpodobnosti vítězství, velmi, velmi náhodně," řekl Vinitsky.
Co to znamená za hranicí rady
Bití lidí ve hrách se skrytými informacemi je víc než jen trik v salonu. Techniky uvažování o soukromém stavu protivníka jsou základem skutečných aplikací, kde jsou informace neúplné – vyjednávací systémy, kybernetická bezpečnost, ekonomické modelování a koordinace více agentů, abychom jmenovali alespoň některé.
Úhel účinnosti se může ukázat jako nejvlivnější část příběhu. Hraniční laboratoř strávila měsíce výpočtů na tomto problému v roce 2022; akademický tým replikoval a překonal výsledek zhruba za cenu ojetého vozu v roce 2026. Jak se výzkum umělé inteligence stává synonymem pro masivní výpočetní rozpočty, Ataraxos je připomínkou toho, že algoritmické nápady – zde model víry, který krotí obrovský prostor pro vyhledávání – mohou stále záležet více než na hrubém měřítku.
Práce týmu popisuje stroj, který zůstává v nejistotě klidný, ignoruje znalosti, které člověk nemůže ignorovat, a blafuje lépe než ti nejlepší na světě. To jsou užitečné dovednosti na palubě i mimo ni.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →