Un sistem AI a cucerit în sfârșit Stratego, jocul clasic de masă care a zăpăcit mașinile timp de decenii - și a făcut-o cu un buget redus. O echipă de cercetători de la Carnegie Mellon University, MIT, New York University și Stanford University a construit un AI numit Ataraxos care l-a învins pe Pim Niemeijer, considerat cel mai bun jucător Stratego al tuturor timpurilor, cu un scor de 15 meciuri la 1 cu patru egaluri, relatează Ars Technica.

Rezultatul este mai puțin izbitor pentru scor decât pentru preț. Ataraxos s-a antrenat pe doar 16 GPU-uri timp de aproximativ o săptămână, plus patru GPU-uri suplimentare timp de patru zile pentru a antrena un model însoțitor - o cursă despre care echipa spune că a costat doar câteva mii de dolari. DeepNash de la DeepMind, sistemul din 2022 care a atras pentru prima dată atenția AI serioasă asupra jocului, a fost antrenat timp de două până la trei luni pe 1.024 de cipuri TPU specializate de la Google, o rulare estimată de echipa Ataraxos că ar costa între 3 și 4,5 milioane de dolari la prețurile din 2025. For more context on this story, see our ongoing AI news.

De ce Stratego a uimit AI timp de zeci de ani

Deep Blue l-a învins pe Garry Kasparov la șah în 1997. AlphaGo l-a învins pe Lee Sedol la Go în 2016. Boții de poker au învins profesioniștii de ani de zile. Stratego a rezistat – chiar și împotriva resurselor considerabile ale DeepMind.

Dificultatea jocului vine din combinația sa neobișnuită de informații ascunse, scară și lungime. Fiecare jucător comandă 40 de piese reprezentând gradele militare, de la un mareșal până la un spion, plus bombe și un steag. Câștigi prin capturarea steagul adversarului. Adversarul tău poate vedea unde sunt piesele tale, dar nu care sunt. Identitățile sunt dezvăluite numai atunci când două piese se ciocnesc, iar piesa mai slabă este îndepărtată.

„În Stratego, există 40 de piese pe placă care ar putea fi în orice ordine”, a declarat Gabriele Farina, un informatician al MIT și coautor al studiului, pentru Ars Technica. Acest lucru permite mai mult de un decilion de configurații posibile - micșorând cele 1.326 de mâini posibile în Texas Hold'em, un joc de computere spart cu ani în urmă. Lungimea agravează problema: „În șah, jocul durează de obicei 40 de mutări, dar în Stratego, un joc poate dura cu ușurință 2.000 de mutări”, a spus Farina.

Apoi există cacealma. Mutarea unei piese slabe ca și cum ar fi un mareșal poate speria un adversar, dar blufează prea des și amenințările nu înseamnă nimic; nu blufează niciodată și devii previzibil. Acest act de echilibrare este ceea ce a împiedicat sistemele anterioare precum DeepNash să ajungă la vârf.

„Există ceva foarte distinctiv la Stratego, și anume că este o cantitate masivă de informații ascunse care se desfășoară pe o scară de timp foarte lungă”, a spus Eugene Vinitsky, cercetător la NYU și un alt coautor.

O a doua rețea neuronală care presupune

Ataraxos a învățat același mod de bază în care a făcut-o DeepNash: jucând împotriva lui însuși, 163 de milioane de jocuri în total, consolidând mișcările care au dus la câștiguri și atenuând cele care nu au făcut-o. Prima îmbunătățire a echipei a fost cât de mult s-a ajustat sistemul după fiecare joc, deoarece informațiile ascunse au tendința de a trimite algoritmi de auto-play în cercuri. Ataraxos a făcut schimbări mari de strategie la începutul antrenamentului și din ce în ce mai atent mai târziu.

Descoperirea mai mare a fost ceva ce DeepNash nu a avut niciodată: gândirea înainte de fiecare mișcare. Rafinamentul bazat pe căutare înainte de a acționa este ceea ce a făcut ca AlphaGo să fie puternic, dar DeepMind nu l-a putut face să funcționeze în Stratego, deoarece spațiul de căutare era prea vast.

Soluția a fost o a doua rețea neuronală - un model de credință, antrenat să ghicească piesele ascunse ale adversarului din modul în care se mișcaseră. În loc să repete toate aranjamentele posibile, Ataraxos prelevează cele plauzibile, redă mișcările candidate în fiecare și alege în funcție de rezultate. Autorul principal, Samuel Sokota și Farina, au scris, de asemenea, un simulator personalizat care rulează milioane de mișcări pe secundă pe plăcile grafice, așa că un laborator academic și-ar putea permite cursul de antrenament. „La scara în care suntem în mediul academic, nu avem cu adevărat acces la un întreg domeniu de GPU”, a spus Farina.

Campionul uman a primit unul înapoi

Niemeijer, care deține patru campionate mondiale și a petrecut peste 600 de săptămâni ca jucător de top din lume, a jucat 20 de meciuri online împotriva lui Ataraxos timp de trei săptămâni, câștigând 100 de dolari pentru fiecare victorie. Știa că AI nu se va adapta la el, dându-i timp să vâneze punctele slabe. A reușit să câștige exact o dată.

Cercetătorii spun că o singură pierdere nu a fost un defect. Bunul Stratego necesită randomizarea configurației, așa că norocul joacă întotdeauna un rol important. „Chiar și o strategie perfectă, uneori doar va pierde”, a spus Farina.

Jucătorii umani de la Campionatul Mondial Stratego din 2025 s-au descurcat mult mai rău: participanții care l-au provocat pe Ataraxos au câștigat doar 2 din 40 de jocuri. Botul a schimbat chiar și modul în care se joacă oamenii, modificând metajocul cu opțiuni neobișnuite, cum ar fi steagul său într-un colț în spatele a doar două bombe - o configurație jucată rar.

Numele sistemului provine de la cuvântul grecesc antic pentru calm, iar cercetătorii spun că calitatea se vede în jocul său. În timp ce un om ar putea paria sălbatic pentru a-și reveni dintr-un deficit, Ataraxos își întoarce încet și metodic. „Ne-am uita pe bot „cacealma” cum se întoarce de la o probabilitate de victorie de două procente, foarte, foarte lejer”, a spus Vinitsky.

Ce înseamnă dincolo de consiliu

A bate oameni la jocuri cu informații ascunse este mai mult decât un truc de salon. Tehnicile de raționament despre statul privat al oponentului stau la baza aplicațiilor reale în care informațiile sunt incomplete — sisteme de negociere, securitate cibernetică, modelare economică și coordonare multi-agenți, pentru a numi câteva.

Unghiul de eficiență se poate dovedi cea mai influentă parte a poveștii. Un laborator de frontieră a petrecut luni de calcul pe această problemă în 2022; o echipă academică a replicat și a depășit rezultatul pentru aproximativ prețul unei mașini second hand în 2026. Pe măsură ce cercetarea AI devine sinonimă cu bugete masive de calcul, Ataraxos este un memento că ideile algoritmice - aici, un model de credință care îmblânzește un spațiu uriaș de căutare - pot încă conta mai mult decât scara brută.

Lucrarea echipei descrie o mașină care rămâne calmă în condiții de incertitudine, ignoră cunoștințele pe care un om nu le poate ignora și blufează mai bine decât cei mai buni din lume. Acestea sunt abilități utile, la bord și în afara ei.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →