Un sistema di intelligenza artificiale ha finalmente conquistato Stratego, il classico gioco da tavolo che ha lasciato perplessi i computer per decenni, e lo ha fatto con un budget ridotto. Un team di ricercatori della Carnegie Mellon University, del MIT, della New York University e della Stanford University ha costruito un'intelligenza artificiale chiamata Ataraxos che ha sconfitto Pim Niemeijer, ampiamente considerato il miglior giocatore di Stratego di tutti i tempi, con un punteggio di 15 partite a 1 con quattro pareggi, riferisce Ars Technica.
Il risultato colpisce meno per il punteggio che per il prezzo. Ataraxos si è allenato con sole 16 GPU per circa una settimana, più quattro GPU aggiuntive per quattro giorni per addestrare un modello complementare: una corsa che, secondo il team, è costata solo poche migliaia di dollari. DeepNash di DeepMind, il sistema del 2022 che per primo ha portato una seria attenzione dell'intelligenza artificiale al gioco, si è addestrato per due o tre mesi su 1.024 chip TPU specializzati di Google, una corsa che, secondo le stime del team Ataraxos, costerebbe tra i 3 e i 4,5 milioni di dollari ai prezzi del 2025. Per maggiori informazioni su questa storia, consulta la nostra ultimi sviluppi nell'IA.
Perché Stratego ha bloccato l'intelligenza artificiale per decenni
Deep Blue ha battuto Garry Kasparov a scacchi nel 1997. AlphaGo ha sconfitto Lee Sedol a Go nel 2016. I robot del poker hanno battuto i professionisti per anni. Stratego ha resistito, anche contro le considerevoli risorse di DeepMind.
La difficoltà del gioco deriva dalla sua insolita combinazione di informazioni nascoste, scala e lunghezza. Ogni giocatore comanda 40 pezzi che rappresentano i gradi militari, da un maresciallo fino a una spia, oltre a bombe e una bandiera. Vinci catturando la bandiera dell'avversario. Il tuo avversario può vedere dove sono i tuoi pezzi, ma non cosa sono. Le identità vengono rivelate solo quando due pezzi si scontrano e il pezzo più debole viene rimosso.
"In Stratego, ci sono 40 pezzi sulla scacchiera che potrebbero essere in qualsiasi ordine", ha detto ad Ars Technica Gabriele Farina, informatico del MIT e coautore dello studio. Ciò consente più di un decilione di possibili setup, facendo impallidire le 1.326 mani possibili nel Texas Hold'em, un gioco che i computer hanno scoperto anni fa. La lunghezza aggrava il problema: "Negli scacchi, di solito la partita dura 40 mosse, ma in Stratego, una partita può facilmente durare 2.000 mosse", ha detto Farina.
Poi c'è il bluff. Muovere un pezzo debole come se fosse un maresciallo può spaventare un avversario, ma bluffare troppo spesso e le minacce non significano nulla; non bluffare mai e diventerai prevedibile. Questo atto di bilanciamento è ciò che ha impedito ai sistemi precedenti come DeepNash di raggiungere la vetta.
"C'è qualcosa di estremamente distintivo in Stratego, ovvero che si tratta di un'enorme quantità di informazioni nascoste che si sviluppano su una scala temporale molto lunga", ha affermato Eugene Vinitsky, ricercatore della New York University e altro coautore.
Una seconda rete neurale che indovina
Ataraxos ha imparato allo stesso modo di DeepNash: giocando contro se stesso, 163 milioni di partite in totale, rafforzando le mosse che hanno portato alla vittoria e smorzando quelle che non hanno portato a vittorie. Il primo miglioramento apportato dal team riguardava il modo in cui il sistema si adattava dopo ogni partita, perché le informazioni nascoste tendono a mandare in circolo algoritmi di auto-gioco. Ataraxos ha apportato grandi cambiamenti di strategia all'inizio dell'allenamento e sempre più attenti in seguito.
La svolta più grande è stata qualcosa che DeepNash non ha mai avuto: pensare al futuro prima di ogni mossa. Il perfezionamento basato sulla ricerca prima dell'azione è ciò che ha reso AlphaGo potente, ma DeepMind non è riuscito a farlo funzionare in Stratego perché lo spazio di ricerca era troppo vasto.
La soluzione era una seconda rete neurale, un modello di credenze, addestrato a indovinare i pezzi nascosti dell'avversario da come si erano mossi. Invece di ripetere ogni possibile disposizione, Ataraxos campiona quelle plausibili, mette in atto le mosse candidate in ciascuna e sceglie in base ai risultati. L'autore principale Samuel Sokota e Farina hanno anche scritto un simulatore personalizzato che esegue milioni di mosse al secondo su schede grafiche, ovvero il modo in cui un laboratorio accademico potrebbe permettersi il corso di formazione. "Nella scala in cui operiamo nel mondo accademico, non abbiamo realmente accesso a un intero campo di GPU", ha affermato Farina.
Il campione umano ne ha recuperato uno
Niemeijer, che detiene quattro campionati del mondo e ha trascorso più di 600 settimane come miglior giocatore del mondo, ha giocato 20 partite online contro Ataraxos in tre settimane, guadagnando $ 100 per ogni vittoria. Sapeva che l'intelligenza artificiale non si sarebbe adattata a lui, dandogli il tempo di andare a caccia dei punti deboli. È riuscito a vincere esattamente una volta.
I ricercatori affermano che la singola perdita non era un difetto. Un buon Stratego richiede la randomizzazione della configurazione, quindi la fortuna gioca sempre un ruolo. "Anche una strategia perfetta a volte porta semplicemente alla sconfitta", ha detto Farina.
I giocatori umani allo Stratego World Championship 2025 se la sono cavata molto peggio: i partecipanti che hanno sfidato Ataraxos hanno vinto solo 2 partite su 40. Il bot ha persino cambiato il modo in cui le persone giocano, distorcendo il metagioco con scelte insolite come infilare la bandiera in un angolo dietro solo due bombe: una configurazione raramente giocata.
Il nome del sistema deriva dall'antica parola greca che significa calma, e i ricercatori affermano che la qualità si vede nel suo funzionamento. Mentre un essere umano potrebbe scommettere selvaggiamente per riprendersi da un deficit, Ataraxos recupera lentamente e metodicamente. "Guardavamo il bot 'bluffare' per tornare indietro da una probabilità di vittoria del 2%, molto, molto casualmente," ha detto Vinitsky.
Cosa significa oltre il tabellone
Battere gli umani nei giochi con informazioni nascoste è più di un trucco da salotto. Le tecniche per ragionare sullo stato privato di un avversario sono alla base di applicazioni reali in cui le informazioni sono incomplete: sistemi di negoziazione, sicurezza informatica, modellazione economica e coordinamento multi-agente, solo per citarne alcuni.
L’aspetto dell’efficienza potrebbe rivelarsi la parte più influente della storia. Un laboratorio di frontiera ha dedicato mesi di calcolo a questo problema nel 2022; un team accademico ha replicato e superato il risultato all’incirca al prezzo di un’auto usata nel 2026. Mentre la ricerca sull’intelligenza artificiale diventa sinonimo di enormi budget di calcolo, Ataraxos ci ricorda che le idee algoritmiche – in questo caso, un modello di convinzione che doma un enorme spazio di ricerca – possono ancora contare più della scala grezza.
L'articolo del team descrive una macchina che rimane calma nell'incertezza, ignora la conoscenza che un essere umano non potrebbe ignorare e bluffa meglio dei migliori al mondo. Queste sono abilità utili, dentro e fuori dal tabellone.
---
Rimani Aggiornato sull'IALe ultime notizie, analisi e scoperte sull'intelligenza artificiale — tutto in un posto.
Leggi altre notizie sull'IA →