Sistem AI pungkasane nelukake Stratego, game papan klasik sing ngganggu mesin nganti pirang-pirang dekade - lan ditindakake kanthi anggaran sing sithik. Tim peneliti saka Universitas Carnegie Mellon, MIT, Universitas New York lan Universitas Stanford mbangun AI sing diarani Ataraxos sing ngalahake Pim Niemeijer, sing dianggep minangka pemain Stratego paling apik ing kabeh wektu, kanthi skor 15 game kanggo 1 kanthi papat imbang, laporan Ars Technica.

Asil punika striking kurang kanggo scoreline saka kanggo tag rega. Ataraxos dilatih ing mung 16 GPUs kanggo bab minggu, plus papat GPU tambahan patang dina kanggo olahraga model kanca - a roto tim ngandika biaya mung sawetara ewu dolar. DeepMind's DeepNash, sistem 2022 sing pisanan narik perhatian AI serius ing game kasebut, dilatih suwene rong nganti telung wulan ing 1,024 chip TPU khusus Google, sing dikira tim Ataraxos bakal regane antarane $ 3 yuta lan $ 4,5 yuta ing rega 2025. For more context on this story, see our ongoing AI news.

Napa Stratego Stumped AI kanggo Dasawarsa

Deep Blue ngalahake Garry Kasparov ing catur ing 1997. AlphaGo ngalahaké Lee Sedol ing Go ing 2016. Poker bot wis diantemi profesional kanggo taun. Stratego dianakaké - malah marang sumber daya owahan DeepMind.

Kangelan game teka saka kombinasi mboten umum saka informasi didhelikake, ukuran lan dawa. Saben pemain mrentah 40 lembar sing makili pangkat militer, saka marshal nganti telik, ditambah bom lan gendéra. Sampeyan menang kanthi nyekel gendera mungsuh. Mungsuh sampeyan bisa ndeleng ing ngendi potongan sampeyan, nanging ora apa. Identitas sing dicethakaké mung nalika loro bêsik tabrakan, lan Piece ringkih dibusak.

"Ing Stratego, ana 40 potongan ing papan sing bisa ditindakake kanthi urutan apa wae," ujare Gabriele Farina, ilmuwan komputer MIT lan co-penulis sinau kasebut, marang Ars Technica. Sing ngidini luwih saka decillion bisa persiyapan - dwarfing 1,326 bisa tangan ing Texas Hold'em, komputer game retak taun ago. Length compounds masalah: "Ing catur, biasane game punika 40 gerakane, nanging ing Stratego, game bisa gampang kanggo 2.000 gerakane," ngandika Farina.

Banjur ana bluffing. Obah Piece ringkih minangka yen ana marshal bisa ajrih mungsuh mati, nanging nggetak asring banget lan ancaman tegese apa-apa; tau nggetak lan sampeyan dadi bisa katebak. Tumindak imbangan kasebut minangka sistem sadurunge kaya DeepNash supaya ora tekan ndhuwur.

"Ana sing paling khas babagan Stratego, yaiku jumlah informasi sing didhelikake sing akeh banget sing mbukak ing skala wektu sing suwe," ujare Eugene Vinitsky, peneliti ing NYU lan penulis liyane.

Jaringan Syaraf Kapindho sing Ditebak

Ataraxos sinau cara dhasar sing padha karo DeepNash: kanthi muter nglawan awake dhewe, total 163 yuta game, nguatake gerakan sing nyebabake menang lan nyuda sing ora. dandan pisanan tim ana ing pinten sistem diatur sawise saben game, amarga informasi didhelikake cenderung kanggo ngirim poto-muter algoritma ing bunderan. Ataraxos nggawe owah-owahan strategi gedhe ing awal latihan lan luwih ati-ati mengko.

Terobosan sing luwih gedhe yaiku sing durung nate ditindakake dening DeepNash: mikir sadurunge saben pamindhahan. Penyempurnaan adhedhasar telusuran sadurunge tumindak yaiku sing nggawe AlphaGo kuat, nanging DeepMind ora bisa digunakake ing Stratego amarga ruang telusuran akeh banget.

Solusi kasebut yaiku jaringan saraf kapindho - model kapercayan, sing dilatih kanggo ngira potongan sing didhelikake mungsuh saka carane dheweke obah. Tinimbang ngulang saben pengaturan sing bisa ditindakake, Ataraxos menehi conto sing bisa dipercaya, muter calon pamindhahan ing saben, lan milih adhedhasar asil. Penulis utama Samuel Sokota lan Farina uga nulis simulator khusus sing mbukak jutaan gerakan per detik ing kertu grafis, yaiku kepiye laboratorium akademik bisa mbayar latihan kasebut. "Ing skala sing kita ana ing akademisi, kita ora duwe akses menyang kabeh lapangan GPU," ujare Farina.

Juara Manungsa entuk siji maneh

Niemeijer, sing nyekel papat juara donya lan wis nglampahi luwih saka 600 minggu minangka pemain paling dhuwur ing donya, main 20 game online nglawan Ataraxos liwat telung minggu, entuk $100 kanggo saben menang. Dheweke ngerti yen AI ora bakal adaptasi karo dheweke, menehi wektu kanggo mburu kelemahane. Dheweke bisa menang persis sapisan.

Para panaliti ujar manawa mundhut siji dudu cacat. Good Stratego mbutuhake randomizing persiyapan Panjenengan, supaya luck tansah muter peran. "Malah strategi sing sampurna, kadhangkala mung bakal kalah," ujare Farina.

Pemain manungsa ing Kejuaraan Dunia Stratego 2025 luwih ala: peserta sing nantang Ataraxos mung menang 2 saka 40 game. Bot malah ngganti cara wong muter, skewing metagame karo pilihan mboten umum kaya tucking flag menyang sudhut konco mung loro bom - persiyapan arang diputer.

Jeneng sistem kasebut asale saka tembung Yunani kuna kanggo tenang, lan para peneliti ujar manawa kualitas ditampilake ing game kasebut. Nalika manungsa bisa muter kanthi liar kanggo pulih saka defisit, Ataraxos mundur alon-alon lan kanthi cara. "Kita bakal nonton bot 'bluff' bali saka kaya kemungkinan kamenangan rong persen, banget, kanthi santai," ujare Vinitsky.

Apa Tegese Ngluwihi Papan

Ngalahake manungsa ing game informasi sing didhelikake luwih saka trik parlor. Techniques kanggo alesan bab negara pribadi mungsuh kang ndhukung aplikasi nyata ngendi informasi ora pepak - sistem rembugan, cybersecurity, modeling ekonomi lan koordinasi multi-agen, kanggo sawetara jeneng.

Sudut efisiensi bisa mbuktekake bagean sing paling berpengaruh ing crita. Lab perbatasan ngenteni pirang-pirang wulan kanggo ngitung masalah iki ing taun 2022; tim akademisi replikasi lan ngluwihi asil kanggo kira-kira rega mobil bekas ing 2026. Nalika riset AI dadi sinonim karo anggaran komputasi massive, Ataraxos minangka pangeling sing gagasan algoritma - kene, model kapercayan sing tames spasi panelusuran ageng - isih bisa dadi luwih penting tinimbang skala mentah.

Kertas tim nggambarake mesin sing tetep tenang ing kahanan sing durung mesthi, ora nggatekake kawruh sing ora bisa digatekake manungsa, lan nggetak luwih apik tinimbang sing paling apik ing donya. Iku skills migunani, ing Papan lan mati iku.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →