Sistem AI akhirnya telah menakluki Stratego, permainan papan klasik yang membingungkan mesin selama beberapa dekad - dan ia melakukannya dengan bajet yang sedikit. Pasukan penyelidik dari Carnegie Mellon University, MIT, New York University dan Stanford University membina AI yang dipanggil Ataraxos yang mengalahkan Pim Niemeijer, yang dianggap secara meluas sebagai pemain Stratego terbaik sepanjang masa, dengan skor 15 perlawanan berbanding 1 dengan empat seri, lapor Ars Technica.
Hasilnya adalah kurang menarik untuk garis skor berbanding tanda harga. Ataraxos berlatih dengan hanya 16 GPU selama kira-kira seminggu, ditambah empat GPU tambahan selama empat hari untuk melatih model pendamping — larian yang dikatakan pasukan hanya menelan belanja beberapa ribu dolar. DeepNash DeepMind, sistem 2022 yang mula-mula membawa perhatian AI yang serius kepada permainan, dilatih selama dua hingga tiga bulan pada 1,024 cip TPU khusus Google, yang dianggarkan oleh pasukan Ataraxos akan menelan belanja antara $3 juta dan $4.5 juta pada harga 2025. For more context on this story, see our ongoing more AI stories.
Mengapa Strategi Mengganggu AI selama Beberapa Dekad
Deep Blue menewaskan Garry Kasparov di catur pada tahun 1997. AlphaGo mengalahkan Lee Sedol di Go pada tahun 2016. Bot poker telah mengalahkan profesional selama bertahun-tahun. Stratego diadakan — walaupun terhadap sumber DeepMind yang banyak.
Kesukaran permainan datang daripada gabungan luar biasa maklumat, skala dan panjangnya. Setiap pemain memerintahkan 40 keping yang mewakili pangkat tentera, daripada marsyal hinggalah seorang pengintip, serta bom dan bendera. Anda menang dengan menangkap bendera lawan. Lawan anda boleh melihat di mana kepingan anda, tetapi bukan apa itu. Identiti didedahkan hanya apabila dua kepingan berlanggar, dan kepingan yang lebih lemah dikeluarkan.
"Dalam Stratego, terdapat 40 keping di papan yang boleh dibuat dalam sebarang susunan," kata Gabriele Farina, seorang saintis komputer MIT dan pengarang bersama kajian itu, kepada Ars Technica. Itu membolehkan lebih daripada satu delapan kemungkinan persediaan - mengecilkan 1,326 tangan yang mungkin di Texas Hold'em, komputer permainan yang retak tahun lalu. Panjang menambah masalah: "Dalam catur, biasanya permainan berlangsung 40 gerakan, tetapi dalam Stratego, permainan boleh bertahan 2,000 gerakan," kata Farina.
Kemudian ada gertakan. Menggerakkan bahagian yang lemah seolah-olah ia adalah marshal boleh menakutkan lawan, tetapi terlalu kerap menggertak dan ugutan tidak bermakna apa-apa; jangan sekali-kali menipu dan anda boleh diramal. Tindakan mengimbangi itulah yang menghalang sistem terdahulu seperti DeepNash daripada mencapai puncak.
"Terdapat sesuatu yang sangat tersendiri tentang Stratego, iaitu ia merupakan sejumlah besar maklumat tersembunyi yang terungkap dalam skala masa yang sangat lama," kata Eugene Vinitsky, seorang penyelidik di NYU dan seorang lagi pengarang bersama.
Rangkaian Neural Kedua Yang Menduga
Ataraxos mempelajari cara asas yang sama DeepNash lakukan: dengan bermain menentang dirinya sendiri, 163 juta permainan secara keseluruhan, mengukuhkan gerakan yang membawa kepada kemenangan dan meredam permainan yang tidak. Penambahbaikan pertama pasukan adalah dari segi berapa banyak sistem dilaraskan selepas setiap perlawanan, kerana maklumat tersembunyi cenderung untuk menghantar algoritma main sendiri dalam kalangan. Ataraxos membuat perubahan strategi yang besar pada awal latihan dan semakin berhati-hati kemudian.
Kejayaan yang lebih besar ialah sesuatu yang tidak pernah dimiliki DeepNash: berfikir ke hadapan sebelum setiap langkah. Penapisan berasaskan carian sebelum bertindak itulah yang menjadikan AlphaGo berkuasa, tetapi DeepMind tidak dapat menjadikannya berfungsi dalam Stratego kerana ruang carian terlalu luas.
Penyelesaiannya ialah rangkaian saraf kedua — model kepercayaan, dilatih untuk meneka bahagian tersembunyi lawan dari cara mereka bergerak. Daripada mengulangi setiap susunan yang mungkin, Ataraxos mengambil contoh yang munasabah, memainkan langkah calon dalam setiap satu, dan memilih berdasarkan hasil. Penulis utama Samuel Sokota dan Farina juga menulis simulator tersuai yang menjalankan berjuta-juta pergerakan sesaat pada kad grafik, iaitu bagaimana makmal akademik mampu menjalankan latihan. "Pada skala yang kami berada dalam bidang akademik, kami tidak benar-benar mempunyai akses kepada keseluruhan bidang GPU," kata Farina.
Juara Manusia Mendapat Satu Kembali
Niemeijer, yang memegang empat kejuaraan dunia dan telah menghabiskan lebih daripada 600 minggu sebagai pemain teratas dunia, bermain 20 permainan dalam talian menentang Ataraxos selama tiga minggu, memperoleh $100 untuk setiap kemenangan. Dia tahu AI tidak akan menyesuaikan diri dengannya, memberinya masa untuk memburu kelemahan. Dia berjaya menang tepat sekali.
Penyelidik mengatakan bahawa kehilangan tunggal bukanlah satu kecacatan. Good Stratego memerlukan persediaan anda secara rawak, jadi nasib sentiasa memainkan peranan. "Malah strategi yang sempurna, kadang-kadang ia hanya akan kalah," kata Farina.
Pemain manusia di Kejohanan Dunia Stratego 2025 jauh lebih teruk: peserta yang mencabar Ataraxos hanya memenangi 2 daripada 40 perlawanan. Bot itu malah mengubah cara orang bermain, memesongkan metagame dengan pilihan luar biasa seperti menyelitkan benderanya ke sudut di belakang hanya dua bom — persediaan yang jarang dimainkan.
Nama sistem berasal daripada perkataan Yunani kuno untuk tenang, dan para penyelidik mengatakan bahawa kualiti ditunjukkan dalam permainannya. Walaupun manusia mungkin berjudi secara liar untuk pulih daripada defisit, Ataraxos berusaha kembali dengan perlahan dan teratur. "Kami akan melihat bot 'membutakan' perjalanan kembali seperti kemungkinan dua peratus kemenangan, sangat, sangat santai," kata Vinitsky.
Maksudnya Di Luar Lembaga
Menewaskan manusia dalam permainan maklumat tersembunyi adalah lebih daripada helah salon. Teknik untuk membuat alasan tentang keadaan persendirian lawan menyokong aplikasi sebenar apabila maklumat tidak lengkap — sistem rundingan, keselamatan siber, pemodelan ekonomi dan penyelarasan pelbagai ejen, untuk menamakan beberapa.
Sudut kecekapan mungkin membuktikan bahagian yang paling berpengaruh dalam cerita. Makmal sempadan menghabiskan berbulan-bulan untuk mengira masalah ini pada tahun 2022; pasukan akademik mereplikasi dan melebihi keputusan untuk kira-kira harga kereta terpakai pada tahun 2026. Memandangkan penyelidikan AI menjadi sinonim dengan belanjawan pengiraan besar-besaran, Ataraxos ialah peringatan bahawa idea algoritma — di sini, model kepercayaan yang menjinakkan ruang carian yang besar — masih boleh menjadi lebih penting daripada skala mentah.
Kertas kerja pasukan menerangkan mesin yang kekal tenang di bawah ketidakpastian, mengabaikan pengetahuan yang tidak dapat diabaikan oleh manusia, dan menipu lebih baik daripada yang terbaik di dunia. Itu adalah kemahiran yang berguna, di papan dan di luarnya.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →