Sistem AI akhirnya menaklukkan Stratego, permainan papan klasik yang membuat mesin bingung selama beberapa dekade — dan berhasil dilakukan dengan anggaran terbatas. Sebuah tim peneliti dari Carnegie Mellon University, MIT, New York University dan Stanford University membangun AI bernama Ataraxos yang mengalahkan Pim Niemeijer, yang secara luas dianggap sebagai pemain Stratego terbaik sepanjang masa, dengan skor 15 game berbanding 1 dengan empat kali seri, Ars Technica melaporkan.
Hasilnya kurang mencolok untuk skornya dibandingkan untuk label harganya. Ataraxos berlatih hanya dengan 16 GPU selama sekitar satu minggu, ditambah empat GPU tambahan selama empat hari untuk melatih model pendamping — menurut tim, biaya yang dikeluarkan untuk menjalankannya hanya beberapa ribu dolar. DeepNash dari DeepMind, sistem tahun 2022 yang pertama kali menarik perhatian AI yang serius ke dalam game, dilatih selama dua hingga tiga bulan menggunakan 1.024 chip TPU khusus Google, sebuah proses yang diperkirakan oleh tim Ataraxos akan menelan biaya antara $3 juta dan $4,5 juta pada harga tahun 2025. For more context on this story, see our ongoing more AI stories.
Mengapa Stratego Bingung dengan AI selama Beberapa Dekade
Deep Blue mengalahkan Garry Kasparov dalam catur pada tahun 1997. AlphaGo mengalahkan Lee Sedol di Go pada tahun 2016. Bot poker telah mengalahkan para profesional selama bertahun-tahun. Stratego bertahan — bahkan melawan sumber daya DeepMind yang besar.
Kesulitan permainan ini berasal dari kombinasi informasi tersembunyi, skala, dan panjangnya yang tidak biasa. Setiap pemain memerintahkan 40 buah yang mewakili pangkat militer, dari marshal hingga mata-mata, ditambah bom dan bendera. Anda menang dengan merebut bendera lawan. Lawan Anda dapat melihat di mana letak bidak Anda, tetapi tidak dapat melihat apa letaknya. Identitas terungkap hanya ketika dua bagian bertabrakan, dan bagian yang lebih lemah dihilangkan.
“Di Stratego, ada 40 buah di papan yang dapat disusun dalam urutan apa pun,” Gabriele Farina, ilmuwan komputer MIT dan salah satu penulis penelitian tersebut, mengatakan kepada Ars Technica. Hal ini memungkinkan lebih dari satu dekade kemungkinan pengaturan – mengerdilkan 1.326 kemungkinan tangan di Texas Hold'em, sebuah game yang dipecahkan komputer bertahun-tahun yang lalu. Panjangnya menambah masalah: "Dalam catur, biasanya permainan berlangsung selama 40 gerakan, namun di Stratego, sebuah permainan dapat dengan mudah bertahan dalam 2.000 gerakan," kata Farina.
Lalu ada gertakan. Memindahkan bidak lemah seolah-olah itu adalah marshal dapat menakuti lawan, tetapi terlalu sering menggertak dan ancaman tidak berarti apa-apa; jangan pernah menggertak dan Anda menjadi mudah ditebak. Tindakan penyeimbangan itulah yang membuat sistem sebelumnya seperti DeepNash tidak mencapai puncak.
“Ada sesuatu yang sangat istimewa tentang Stratego, yaitu banyaknya informasi tersembunyi yang terungkap dalam skala waktu yang sangat lama,” kata Eugene Vinitsky, peneliti di NYU dan rekan penulis lainnya.
Jaringan Neural Kedua yang Menebak
Ataraxos belajar dengan cara dasar yang sama seperti yang dilakukan DeepNash: dengan bermain melawan dirinya sendiri, total 163 juta permainan, memperkuat gerakan yang menghasilkan kemenangan dan meredam gerakan yang tidak menghasilkan kemenangan. Peningkatan pertama yang dilakukan tim adalah seberapa besar penyesuaian sistem setelah setiap pertandingan, karena informasi tersembunyi cenderung membuat algoritme permainan mandiri berputar-putar. Ataraxos membuat perubahan strategi besar-besaran di awal pelatihan dan kemudian melakukan perubahan yang lebih hati-hati.
Terobosan yang lebih besar adalah sesuatu yang belum pernah dimiliki DeepNash: berpikir ke depan sebelum melakukan setiap tindakan. Penyempurnaan berbasis pencarian sebelum bertindak inilah yang membuat AlphaGo kuat, namun DeepMind tidak dapat membuatnya berfungsi di Stratego karena ruang pencarian terlalu luas.
Solusinya adalah jaringan saraf kedua — model keyakinan, yang dilatih untuk menebak bagian tersembunyi lawan dari cara mereka bergerak. Alih-alih mengulangi setiap pengaturan yang mungkin, Ataraxos mengambil sampel yang masuk akal, memainkan kandidat gerakan di setiap pengaturan, dan memilih berdasarkan hasilnya. Penulis utama Samuel Sokota dan Farina juga menulis simulator khusus yang menjalankan jutaan gerakan per detik pada kartu grafis, sehingga laboratorium akademis mampu menjalankan pelatihan tersebut. “Pada skala akademis, kami tidak memiliki akses ke seluruh bidang GPU,” kata Farina.
Juara Manusia Mendapatkan Satu Kembali
Niemeijer, yang memegang empat kejuaraan dunia dan telah menghabiskan lebih dari 600 minggu sebagai pemain peringkat teratas dunia, memainkan 20 pertandingan online melawan Ataraxos selama tiga minggu, menghasilkan $100 untuk setiap kemenangan. Dia tahu AI tidak akan beradaptasi dengannya, memberinya waktu untuk mencari kelemahan. Dia berhasil menang tepat satu kali.
Para peneliti mengatakan bahwa kerugian tunggal bukanlah sebuah cacat. Strategi yang baik memerlukan pengacakan pengaturan Anda, jadi keberuntungan selalu berperan. “Bahkan strategi yang sempurna pun terkadang kalah begitu saja,” kata Farina.
Pemain manusia di Kejuaraan Dunia Stratego 2025 bernasib jauh lebih buruk: peserta yang menantang Ataraxos hanya memenangkan 2 dari 40 pertandingan. The bot even changed how people play, skewing the metagame with unusual choices like tucking its flag into a corner behind just two bombs — a rarely played setup.
Nama sistem ini berasal dari kata Yunani kuno yang berarti ketenangan, dan para peneliti mengatakan bahwa kualitas terlihat dari permainannya. Meskipun manusia mungkin berjudi dengan liar untuk memulihkan defisit, Ataraxos berusaha bangkit kembali secara perlahan dan metodis. "Kami akan melihat bot 'menggertak' kembali dari kemungkinan kemenangan dua persen, dengan sangat, sangat santai," kata Vinitsky.
Apa Artinya Di Luar Dewan
Mengalahkan manusia dalam permainan informasi tersembunyi lebih dari sekedar trik di ruang tamu. Techniques for reasoning about an opponent's private state underpin real applications where information is incomplete — negotiation systems, cybersecurity, economic modeling and multi-agent coordination, to name a few.
Sudut pandang efisiensi mungkin menjadi bagian yang paling berpengaruh dalam cerita ini. Sebuah laboratorium perbatasan menghabiskan waktu berbulan-bulan untuk menghitung masalah ini pada tahun 2022; an academic team replicated and exceeded the result for roughly the price of a used car in 2026. As AI research becomes synonymous with massive compute budgets, Ataraxos is a reminder that algorithmic ideas — here, a belief model that tames a huge search space — can still matter more than raw scale.
The team's paper describes a machine that stays calm under uncertainty, ignores knowledge a human could not ignore, and bluffs better than the best in the world. Itu adalah keterampilan yang berguna, baik di dalam maupun di luar papan.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →