Một hệ thống AI cuối cùng đã chinh phục được Stratego, trò chơi board game cổ điển đã đánh bại máy móc trong nhiều thập kỷ — và nó đã làm được điều đó với một ngân sách eo hẹp. Một nhóm các nhà nghiên cứu từ Đại học Carnegie Mellon, MIT, Đại học New York và Đại học Stanford đã xây dựng một AI có tên Ataraxos để đánh bại Pim Niemeijer, được nhiều người coi là người chơi Stratego giỏi nhất mọi thời đại, với tỷ số 15 ván ăn 1 với 4 ván hòa, theo báo cáo của Ars Technica.

Kết quả gây ấn tượng ít hơn đối với đường tỷ số so với thẻ giá. Ataraxos chỉ đào tạo trên 16 GPU trong khoảng một tuần, cộng thêm bốn GPU bổ sung trong bốn ngày để đào tạo một mô hình đồng hành — một cuộc chạy mà nhóm cho biết chỉ tốn vài nghìn đô la. DeepNash của DeepMind, hệ thống năm 2022 lần đầu tiên thu hút sự chú ý nghiêm túc của AI vào trò chơi, đã được đào tạo trong hai đến ba tháng trên 1.024 chip TPU chuyên dụng của Google, một hoạt động mà nhóm Ataraxos ước tính sẽ tiêu tốn từ 3 triệu đến 4,5 triệu USD theo mức giá năm 2025. For more context on this story, see our ongoing breaking AI news.

Tại sao Stratego đánh bại AI trong nhiều thập kỷ

Deep Blue đánh bại Garry Kasparov ở môn cờ vua năm 1997. AlphaGo đánh bại Lee Sedol tại cờ vây năm 2016. Các bot poker đã đánh bại các chuyên gia trong nhiều năm. Stratego đã đứng vững — thậm chí trước nguồn lực đáng kể của DeepMind.

Độ khó của trò chơi đến từ sự kết hợp bất thường giữa thông tin ẩn, quy mô và độ dài. Mỗi người chơi chỉ huy 40 quân cờ đại diện cho các cấp bậc quân sự, từ thống chế đến gián điệp, cùng với bom và cờ. Bạn giành chiến thắng bằng cách chiếm được cờ của đối thủ. Đối thủ của bạn có thể thấy quân cờ của bạn ở đâu, nhưng không biết chúng là gì. Danh tính chỉ được tiết lộ khi hai quân cờ va chạm nhau và quân yếu hơn bị loại bỏ.

Gabriele Farina, nhà khoa học máy tính của MIT và đồng tác giả của nghiên cứu, nói với Ars Technica: “Trong Stratego, có 40 mảnh trên bảng có thể theo bất kỳ thứ tự nào”. Điều đó cho phép hơn một triệu lượt thiết lập có thể thực hiện được — vượt xa con số 1.326 ván bài có thể có trong Texas Hold'em, một trò chơi máy tính đã bị bẻ khóa nhiều năm trước. Độ dài càng làm tăng thêm vấn đề: “Trong cờ vua, trò chơi thường kéo dài 40 nước đi, nhưng trong Stratego, một ván cờ có thể dễ dàng kéo dài 2.000 nước đi,” Farina nói.

Sau đó là lừa gạt. Di chuyển một quân yếu như thể nó là một soái ca có thể khiến đối thủ sợ hãi, nhưng việc lừa gạt quá thường xuyên và đe dọa chẳng có ý nghĩa gì; không bao giờ lừa gạt và bạn trở nên dễ đoán. Hành động cân bằng đó là nguyên nhân khiến các hệ thống trước đó như DeepNash không thể đạt đến đỉnh cao.

Eugene Vinitsky, một nhà nghiên cứu tại NYU và một đồng tác giả khác, cho biết: “Có một điều gì đó cực kỳ đặc biệt về Stratego, đó là một lượng lớn thông tin ẩn giấu được tiết lộ trong một khoảng thời gian rất dài”.

Mạng lưới thần kinh thứ hai có khả năng đoán

Ataraxos đã học theo cách cơ bản tương tự mà DeepNash đã làm: bằng cách chơi với chính nó, tổng cộng 163 triệu trò chơi, củng cố các nước đi dẫn đến chiến thắng và giảm bớt những nước đi không thắng. Cải tiến đầu tiên của nhóm là mức độ điều chỉnh của hệ thống sau mỗi trận đấu, vì thông tin ẩn có xu hướng gửi các thuật toán tự chơi theo vòng kết nối. Ataraxos đã sớm thực hiện những thay đổi lớn về chiến lược trong quá trình huấn luyện và ngày càng thận trọng hơn sau này.

Bước đột phá lớn hơn là điều mà DeepNash chưa bao giờ có: suy nghĩ trước mỗi bước đi. Sự sàng lọc dựa trên tìm kiếm trước khi hành động là điều khiến AlphaGo trở nên mạnh mẽ, nhưng DeepMind không thể khiến nó hoạt động được trong Stratego vì không gian tìm kiếm quá rộng lớn.

Giải pháp là mạng lưới thần kinh thứ hai - một mô hình niềm tin, được huấn luyện để đoán những quân cờ ẩn giấu của đối thủ dựa trên cách họ di chuyển. Thay vì lặp đi lặp lại mọi cách sắp xếp có thể, Ataraxos lấy mẫu những cách hợp lý, thực hiện các nước đi ứng cử viên trong mỗi cách và chọn dựa trên kết quả. Tác giả chính Samuel Sokota và Farina cũng đã viết một trình mô phỏng tùy chỉnh chạy hàng triệu chuyển động mỗi giây trên card đồ họa, đó là cách một phòng thí nghiệm học thuật có thể đủ khả năng thực hiện quá trình đào tạo. Farina nói: “Ở quy mô mà chúng tôi đang có trong giới học thuật, chúng tôi thực sự không có quyền truy cập vào toàn bộ lĩnh vực GPU”.

Nhà vô địch loài người đã quay trở lại

Niemeijer, người nắm giữ bốn chức vô địch thế giới và đã trải qua hơn 600 tuần với tư cách là kỳ thủ xếp hạng hàng đầu thế giới, đã chơi 20 trận trực tuyến với Ataraxos trong ba tuần, kiếm được 100 USD cho mỗi trận thắng. Anh biết AI sẽ không thích ứng với anh, cho anh thời gian để tìm ra điểm yếu. Anh ấy đã giành chiến thắng đúng một lần.

Các nhà nghiên cứu nói rằng sự mất mát duy nhất không phải là một sai sót. Chiến lược tốt yêu cầu thiết lập ngẫu nhiên, vì vậy may mắn luôn đóng một vai trò quan trọng. Farina nói: “Ngay cả một chiến lược hoàn hảo, đôi khi nó cũng sẽ thất bại.

Những người chơi là con người tại Giải vô địch thế giới Stratego 2025 còn tệ hơn nhiều: những người tham dự thách đấu Ataraxos chỉ thắng 2 trong số 40 trận. Con bot thậm chí còn thay đổi cách mọi người chơi, làm lệch metagame bằng những lựa chọn bất thường như nhét lá cờ của nó vào một góc chỉ sau hai quả bom — một thiết lập hiếm khi được chơi.

Tên của hệ thống này xuất phát từ từ tiếng Hy Lạp cổ có nghĩa là sự bình tĩnh và các nhà nghiên cứu nói rằng chất lượng thể hiện qua cách chơi của nó. Trong khi con người có thể đánh bạc điên cuồng để phục hồi sau khi bị thâm hụt, thì Ataraxos lại tìm cách quay trở lại một cách chậm rãi và có phương pháp. Vinitsky nói: “Chúng tôi sẽ xem bot 'lừa đảo' quay trở lại với xác suất chiến thắng khoảng hai phần trăm, rất, rất tình cờ.

Ý nghĩa của nó ngoài bảng

Đánh bại con người trong các trò chơi ẩn thông tin không chỉ là một thủ thuật trong phòng khách. Các kỹ thuật lý luận về trạng thái riêng tư của đối thủ củng cố các ứng dụng thực tế trong đó thông tin không đầy đủ - hệ thống đàm phán, an ninh mạng, mô hình kinh tế và phối hợp đa tác nhân, v.v.

Góc độ hiệu quả có thể là phần có ảnh hưởng nhất của câu chuyện. Một phòng thí nghiệm ở biên giới đã dành nhiều tháng tính toán về vấn đề này vào năm 2022; một nhóm học thuật đã nhân rộng và vượt qua kết quả với giá gần bằng giá một chiếc ô tô đã qua sử dụng vào năm 2026. Khi nghiên cứu AI trở thành đồng nghĩa với ngân sách điện toán khổng lồ, Ataraxos là một lời nhắc nhở rằng các ý tưởng thuật toán — ở đây là một mô hình niềm tin có thể chế ngự một không gian tìm kiếm khổng lồ — vẫn có thể quan trọng hơn quy mô thô.

Bài báo của nhóm mô tả một cỗ máy có thể giữ bình tĩnh trong điều kiện không chắc chắn, phớt lờ những kiến ​​thức mà con người không thể bỏ qua và lừa gạt giỏi hơn những cỗ máy giỏi nhất trên thế giới. Đó là những kỹ năng hữu ích, trên và ngoài bảng.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →