AI 시스템이 마침내 수십 년 동안 기계를 당황하게 만들었던 고전 보드 게임인 Stratego를 정복했으며, 적은 예산으로 이를 달성했습니다. Ars Technica에 따르면 Carnegie Mellon University, MIT, New York University 및 Stanford University의 연구진은 Ataraxos라는 AI를 구축하여 역대 최고의 Stratego 플레이어로 널리 알려진 Pim Niemeijer를 15승 1패로 이겼습니다.

결과는 가격표보다 점수선에서 눈에 띄는 것이 적습니다. Ataraxos는 약 일주일 동안 단 16개의 GPU로 훈련했으며, 동반 모델을 훈련하기 위해 4일 동안 4개의 추가 GPU로 훈련했습니다. 팀에서는 실행 비용이 수천 달러에 불과하다고 말합니다. 처음으로 AI의 관심을 게임에 가져온 2022년 시스템인 DeepMind의 DeepNash는 Google의 특수 TPU 칩 1,024개로 2~3개월 동안 훈련되었습니다. Ataraxos 팀은 실행 비용이 2025년 가격으로 300만 달러에서 450만 달러 사이가 될 것으로 추정합니다. 이 이야기에 대한 자세한 내용은 최신 AI 동향를 참조하세요.

Stratego가 수십 년 동안 AI를 방해한 이유

Deep Blue는 1997년 체스에서 Garry Kasparov를 이겼습니다. AlphaGo는 2016년 바둑에서 이세돌을 이겼습니다. 포커 봇은 수년간 전문가들을 이겼습니다. Stratego는 DeepMind의 상당한 자원에도 불구하고 버텼습니다.

게임의 난이도는 숨겨진 정보, 규모 및 길이의 특이한 조합에서 비롯됩니다. 각 플레이어는 보안관부터 스파이까지 군사 계급을 대표하는 40개의 말과 폭탄, 깃발을 지휘합니다. 상대방의 깃발을 빼앗으면 승리합니다. 상대방은 당신의 말이 어디에 있는지 볼 수 있지만 그것이 무엇인지는 볼 수 없습니다. 두 조각이 충돌할 때만 신원이 드러나고, 약한 조각이 제거됩니다.

MIT 컴퓨터 과학자이자 이번 연구의 공동 저자인 Gabriele Farina는 Ars Technica에 "Stratego에는 어떤 순서로든 40개의 조각이 보드에 있습니다."라고 말했습니다. 이는 10억 개 이상의 가능한 설정을 허용합니다. 이는 몇 년 전에 크랙이 발생한 게임 컴퓨터인 텍사스 홀덤에서 가능한 1,326개의 핸드를 왜소하게 만드는 것입니다. 길이는 문제를 더욱 복잡하게 만듭니다. "체스에서는 일반적으로 게임이 40개 이동 동안 지속되지만 Stratego에서는 게임이 쉽게 2,000개 이동까지 지속될 수 있습니다"라고 Farina는 말했습니다.

그런 다음 허풍이 있습니다. 마샬인 것처럼 약한 부분을 움직이면 상대방이 겁을 먹을 수 있지만 너무 자주 허세를 부리고 위협을 가하는 것은 아무 의미가 없습니다. 절대로 허세를 부리지 않으면 예측 가능해집니다. 이러한 균형 잡힌 행동은 DeepNash와 같은 초기 시스템이 정상에 도달하는 것을 방해했습니다.

NYU 연구원이자 공동 저자인 Eugene Vinitsky는 "Stratego에는 매우 독특한 점이 있는데, 이는 매우 오랜 시간에 걸쳐 펼쳐지는 엄청난 양의 숨겨진 정보라는 것입니다."라고 말했습니다.

추측하는 두 번째 신경망

Ataraxos는 DeepNash가 했던 것과 동일한 기본 방식을 배웠습니다. 총 1억 6,300만 게임을 자신과 대결하여 승리로 이어지는 움직임을 강화하고 그렇지 못한 움직임을 약화시키는 것입니다. 팀의 첫 번째 개선 사항은 숨겨진 정보가 셀프 플레이 알고리즘을 순환적으로 보내는 경향이 있기 때문에 각 게임이 끝난 후 시스템이 얼마나 조정되었는지였습니다. Ataraxos는 훈련 초기에 대규모 전략 변경을 수행했으며 나중에는 점점 더 신중하게 전략을 변경했습니다.

더 큰 혁신은 DeepNash가 결코 갖지 못했던 것입니다: 각 움직임 전에 미리 생각하는 것입니다. 행위 전 검색 기반의 정제가 AlphaGo를 강력하게 만든 이유이지만 DeepMind는 검색 공간이 너무 넓어서 Stratego에서 이를 작동시키지 못했습니다.

해결책은 두 번째 신경망, 즉 상대방이 어떻게 움직였는지로부터 상대방의 숨겨진 부분을 추측하도록 훈련된 신념 모델이었습니다. Ataraxos는 가능한 모든 배열을 반복하는 대신 그럴듯한 배열을 샘플링하고 각각의 후보 동작을 실행하고 결과에 따라 선택합니다. 수석 저자인 Samuel Sokota와 Farina는 또한 그래픽 카드에서 초당 수백만 번의 움직임을 실행하는 맞춤형 시뮬레이터를 작성했는데, 이는 학술 연구실에서 훈련을 실행할 수 있는 방법입니다. Farina는 "우리가 학계의 규모로 볼 때 실제로 GPU 전체 분야에 접근할 수는 없습니다."라고 말했습니다.

인간 챔피언이 하나를 되찾았습니다

4번의 세계 선수권 대회를 보유하고 600주 이상 세계 1위 선수로 활약한 Niemeijer는 3주에 걸쳐 아타락소스를 상대로 20번의 온라인 게임을 치르며 승리할 때마다 100달러를 받았습니다. 그는 AI가 자신에게 적응하지 않을 것이라는 것을 알았고, 약점을 찾아낼 시간을 벌었습니다. 그는 정확히 한 번 승리했습니다.

연구원들은 단일 손실이 결함이 아니라고 말합니다. 좋은 Stratego에서는 설정을 무작위로 지정해야 하므로 항상 행운이 중요한 역할을 합니다. Farina는 “완벽한 전략이라 할지라도 때로는 패배할 수도 있습니다.”라고 말했습니다.

2025년 Stratego World Championship에서 인간 선수들은 훨씬 더 나빴습니다. Ataraxos에 도전한 참가자들은 40경기 중 2경기만 승리했습니다. 봇은 심지어 사람들이 플레이하는 방식을 바꿔서 폭탄 두 개 뒤의 구석에 깃발을 집어넣는 등의 특이한 선택으로 메타게임을 왜곡했습니다. 이는 거의 플레이되지 않는 설정입니다.

이 시스템의 이름은 평온함을 의미하는 고대 그리스 단어에서 유래되었으며 연구자들은 품질이 그 작동에서 나타난다고 말합니다. 인간은 적자를 회복하기 위해 미친 듯이 도박을 할 수도 있지만, 아타락소스는 천천히 체계적으로 회복합니다. Vinitsky는 "우리는 봇이 2%의 승리 확률에서 아주 아무렇지도 않게 '허세'를 부리는 모습을 지켜보았습니다."라고 말했습니다.

이사회 너머의 의미

숨겨진 정보 게임에서 인간을 이기는 것은 단순한 속임수 그 이상입니다. 상대방의 비공개 상태를 추론하는 기술은 협상 시스템, 사이버 보안, 경제 모델링, 다중 에이전트 조정 등 정보가 불완전한 실제 애플리케이션을 뒷받침합니다.

효율성 측면이 이야기에서 가장 영향력 있는 부분이 될 수 있습니다. 프론티어 연구소는 2022년에 이 문제를 해결하기 위해 수개월간 컴퓨팅을 소비했습니다. 학술 팀은 2026년에 대략 중고차 가격에 대한 결과를 복제하고 초과했습니다. AI 연구가 막대한 컴퓨팅 예산과 동의어가 되면서 Ataraxos는 알고리즘 아이디어(여기서는 거대한 검색 공간을 길들이는 신념 모델)가 여전히 원시 규모보다 더 중요할 수 있음을 상기시켜 줍니다.

팀의 논문에서는 불확실성 속에서도 침착함을 유지하고 인간이 무시할 수 없는 지식을 무시하며 세계 최고보다 더 잘 허세를 부리는 기계에 대해 설명합니다. 그것은 보드 안팎에서 유용한 기술입니다.

---

AI 최신 소식

최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.

AI 뉴스 더 보기 →