Система искусственного интеллекта наконец-то покорила Stratego, классическую настольную игру, которая десятилетиями ставила машины в тупик — и сделала это при ограниченном бюджете. Команда исследователей из Университета Карнеги-Меллона, Массачусетского технологического института, Нью-Йоркского университета и Стэнфордского университета создала ИИ под названием Ataraxos, который победил Пима Нимейера, широко известного как лучший игрок в Stratego всех времен, со счетом 15 игр к 1 при четырех ничьих, сообщает Ars Technica.

Результат поражает не столько счетом, сколько ценой. Ataraxos тренировалась всего на 16 графических процессорах в течение примерно недели, а также на четырех дополнительных графических процессорах в течение четырех дней для обучения сопутствующей модели — такой прогон, по словам команды, стоил всего несколько тысяч долларов. DeepNash от DeepMind, система 2022 года, которая впервые привлекла к игре серьезное внимание к искусственному интеллекту, обучалась в течение двух-трех месяцев на 1024 специализированных чипах TPU Google. По оценкам команды Ataraxos, этот запуск будет стоить от 3 до 4,5 миллионов долларов в ценах 2025 года. Подробнее об этой истории — в нашем последние разработки в ИИ.

Почему Stratego десятилетиями ставила ИИ в тупик

Deep Blue обыграла Гарри Каспарова в шахматы в 1997 году. AlphaGo победила Ли Седоля в го в 2016 году. Покерные боты уже много лет побеждают профессионалов. Stratego выдержала — даже несмотря на значительные ресурсы DeepMind.

Сложность игры заключается в необычном сочетании скрытой информации, масштаба и длины. Каждый игрок командует 40 фигурами, обозначающими воинские звания, от маршала до шпиона, а также бомбами и флагом. Вы выигрываете, захватив флаг противника. Ваш противник может видеть, где находятся ваши фигуры, но не какие они. Тождества раскрываются только тогда, когда две части сталкиваются и более слабая часть удаляется.

«В Stratego на доске 40 фигур, которые могут быть расположены в любом порядке», — рассказал Ars Technica Габриэле Фарина, ученый-компьютерщик Массачусетского технологического института и соавтор исследования. Это позволяет использовать более демиллиона возможных расстановок, что затмевает 1326 возможных рук в Техасском Холдеме, игровой компьютерной игре, взломанной много лет назад. Длина усугубляет проблему: «В шахматах игра обычно длится 40 ходов, но в Stratego игра легко может длиться 2000 ходов», — сказал Фарина.

Затем идет блеф. Перемещение слабой фигуры, как будто это маршал, может отпугнуть противника, но блефовать слишком часто, и угрозы ничего не значат; никогда не блефуйте, и вы станете предсказуемыми. Именно этот баланс и не позволил более ранним системам, таким как DeepNash, достичь вершины.

«В Stratego есть что-то особенное: это огромный объем скрытой информации, которая разворачивается в течение очень длительного периода времени», — сказал Юджин Виницкий, исследователь из Нью-Йоркского университета и еще один соавтор.

Вторая нейронная сеть, которая угадывает

Ataraxos усвоил тот же основной метод, что и DeepNash: сыграв против себя в общей сложности 163 миллиона игр, усиливая ходы, которые привели к победам, и подавляя те, которые этого не сделали. Первое улучшение команды заключалось в том, насколько сильно система адаптировалась после каждой игры, поскольку скрытая информация имеет тенденцию заставлять алгоритмы самостоятельной игры ходить по кругу. Атараксос внес большие изменения в стратегию на ранних этапах обучения, а затем стал делать это все более осторожно.

Большим прорывом было то, чего у DeepNash никогда не было: продумывание каждого шага наперед. Уточнение на основе поиска перед действием — это то, что сделало AlphaGo мощным, но DeepMind не смог заставить его работать в Stratego, потому что пространство поиска было слишком обширным.

Решением стала вторая нейронная сеть — модель убеждений, обученная угадывать скрытые части противника по тому, как он двигался. Вместо того, чтобы перебирать все возможные варианты, Атараксос выбирает наиболее вероятные варианты, разыгрывает возможные ходы в каждом и делает выбор на основе результатов. Ведущий автор Сэмюэл Сокота и Фарина также написали специальный симулятор, который выполняет миллионы ходов в секунду на видеокартах, и именно поэтому академическая лаборатория может себе позволить провести обучение. «В том масштабе, в котором мы находимся в академических кругах, у нас на самом деле нет доступа ко всей области графических процессоров», — сказал Фарина.

Человеческий чемпион получил один обратно

Нимейер, который выиграл четыре чемпионата мира и провел более 600 недель в качестве лучшего игрока мира, сыграл 20 онлайн-игр против «Атараксоса» за три недели, зарабатывая 100 долларов за каждую победу. Он знал, что ИИ не адаптируется к нему, давая ему время поискать слабые места. Ему удалось победить ровно один раз.

Исследователи говорят, что единичная потеря не была недостатком. Хороший Stratego требует рандомизации вашей настройки, поэтому удача всегда играет роль. «Даже идеальная стратегия иногда просто проигрывает», — сказал Фарина.

Игрокам-людям на чемпионате мира по Stratego 2025 года повезло гораздо хуже: участники, бросившие вызов Атараксосу, выиграли только 2 из 40 игр. Бот даже изменил способ игры людей, исказив метаигру необычными решениями, например, засунув свой флаг в угол всего за двумя бомбами — редко используемая установка.

Название системы происходит от древнегреческого слова, означающего спокойствие, и исследователи говорят, что качество проявляется в ее игре. В то время как человек может отчаянно рисковать, чтобы оправиться от дефицита, Атараксос медленно и методично возвращается обратно. «Мы наблюдали, как бот «блефовал» на обратном пути с вероятностью победы около двух процентов, очень, очень небрежно», — сказал Виницкий.

Что это значит за пределами доски

Победа над людьми в играх со скрытой информацией – это больше, чем просто салонный трюк. Методы рассуждений о частном государстве противника лежат в основе реальных приложений, где информация неполна — системы переговоров, кибербезопасность, экономическое моделирование и многоагентная координация, и это лишь некоторые из них.

Угол эффективности может оказаться самой влиятельной частью истории. В 2022 году пограничная лаборатория потратила месяцы вычислений на решение этой проблемы; академическая группа повторила и превзошла результат примерно по цене подержанного автомобиля в 2026 году. Поскольку исследования искусственного интеллекта становятся синонимом огромных вычислительных бюджетов, Ataraxos является напоминанием о том, что алгоритмические идеи — в данном случае модель убеждений, которая укрощает огромное пространство поиска — по-прежнему могут иметь большее значение, чем просто масштаб.

В документе команды описывается машина, которая сохраняет спокойствие в условиях неопределенности, игнорирует знания, которые человек не может игнорировать, и блефует лучше, чем лучшие в мире. Это полезные навыки, как на доске, так и за ее пределами.

---

Будьте в курсе ИИ

Последние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.

Читать больше новостей об ИИ →