Система штучного інтелекту нарешті перемогла Stratego, класичну настільну гру, яка десятиліттями вводила машини в глухий кут, і вона зробила це за мізерний бюджет. Команда дослідників з Університету Карнегі-Меллона, Массачусетського технологічного інституту, Університетів Нью-Йорка та Стенфордського університету створила штучний інтелект під назвою Ataraxos, який переміг Піма Німейєра, якого багато хто вважав найкращим гравцем Stratego усіх часів, із рахунком 15 партій проти 1 при чотирьох нічиїх, повідомляє Ars Technica.

Результат вражає не стільки рахунком, скільки цінником. Ataraxos тренувався лише на 16 графічних процесорах протягом тижня, а також на чотирьох додаткових графічних процесорах протягом чотирьох днів, щоб навчити супутню модель — за словами команди, запуск коштував лише кілька тисяч доларів. DeepNash від DeepMind, система 2022 року, яка вперше привернула серйозну увагу ШІ до гри, тренувалася протягом двох-трьох місяців на 1024 спеціалізованих чіпах TPU від Google, і, за оцінками команди Ataraxos, запуск коштував би від 3 до 4,5 мільйонів доларів США за цінами 2025 року. For more context on this story, see our ongoing latest AI developments.

Чому Stratego десятиліттями заважав ШІ

Deep Blue переміг Гаррі Каспарова в шахи в 1997 році. AlphaGo переміг Лі Седола в Go в 2016 році. Покерні боти роками перемагали професіоналів. Stratego витримав — навіть проти значних ресурсів DeepMind.

Складність гри полягає в її незвичайному поєднанні прихованої інформації, масштабу та довжини. Кожен гравець керує 40 фігурами, що представляють військові звання, від маршала до шпигуна, а також бомби та прапор. Ви виграєте, захопивши прапор супротивника. Ваш суперник бачить, де знаходяться ваші фігури, але не бачить, що вони. Особи виявляються лише тоді, коли дві частини стикаються, і слабша частина вилучається.

«У Stratego на дошці є 40 елементів, які можуть бути в будь-якому порядку», — сказала Ars Technica Габріеле Фаріна, комп’ютерний науковець Массачусетського технологічного інституту та співавтор дослідження. Це дозволяє зробити більш ніж децильйон можливих налаштувань — перевищуючи 1326 можливих роздач у Техаському Холдемі, грі, зламаній багато років тому. Довжина ускладнює проблему: «У шахах зазвичай гра триває 40 ходів, але в Stratego гра може легко тривати 2000 ходів», — сказав Фаріна.

Тоді йде блеф. Переміщення слабкої фігури так, ніби це маршал, може налякати опонента, але занадто часто блефувати та погрози нічого не значать; ніколи не блефуйте, і ви станете передбачуваним. Цей акт балансування – це те, що завадило попереднім системам, таким як DeepNash, досягти вершини.

«У Stratego є щось надзвичайно особливе, а саме те, що це величезна кількість прихованої інформації, яка розгортається протягом дуже тривалого часу», — сказав Євген Вініцький, дослідник Нью-Йоркського університету та інший співавтор.

Друга нейронна мережа, яка вгадує

Ataraxos навчився так само, як і DeepNash: граючи сам проти себе, загалом 163 мільйони ігор, посилюючи ходи, які призвели до виграшів, і пригнічуючи ті, які ні. Перше вдосконалення команди полягало в тому, наскільки система коригується після кожної гри, оскільки прихована інформація має тенденцію надсилати алгоритми самоігри по колу. Ataraxos вніс значні зміни в стратегію на початку тренувань і дедалі обережніше — пізніше.

Більшого прориву в DeepNash ніколи не було: думати наперед перед кожним кроком. Уточнення на основі пошуку перед діями — це те, що зробило AlphaGo потужним, але DeepMind не зміг змусити його працювати в Stratego, оскільки простір пошуку був надто великим.

Рішенням стала друга нейронна мережа — модель віри, навчена вгадувати приховані фігури супротивника за тим, як вони рухалися. Замість того, щоб повторювати всі можливі схеми, Ataraxos відбирає правдоподібні, розігрує можливі ходи в кожному та вибирає на основі результатів. Провідний автор Семюел Сокота та Фаріна також написали спеціальний симулятор, який запускає мільйони рухів за секунду на відеокартах, саме тому академічна лабораторія могла дозволити собі навчальний запуск. «У тому масштабі, в якому ми працюємо в академічному середовищі, ми насправді не маємо доступу до цілої області графічних процесорів», — сказав Фаріна.

Чемпіон-людина повернувся

Німейєр, який є володарем чотирьох чемпіонатів світу та понад 600 тижнів був найкращим гравцем у світі, зіграв 20 онлайн-ігор проти Ataraxos протягом трьох тижнів, заробляючи 100 доларів США за кожну перемогу. Він знав, що штучний інтелект не адаптується до нього, даючи йому час полювати на слабкі місця. Йому вдалося перемогти рівно раз.

Дослідники кажуть, що одинична втрата не була недоліком. Хороша стратегія вимагає рандомізації ваших налаштувань, тому удача завжди відіграє свою роль. "Навіть ідеальна стратегія іноді просто програє", - сказав Фаріна.

Людські гравці на Чемпіонаті світу зі стратегії 2025 року показали набагато гірші результати: учасники, які кинули виклик Атараксосу, виграли лише 2 із 40 ігор. Бот навіть змінив те, як люди грають, спотворивши метагру незвичайними варіантами, як-от засунути свій прапор у кут лише за двома бомбами — таке налаштування рідко грають.

Назва системи походить від давньогрецького слова «спокій», і дослідники кажуть, що якість проявляється в її грі. Хоча людина може грати в азартні ігри, щоб відновити дефіцит, Ataraxos повертається повільно й методично. «Ми спостерігали, як бот «блефує» на шляху назад із двовідсотковою ймовірністю перемоги, дуже, дуже невимушено», — сказав Вініцький.

Що це означає за межами дошки

Перемагати людей в іграх із прихованою інформацією — це більше, ніж салонний трюк. Техніки міркування про приватний стан опонента лежать в основі реальних додатків, де інформація неповна — переговорні системи, кібербезпека, економічне моделювання та багатоагентна координація тощо.

Ракурс ефективності може виявитися найвпливовішою частиною історії. У 2022 році передова лабораторія витратила кілька місяців на обчислення цієї проблеми; команда науковців відтворила та перевищила результат приблизно за ціною вживаного автомобіля у 2026 році. Оскільки дослідження штучного інтелекту стають синонімом величезних обчислювальних бюджетів, Ataraxos є нагадуванням про те, що алгоритмічні ідеї — тут модель віри, яка приборкує величезний простір пошуку — все ще можуть мати більше значення, ніж необроблений масштаб.

Стаття команди описує машину, яка зберігає спокій в умовах невизначеності, ігнорує знання, які людина не могла ігнорувати, і блефує краще, ніж найкращі у світі. Це корисні навички як на дошці, так і поза нею.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →