System sztucznej inteligencji w końcu podbił Stratego, klasyczną grę planszową, która przez dziesięciolecia zaskakiwała maszyny – i udało się to przy skromnym budżecie. Zespół naukowców z Carnegie Mellon University, MIT, New York University i Stanford University zbudował sztuczną inteligencję o nazwie Ataraxos, która pokonała Pima Niemeijera, powszechnie uważanego za najlepszego gracza Stratego wszech czasów, wynikiem 15 gier do 1 i czterema remisami, podaje Ars Technica.
Wynik jest mniej uderzający w przypadku wyniku niż w przypadku ceny. Ataraxos trenował na zaledwie 16 procesorach graficznych przez około tydzień oraz na czterech dodatkowych procesorach graficznych przez cztery dni w celu wytrenowania modelu towarzyszącego – koszt, który według zespołu wynosi zaledwie kilka tysięcy dolarów. DeepNash firmy DeepMind, system z 2022 r., który jako pierwszy zwrócił uwagę sztucznej inteligencji na grę, był trenowany przez dwa do trzech miesięcy na 1024 wyspecjalizowanych chipach TPU firmy Google. Według szacunków zespołu Ataraxos koszt takiego uruchomienia będzie wynosić od 3 do 4,5 mln dolarów według cen z 2025 r. Więcej kontekstu na ten temat znajdziesz w naszych wiadomości AI.
Dlaczego Stratego zakłócał sztuczną inteligencję przez dziesięciolecia
Deep Blue pokonał Garry'ego Kasparowa w szachach w 1997 r. AlphaGo pokonał Lee Sedola w Go w 2016 r. Boty pokerowe pokonują profesjonalistów od lat. Stratego wytrzymał — nawet wbrew znacznym zasobom DeepMind.
Trudność gry wynika z niezwykłego połączenia ukrytych informacji, skali i długości. Każdy gracz ma do dyspozycji 40 figurek reprezentujących stopnie wojskowe, od marszałka po szpiega, a także bomby i flagę. Wygrywasz, zdobywając flagę przeciwnika. Twój przeciwnik może zobaczyć, gdzie znajdują się Twoje pionki, ale nie jakie są. Tożsamość ujawnia się dopiero wtedy, gdy zderzą się dwie części, a słabsza część zostanie usunięta.
„W Stratego na planszy znajduje się 40 elementów, które można ułożyć w dowolnej kolejności” – powiedziała Ars Technica Gabriele Farina, informatyk z MIT i współautorka badania. To pozwala na więcej niż decylion możliwych konfiguracji – przyćmiewając 1326 możliwych rozdań w Texas Hold'em, grze złamanej komputerowo wiele lat temu. Problem pogłębia długość: „W szachach partia zwykle trwa 40 ruchów, ale w Stratego partia może z łatwością trwać 2000 ruchów” – powiedziała Farina.
Potem następuje blef. Poruszanie słabą figurą niczym marszałkiem może odstraszyć przeciwnika, ale zbyt częste blefy i groźby nic nie znaczą; nigdy nie blefuj, a staniesz się przewidywalny. To balansowanie powstrzymywało wcześniejsze systemy, takie jak DeepNash, przed osiągnięciem szczytu.
„Jest coś wyjątkowo charakterystycznego w Stratego, a mianowicie to, że jest to ogromna ilość ukrytych informacji, które ujawniają się w bardzo długiej skali czasu” – powiedział Eugene Vinitsky, badacz z Uniwersytetu Nowojorskiego i inny współautor.
Druga sieć neuronowa, która zgaduje
Ataraxos uczył się w ten sam podstawowy sposób, co DeepNash: grając przeciwko sobie, łącznie rozegrał 163 miliony gier, wzmacniając ruchy, które doprowadziły do zwycięstw i tłumiąc te, które nie doprowadziły do zwycięstwa. Pierwszą poprawą, jaką zespół wprowadził, było dostosowanie systemu po każdej grze, ponieważ ukryte informacje mają tendencję do zakreślania algorytmów gry samodzielnej. Ataraxos dokonał dużych zmian w strategii na początku treningu, a później wprowadzał je coraz ostrożniej.
Większym przełomem było coś, czego DeepNash nigdy nie przeżyło: myślenie o przyszłości przed każdym ruchem. Udoskonalanie oparte na wyszukiwaniu przed podjęciem działania sprawiło, że AlphaGo jest potężna, ale DeepMind nie mógł sprawić, by zadziałało w Stratego, ponieważ przestrzeń wyszukiwania była zbyt duża.
Rozwiązaniem była druga sieć neuronowa — model przekonań, wytrenowany w odgadywaniu ukrytych elementów przeciwnika na podstawie sposobu, w jaki się poruszał. Zamiast iterować po każdym możliwym układzie, Ataraxos próbuje tych prawdopodobnych, odtwarza potencjalne ruchy w każdym z nich i wybiera na podstawie wyników. Główny autor Samuel Sokota i Farina napisali także niestandardowy symulator, który wykonuje miliony ruchów na sekundę na kartach graficznych, dzięki czemu laboratorium akademickie mogło sobie pozwolić na przebieg szkolenia. „Przy skali, jaką mamy w środowisku akademickim, tak naprawdę nie mamy dostępu do całej dziedziny procesorów graficznych” – powiedziała Farina.
Człowieczy mistrz otrzymał jednego w zamian
Niemeijer, czterokrotny mistrz świata i spędził ponad 600 tygodni jako czołowy gracz na świecie, rozegrał 20 meczów online przeciwko Ataraxosowi w ciągu trzech tygodni, zarabiając 100 dolarów za każde zwycięstwo. Wiedział, że sztuczna inteligencja nie dostosuje się do niego, dając mu czas na polowanie na słabości. Udało mu się wygrać dokładnie raz.
Naukowcy twierdzą, że pojedyncza strata nie jest wadą. Dobra strategia wymaga losowego ustawienia, więc szczęście zawsze odgrywa rolę. „Nawet doskonała strategia czasami po prostu przegra” – powiedziała Farina.
Gracze będący ludźmi na Mistrzostwach Świata Stratego 2025 wypadli znacznie gorzej: uczestnicy, którzy rzucili wyzwanie Ataraxosowi, wygrali tylko 2 z 40 gier. Bot zmienił nawet sposób, w jaki ludzie grają, wypaczając metagrę, dokonując nietypowych wyborów, takich jak umieszczenie flagi w rogu za zaledwie dwiema bombami – co jest rzadko spotykaną konfiguracją.
Nazwa systemu pochodzi od starożytnego greckiego słowa oznaczającego spokój, a naukowcy twierdzą, że jakość widać w jego grze. Podczas gdy człowiek może szaleć z hazardem, aby odzyskać siły po deficytie, Ataraxos wraca powoli i metodycznie. „Obserwowaliśmy, jak bot «blefuje» z prawdopodobieństwem zwycięstwa wynoszącym około dwa procent, bardzo, bardzo przypadkowo” – powiedział Vinitsky.
Co to oznacza poza tablicą
Pokonywanie ludzi w grach polegających na ukrytych informacjach to coś więcej niż tylko sztuczka salonowa. Techniki wnioskowania na temat stanu prywatnego przeciwnika stanowią podstawę rzeczywistych zastosowań, w których informacje są niekompletne — to tylko kilka przykładów, takich jak systemy negocjacyjne, cyberbezpieczeństwo, modelowanie ekonomiczne i koordynacja wielu agentów.
Kąt efektywności może okazać się najbardziej wpływową częścią historii. W 2022 r. pionierskie laboratorium spędziło miesiące na obliczeniach nad tym problemem; zespół akademicki powtórzył i przekroczył ten wynik za mniej więcej cenę używanego samochodu w 2026 r. Ponieważ badania nad sztuczną inteligencją stają się synonimem ogromnych budżetów obliczeniowych, Ataraxos przypomina, że pomysły algorytmiczne — w tym przypadku model przekonań, który oswaja ogromną przestrzeń poszukiwań — nadal mogą mieć większe znaczenie niż surowa skala.
Artykuł zespołu opisuje maszynę, która zachowuje spokój w obliczu niepewności, ignoruje wiedzę, której człowiek nie jest w stanie zignorować, i blefuje lepiej niż najlepsi na świecie. To przydatne umiejętności, zarówno na planszy, jak i poza nią.
---
Bądź na Bieżąco z AINajnowsze wiadomości, analizy i przełomy w dziedzinie AI — wszystko w jednym miejscu.
Czytaj więcej wiadomości AI →