AI システムは、数十年にわたってマシンを苦しめてきた古典的なボード ゲームである Stratego をついに克服しました。しかも、限られた予算でそれを達成しました。カーネギーメロン大学、マサチューセッツ工科大学、ニューヨーク大学、スタンフォード大学の研究者チームが Ataraxos と呼ばれる AI を開発し、Stratego 史上最高のプレイヤーと広く認められている Pim Niemeijer を 15 対 1、4 引き分けのスコアで破ったと Ars Technica が報じています。

結果は、スコアラインよりも価格よりも顕著でした。 Ataraxos は、わずか 16 個の GPU で約 1 週間トレーニングし、さらに 4 台の追加の GPU で 4 日間コンパニオン モデルをトレーニングしました。チームによれば、実行費用はわずか数千ドルでした。ゲームにAIが本格的に注目されるようになった2022年のシステムであるDeepMindのDeepNashは、Googleの特殊なTPUチップ1,024個で2~3カ月間トレーニングされたが、Ataraxosチームの試算では、2025年の価格でその実行にかかる費用は300万~450万ドルだった。 この件の詳細は、人工知能の最新情報をご覧ください。

なぜ Stratego は数十年にわたって AI に悩まされてきたのか

ディープ ブルーは 1997 年にチェスでガルリ カスパロフを破りました。2016 年にはアルファ碁が囲碁でイ セドルを破りました。ポーカー ボットは長年にわたりプロを破ってきました。 DeepMind の膨大なリソースに対しても、Stratego は持ちこたえました。

このゲームの難しさは、隠された情報、スケール、長さの異常な組み合わせによって決まります。各プレイヤーは、元帥からスパイまでの軍の階級を表す 40 個のピース​​に加え、爆弾や旗を指揮します。相手のフラッグを奪えば勝ちです。対戦相手はあなたの駒がどこにあるかを見ることはできますが、それが何であるかはわかりません。正体は 2 つのピースが衝突した場合にのみ明らかになり、弱い方のピースが取り除かれます。

「Stratego では、ボード上にはどのような順序でも配置できる 40 個のピース​​があります」と MIT のコンピュータ科学者であり、この研究の共著者であるガブリエレ・ファリーナ氏は Ars Technica に語った。これにより、10 億を超えるセットアップが可能になります。これは、何年も前に解読されたゲーム コンピューターであるテキサス ホールデムの 1,326 通りのハンドを小さくするものです。長さも問題をさらに複雑にします。「チェスでは、通常、ゲームは 40 手で終わりますが、Stratego では、ゲームは簡単に 2,000 手で終わることがあります」とファリーナ氏は言いました。

次に、ブラフがあります。弱い駒をマーシャルのように動かすと、相手を怖がらせることができますが、ブラフが多すぎると脅しは何の意味も持ちません。決してハッタリを掛けないようにすれば、予測可能になります。このバランスをとる行為が、DeepNash のような初期のシステムがトップに到達するのを妨げていたのです。

「Strategoには非常に特徴的な点があります。それは、非常に長い時間スケールで展開される大量の隠された情報であるということです」と、ニューヨーク大学の研究者でもう一人の共著者であるユージン・ヴィニツキーは述べた。

推測する 2 番目のニューラル ネットワーク

Ataraxos は、DeepNash と同じ基本的な方法を学びました。合計 1 億 6,300 万試合を自分自身と対戦し、勝利につながる動きを強化し、そうでない動きを弱めることです。チームの最初の改善点は、各試合後にシステムがどれだけ調整されるかという点でした。これは、隠された情報がセルフプレイ アルゴリズムを循環的に送信する傾向があるためです。アタラクソスはトレーニングの初期段階で大きな戦略変更を行い、後半ではさらに慎重に変更した。

より大きな進歩は、DeepNash にはなかったものでした。それは、行動する前に事前に考えるということでした。行動前の検索ベースの絞り込みが AlphaGo を強力にしましたが、DeepMind は検索スペースが広すぎるため、Stratego ではそれを機能させることができませんでした。

解決策は 2 番目のニューラル ネットワーク、つまり相手の動きから相手の隠された駒を推測するように訓練された信念モデルでした。 Ataraxos は、考えられるすべての配置を繰り返すのではなく、もっともらしい配置をサンプリングし、それぞれで候補となる動きを実行し、結果に基づいて選択します。筆頭著者の Samuel Sokota 氏と Farina 氏は、グラフィックス カード上で 1 秒あたり数百万回の動作を実行するカスタム シミュレータも作成しました。これは、学術研究室がトレーニングを実行する余裕がある方法です。 「私たちが学術界にいるような規模では、GPU の全分野に実際にアクセスすることはできません」とファリーナ氏は言います。

人間のチャンピオンが 1 つを取り戻しました

世界選手権を4回保持し、600週間以上世界トップランクの選手として過ごしてきたニーマイヤーは、アタラクソスと3週間にわたって20のオンラインゲームをプレイし、勝利ごとに100ドルを獲得した。彼は AI が自分に適応しないことを知っており、弱点を探す時間を与えられました。彼は一度だけ勝つことに成功した。

研究者らは、一度の損失は欠陥ではなかったと述べている。優れた戦略にはセットアップをランダム化する必要があるため、常に運が重要な役割を果たします。 「完璧な戦略であっても、時には負けることもあります」とファリーナ氏は言う。

2025 年の Stratego World Championship での人間のプレイヤーの成績ははるかに悪く、Ataraxos に挑戦した参加者は 40 試合中 2 試合しか勝てませんでした。このボットは人々のプレイ方法さえも変え、たった 2 つの爆弾の後ろに旗を隅に押し込むなど、珍しい選択でメタゲームを歪めました。これはめったにプレイされない設定です。

このシステムの名前は、古代ギリシャ語で「静けさ」を意味する言葉に由来しており、研究者らは、その品質がその動作に現れると述べています。人間が赤字から回復するために乱暴なギャンブルをするかもしれない一方で、アタラクソスはゆっくりと系統的に元に戻ります。 「私たちは、ボットが勝利確率 2% 程度から戻ってくるところを『ブラフ』するのを、非常に、非常にカジュアルに観察していました」と Vinitsky 氏は言いました。

取締役会を超えた意味

情報隠蔽ゲームで人間に勝つことは、単なるお座敷のトリック以上のものです。相手のプライベートな状態を推論するための技術は、情報が不完全な実際のアプリケーション、たとえば、交渉システム、サイバーセキュリティ、経済モデリング、マルチエージェント調整などを支えています。

効率性の観点が、この話の中で最も影響力のある部分になるかもしれません。フロンティア ラボは 2022 年にこの問題に数か月を費やして計算しました。学術チームは、2026 年の中古車とほぼ同じ価格でその結果を再現し、それを上回りました。AI 研究が大規模なコンピューティング予算の代名詞となりつつある中、Ataraxos は、アルゴリズムのアイデア (ここでは、巨大な検索空間を飼いならす信念モデル) が生のスケールよりも依然として重要である可能性があることを思い出させてくれます。

チームの論文には、不確実性の中でも冷静さを保ち、人間が無視できない知識を無視し、世界最高のマシンよりも上手にブラフをかけるマシンについて説明されています。これらはボード上でもボード外でも役立つスキルです。

---

AIの最新情報をお届け

AIの最新ニュース、分析、ブレイクスルーを一箇所で。

AIニュースをもっと読む →