人工智能系统最终征服了 Stratego,一款困扰机器数十年的经典棋盘游戏,而且它在预算有限的情况下做到了这一点。据 Ars Technica 报道,来自卡内基梅隆大学、麻省理工学院、纽约大学和斯坦福大学的研究人员团队构建了一个名为 Ataraxos 的人工智能,它以 15 比 1 和 4 平的比分击败了被广泛认为是有史以来最好的 Stratego 玩家 Pim Niemeijer。

结果比分数更引人注目,而价格标签则更引人注目。 Ataraxos 仅使用 16 个 GPU 进行了大约一周的训练,再加上 4 个额外的 GPU 进行了四天的训练,以训练配套模型 - 该团队表示,这次运行只需花费几千美元。 DeepMind 的 DeepNash 是 2022 年首次引起 AI 游戏关注的系统,它在 1,024 个 Google 专用 TPU 芯片上进行了两到三个月的训练,Ataraxos 团队估计,按照 2025 年的价格计算,运行成本将在 300 万到 450 万美元之间。 更多相关背景,请参阅我们的人工智能资讯。

为什么 Stratego 几十年来一直困扰着人工智能

1997 年,深蓝在国际象棋比赛中击败了加里·卡斯帕罗夫。2016 年,AlphaGo 在围棋比赛中击败了李世石。扑克机器人多年来一直击败职业选手。即使面对 DeepMind 的大量资源,Stratego 仍然坚持了下来。

游戏的难度来自于其隐藏信息、规模和长度的不同寻常的组合。每个玩家指挥 40 件代表军衔的棋子,从元帅到间谍,还有炸弹和旗帜。你通过夺取对手的旗帜来获胜。你的对手可以看到你的棋子在哪里,但看不到它们是什么。只有当两块碰撞时,身份才会显露出来,并且较弱的一块会被移除。

“在 Stratego 中,棋盘上有 40 个棋子,可以按任何顺序排列,”麻省理工学院计算机科学家、该研究的合著者 Gabriele Farina 告诉 Ars Technica。这允许超过十亿种可能的设置——这让多年前破解的德州扑克游戏中 1,326 手可能的手牌相形见绌。长度使问题变得更加复杂:“在国际象棋中,通常游戏会持续 40 步,但在 Stratego 中,一局游戏很容易就会持续 2,000 步,”法里纳说。

然后就是虚张声势。像元帅一样移动弱子可以吓跑对手,但虚张声势太频繁,威胁毫无意义;永远不要虚张声势,你就会变得可预测。这种平衡行为使得像 DeepNash 这样的早期系统无法达到顶峰。

纽约大学研究员、另一位合著者尤金·维尼茨基 (Eugene Vinitsky) 表示:“Stratego 有一个非常独特的地方,那就是它隐藏着大量隐藏信息,而且会在很长一段时间内展现出来。”

第二个猜测神经网络

Ataraxos 学习的基本方法与 DeepNash 的基本方法相同:通过与自己对弈,总共进行了 1.63 亿场比赛,加强了导致胜利的棋步并削弱了那些无法获胜的棋步。该团队的第一个改进是每场比赛后系统的调整程度,因为隐藏的信息往往会让自我对弈算法陷入循环。阿塔拉索斯在训练初期做出了巨大的策略改变,后来也变得更加谨慎。

更大的突破是 DeepNash 从未有过的:在每一步行动之前都进行深思熟虑。在行动之前基于搜索的细化使 AlphaGo 变得强大,但 DeepMind 无法使其在 Stratego 中发挥作用,因为搜索空间太大了。

解决方案是第二个神经网络——一个信念模型,经过训练可以根据对手的移动方式猜测对手的隐藏棋子。阿塔拉索斯不是迭代每一种可能的排列,而是对看似合理的排列进行抽样,在每个排列中进行候选走法,并根据结果进行选择。主要作者塞缪尔·索科塔(Samuel Sokota)和法里纳(Farina)还编写了一个定制模拟器,每秒在显卡上运行数百万次移动,这就是学术实验室能够承担训练运行的费用。 “就我们学术界的规模而言,我们并没有真正接触到 GPU 的整个领域,”Farina 说。

人类冠军逆转

Niemeijer 拥有四次世界冠军,并作为世界排名第一的选手已经超过 600 周,他在三周内与 Ataraxos 进行了 20 场在线比赛,每场胜利赚取 100 美元。他知道人工智能不会适应他,这让他有时间寻找弱点。他只赢了一次。

研究人员表示,单一损失并不是缺陷。好的策略需要随机化你的设置,所以运气总是很重要。 “即使是完美的策略,有时也会失败,”法里纳说。

2025 年 Stratego 世界锦标赛上的人类玩家表现要差得多:挑战 Ataraxos 的参赛者仅赢得了 40 场比赛中的 2 场。该机器人甚至改变了人们的游戏方式,通过不寻常的选择来扭曲元游戏,例如将其旗帜塞到两颗炸弹后面的角落里——这是一种很少玩的设置。

该系统的名称源自古希腊语,意为“平静”,研究人员表示,其质量体现在其运行过程中。人类可能会通过疯狂赌博来弥补赤字,但阿塔拉索斯却能缓慢而有条不紊地恢复元气。 “我们会看着机器人‘虚张声势’地从百分之二的胜利概率中恢复过来,非常非常随意,”维尼茨基说。

董事会之外的含义

在隐藏信息游戏中击败人类不仅仅是一个室内把戏。推理对手私有状态的技术支撑着信息不完整的实际应用——谈判系统、网络安全、经济建模和多主体协调等等。

效率角度可能是故事中最有影响力的部分。 2022 年,前沿实验室花费了数月的时间来解决这个问题;一个学术团队复制了这一结果,并在 2026 年以大约一辆二手车的价格超越了这一结果。随着人工智能研究成为大量计算预算的代名词,Ataraxos 提醒我们,算法思想(这里是一种驯服巨大搜索空间的信念模型)仍然比原始规模更重要。

该团队的论文描述了一种机器,它可以在不确定的情况下保持冷静,忽略人类无法忽略的知识,并且比世界上最好的机器更能虚张声势。无论是在棋盘上还是棋盘外,这些都是有用的技能。

---

掌握AI最新动态

获取最新的AI新闻、分析和突破——尽在一处。

阅读更多AI新闻 →