Google DeepMind 发布了其 15 年游戏人工智能研究的详细回顾,最终与 EVE Online 背后的独立工作室 Fenris Creations 建立了研究合作伙伴关系,并列出了两个组织计划在 EVE 宇宙中运行的分阶段研究计划。

8 月 21 日的这篇文章由 Alexandre Moufarek 和 Adrian Bolton 撰写,将实验室最早的强化学习成果与其当前的多面手智能体工作联系起来。这是对今年早些时候首次公布的合作伙伴关系的最全面的统计,它标志着世界领先的人工智能实验室之一相信人工智能研究的下一个前沿领域在于:不是掌握一款具有明确分数的游戏,而是在自 2003 年以来一直持续运行的生机勃勃的世界中生存下来。

从 Atari Pixels 到 AlphaStar

回顾回顾了构建 DeepMind 研究项目的游戏结果链。 2015 年《自然》杂志的一篇论文中描述的深度 Q 网络 (DQN) 学会了直接从原始像素玩 49 款 Atari 2600 游戏(从 Pong 到 Breakout 到 Space Invaders),无需任何特定于游戏的工程,有助于促进深度强化学习的现代时代。

随后的每个里程碑都会产生更强大、更通用的系统。 AlphaGo 在 2016 年击败了世界冠军李世石,许多专家认为这一壮举还需要十年的时间。 AlphaGo Zero 完全通过自我对弈学习,超越了之前的所有版本,而 AlphaZero 将这种方法推广到用单一算法掌握国际象棋、将棋和围棋。 MuZero 更进一步,在不了解规则的情况下学习玩游戏。 2019 年,AlphaStar 在《星际争霸 II》中达到了大师级别,能够应对实时复杂性和不完美信息。

DeepMind 指出,这种探索精神超越了游戏:AlphaFold 将相同的基础应用于蛋白质结构预测,这一突破获得了 2024 年诺贝尔化学奖的认可。

向通才代理的转变

这篇文章提出了方向的根本改变。早期的工作表明,只要有明确的目标和足够的训练,人工智能就可以掌握任何游戏。但是,正如作者所写,“现实世界没有分数和规则书。”这就引出了一个不同的问题:人工智能能否像人一样理解任何游戏世界并与之互动?

实现这一目标的工具是 SIMA,即可扩展、可指导的多世界代理。 SIMA 不是为了获得高分而进行优化,而是感知玩家在屏幕上看到的内容,理解自然语言指令,并通过普通键盘和鼠标控制进行操作,无需 API 或源代码访问。 SIMA 2 于 2025 年 11 月推出,以 Gemini 模型为核心,充当能够实时推理和对话的互动伴侣,并在包括《无人深空》、《英灵殿》和《Hydroneer》在内的复杂 3D 环境中实现类人游戏。

该实验室对智能体的局限性持坦率态度:SIMA 2 仍然难以处理长期任务,并且工作时的内存受到低延迟交互所需的上下文窗口的限制。它仍然是少数学者和游戏开发者可以使用的有限研究预览。

为什么《星战前夜》在线

Fenris Creations 的合作伙伴关系让 DeepMind 能够接触到任何基准都无法复制的东西:一个持久的、单分片的宇宙,其中成千上万的玩家共享一个具有真实供需动态的经济体、跨越数千个恒星系统的贸易网络,以及完全由玩家互动构建的政治结构。

DeepMind 确定了该环境旨在锻炼的四种能力:持续学习而不忘记、远远超出当今模型上下文窗口的记忆、数周、数月甚至数年的长期规划,以及涵盖合作、竞争、谈判和经济的复杂多智能体动态。

Fenris Creations 首席执行官 Hilmar Pétursson 在帖子中表示:“与 Google DeepMind 一起,我们正在进入一个未知的领域,人工智能必须在其他游戏环境所不需要的时间尺度上学习、适应和记忆,同时帮助我们了解人类和人工智能如何在虚拟环境中共存,然后我们才能应对现实生活中的相同问题。”

此次合作涵盖三个不同的环境。 EVE Online 提供了大规模的持久宇宙。 EVE Vanguard 增加了第一人称、快节奏的战术决策,创造了研究跨多个抽象级别操作的代理的机会——从抽搐级别的战术到跨越星系的战略。 EVE Frontier 凭借其可编程智能组件和开放式架构,呈现出一个规则可以改变的世界。

至关重要的是,该研究计划遵循分阶段的路径。它从 EVE Online 的离线实例开始,这是一个与现场玩家分开的安全沙箱。然后,它通过 EVE Frontier 前进,研究人类和特工如何在一个持久的、开放的世界中共存。只有当能力成熟时,DeepMind 才会考虑将它们带入现场游戏中——然后,帖子强调,目的是丰富人类的游戏。

人工智能已经进入驾驶舱

此次合作的一项成果已经呈现在玩家面前。 Aura Guidance 使用 Gemini 提供玩家生成的知识,这些知识来自真实的新手帮助问题和答案,以帮助新飞行员,该软件于 2026 年 2 月 17 日以原型形式推出,并且正在作为受控 A/B 测试运行,衡量它是否可以提高新玩家的保留率。

对于游戏开发商来说,长期利益重大。一个真正通用的游戏代理(无需修改游戏代码即可与现有游戏配合使用)可以为真正理解游戏世界的 AI 伙伴、以脚本系统无法实现的方式适应的 NPC 提供支持,并在开发过程中(当游戏因每次提交而发生变化时)提供强大的 QA 测试。

这篇文章以实验室的最终框架结束:人工智能作为催化剂,而不是替代品。 “游戏一直是智力的一面镜子,”作者写道。随着游戏变得更加复杂、更加持久、更加开放,用于导航游戏的人工智能系统也变得更加复杂,就像之前的 AlphaGo 和 AlphaFold 一样,DeepMind 期望在虚拟世界中学到的经验教训能够转化为现实世界中的问题。

保持人工智能领先地位

从强化学习里程碑到前沿研究合作伙伴关系,发现的步伐没有放缓的迹象。 AI Buzz Wire 通过经过来源验证的报告涵盖了每项主要的人工智能研究进展——没有猜测,没有炒作。

阅读更多人工智能研究新闻 →