Google DeepMind は、EVE Online の背後にある独立系スタジオである Fenris Creations との研究提携で頂点に達する、ゲームにおける AI 研究の 15 年にわたる詳細な回顧録を公開しました。また、両組織が EVE ユニバース内で実行する予定の段階的な研究プログラムの概要を示しています。
Alexandre Moufarek と Adrian Bolton が執筆した 8 月 21 日の投稿は、研究所の初期の強化学習の結果をジェネラリスト エージェントに関する現在の研究に結び付けています。これは、今年初めに初めて発表されたパートナーシップの詳細な説明であり、世界有数の AI 研究所の 1 つが、AI 研究 の次のフロンティアがどこにあると信じているかを示しています。明確なスコアで 1 つのゲームをマスターすることではなく、2003 年以来継続的に実行されている生きた世界を生き残ることにあります。
Atari ピクセルから AlphaStar へ
この回顧展では、DeepMind の研究プログラムを構築した一連のゲーム結果をたどります。 2015 年の Nature 論文で説明されている Deep Q-Network (DQN) は、ゲーム固有のエンジニアリングを一切行わずに、ポンからブレイクアウト、スペース インベーダーに至るまで、生のピクセルから 49 の Atari 2600 ゲームを直接プレイすることを学習し、現代の深層強化学習の促進に貢献しました。
その後のマイルストーンごとに、より高性能でより汎用的なシステムが生み出されました。 AlphaGoは2016年に世界チャンピオンのイ・セドルを破ったが、多くの専門家はその偉業はまだ10年先だと考えていた。 AlphaGo Zero は、完全にセルフプレイから学習することで以前のすべてのバージョンを上回り、AlphaZero は単一のアルゴリズムでチェス、将棋、囲碁をマスターするそのアプローチを一般化しました。 MuZero はさらに進んで、ルールさえ知らずにプレイすることを学びました。 2019 年、AlphaStar は StarCraft II でグランドマスター レベルに到達し、リアルタイムの複雑さと不完全な情報をナビゲートしました。
DeepMind は、この探求の精神はゲームを超えて受け継がれたと指摘しています。AlphaFold は同じ基礎をタンパク質の構造予測に適用し、これは 2024 年のノーベル化学賞で認められる画期的な成果です。
ジェネラリストエージェントへの移行
この投稿は方向性の根本的な変化を示しています。これまでの研究では、明確な目的と十分なトレーニングがあれば、AI はどんなゲームでもマスターできることが実証されました。しかし、著者が書いているように、「現実の世界にはスコアやルールブックは付属しません」。そのため、別の疑問が生まれました。AI は人間と同じようにゲームの世界を理解し、操作できるのでしょうか?
その野望を実現する手段となるのが、Scalable Instructable Multiworld Agent である SIMA です。 SIMA は、高スコアを目指して最適化するのではなく、プレーヤーが画面上で見ているものを認識し、自然言語の指示を理解し、通常のキーボードとマウスのコントロールを通じて動作します。API やソース コードへのアクセスは必要ありません。 Gemini モデルを中核として 2025 年 11 月に導入された SIMA 2 は、リアルタイムの推論と会話が可能なインタラクティブなコンパニオンとして機能し、No Man's Sky、Valheim、Hydroneer などの複雑な 3D 環境全体で人間のようなプレイを実現します。
ラボはエージェントの限界について率直に述べています。SIMA 2 は依然として非常に長期的なタスクに苦戦しており、低遅延の対話に必要なコンテキスト ウィンドウによって制約された短いメモリで動作します。これは依然として、少数の学者やゲーム開発者が利用できる限られた研究プレビューです。
EVE オンラインを選ぶ理由
Fenris Creations とのパートナーシップにより、DeepMind はベンチマークでは再現できないもの、つまり、何千ものプレイヤーが実際の需要と供給のダイナミクスを備えた 1 つの経済を共有する永続的な単一シャード ユニバース、何千もの星系にまたがる貿易ネットワーク、プレイヤーの相互作用によって完全に構築された政治構造へのアクセスが可能になります。
DeepMind は、環境が実行するように設計されている 4 つの機能を特定しています。それは、忘れることのない継続的な学習、今日のモデルのコンテキスト ウィンドウをはるかに超えて拡張される記憶、数週間、数か月、さらには数年にわたる長期計画、協力、競争、交渉、経済に及ぶ複雑なマルチエージェントのダイナミクスです。
Fenris Creations CEOのHilmar Pétursson氏は、「Google DeepMindと協力して、他のゲーム環境では要求されないタイムスケールでAIが学習、適応、記憶しなければならない未知の領域に進出すると同時に、現実世界で同じ問題に取り組まなければならない前に、人間とAIが仮想環境でどのように共存できるかを理解するのに役立つ」と投稿で述べた。
このパートナーシップは 3 つの異なる環境にまたがります。 EVE Online は大規模な永続ユニバースを提供します。 EVE Vanguard は、一人称視点のペースの速い戦術的意思決定を追加し、トゥイッチ レベルの戦術から銀河系にまたがる戦略に至るまで、複数の抽象レベルにわたって動作するエージェントを研究する機会を生み出します。 EVE Frontier は、プログラム可能なスマート アセンブリとオープン アーキテクチャを備えており、ルール自体が変化する可能性がある世界を提示します。
重要なのは、研究プログラムが段階的な道をたどることです。それは、ライブ プレーヤーから分離された安全なサンドボックスである EVE Online のオフライン インスタンスから始まります。その後、EVE Frontier を通じて、永続的でオープンエンドな世界で人間とエージェントがどのように共存できるかを研究します。機能が成熟した場合にのみ、DeepMind はそれらをライブ ゲームに導入することを検討します。そして、人間のプレイを豊かにすることを目的として投稿では強調されています。
AI はすでにコックピットにあります
コラボレーションの 1 つの成果がすでにプレイヤーの目の前にあります。 Gemini を使用して、新しいパイロットを支援するために実際のルーキー ヘルプの質問と回答から得られたプレイヤー生成の知識を提供する Aura Guide は、2026 年 2 月 17 日にプロトタイプが開始され、新規プレイヤーの定着率が向上するかどうかを測定する管理された A/B テストとして実行されています。
ゲーム開発者にとって、長期的なリスクは非常に重要です。真に汎用的なゲーム エージェント (ゲーム コードを変更することなく既存のゲームで動作するエージェント) は、ゲームの世界を真に理解する AI コンパニオン、スクリプト化されたシステムでは決して不可能な方法で適応する NPC、およびコミットごとにゲームが変更される開発中の堅牢な QA テストを強化できる可能性があります。
この記事は、AI は代替品ではなく触媒であるという、研究室の究極の枠組みで締めくくられています。 「ゲームは常に知性の鏡であった」と著者らは書いている。ゲームがより複雑になり、より永続的で、よりオープンエンドになるにつれて、ゲームをナビゲートするために構築された AI システムも同様に変化します。そして、以前の AlphaGo や AlphaFold と同様に、DeepMind は仮想世界で学んだ教訓が現実の問題に応用されることを期待しています。
AI の先を行く
強化学習のマイルストーンから最先端の研究パートナーシップに至るまで、発見のペースは衰える気配がありません。 AI Buzz Wire は、あらゆる主要な AI 研究開発を情報源が検証されたレポートで取り上げています。憶測や誇大広告は一切ありません。
AI研究ニュースをもっと読む→