Google DeepMind는 EVE Online의 독립 스튜디오인 Fenris Creations와의 연구 파트너십을 통해 15년간의 게임 AI 연구에 대한 자세한 회고전을 발표했으며, 두 조직이 EVE 세계 내에서 실행할 계획인 단계적 연구 프로그램을 마련했습니다.
Alexandre Moufarek과 Adrian Bolton이 작성한 8월 21일 게시물은 연구소의 초기 강화 학습 결과를 일반 에이전트에 대한 현재 작업과 연결합니다. 이는 올해 초 처음 공개된 파트너십에 대한 가장 완전한 설명이며, 세계 최고의 AI 연구소 중 하나가 AI 연구의 다음 개척지는 명확한 점수로 단일 게임을 마스터하는 것이 아니라 2003년부터 지속적으로 실행되고 있는 살아있는 세계에서 살아남는 것이라고 믿고 있음을 나타냅니다.
Atari Pixel에서 AlphaStar까지
회고전에서는 DeepMind의 연구 프로그램을 구축한 일련의 게임 결과를 추적합니다. 2015년 Nature 논문에 설명된 DQN(Deep Q-Network)은 게임별 엔지니어링 없이 Pong에서 Breakout, Space Invaders에 이르기까지 원시 픽셀에서 직접 49개의 Atari 2600 게임을 플레이하는 방법을 학습하여 심층 강화 학습의 현대 시대를 촉진하는 데 도움이 됩니다.
이후의 각 이정표는 더욱 유능하고 일반적인 시스템을 만들어냈습니다. AlphaGo는 2016년에 세계 챔피언 이세돌을 꺾었습니다. 많은 전문가들은 아직 10년이 더 남았다고 생각했습니다. AlphaGo Zero는 셀프 플레이를 통해 완전히 학습함으로써 모든 이전 버전을 능가했으며 AlphaZero는 마스터 체스, 장기 및 바둑에 대한 접근 방식을 단일 알고리즘으로 일반화했습니다. MuZero는 더 나아가 규칙을 모르고 플레이하는 방법을 배웠습니다. 2019년에 AlphaStar는 스타크래프트 II에서 그랜드마스터 레벨에 도달하여 실시간 복잡성과 불완전한 정보를 탐색했습니다.
DeepMind는 이러한 탐구 정신이 게임을 넘어서는 것이라고 지적합니다. AlphaFold는 동일한 기초를 단백질 구조 예측에 적용했으며, 이는 2024년 노벨 화학상으로 인정받은 획기적인 성과입니다.
일반 상담원으로의 전환
포스트는 근본적인 방향 변화를 제시합니다. 이전 연구에서는 AI가 명확한 목표와 충분한 훈련을 통해 모든 게임을 마스터할 수 있음을 보여주었습니다. 그러나 저자가 쓴 것처럼 "실제 세계에는 점수와 규칙서가 제공되지 않습니다." 이는 다른 질문으로 이어졌습니다. AI가 사람처럼 모든 게임 세계를 이해하고 상호 작용할 수 있습니까?
그 야망을 위한 수단은 Scalable Instructable Multiworld Agent인 SIMA입니다. 높은 점수를 위해 최적화하는 대신 SIMA는 플레이어가 화면에서 보는 것을 인식하고 자연어 지침을 이해하며 일반적인 키보드 및 마우스 제어를 통해 작동합니다. API나 소스 코드 액세스가 필요하지 않습니다. Gemini 모델을 핵심으로 2025년 11월에 출시된 SIMA 2는 실시간 추론과 대화가 가능한 대화형 동반자 역할을 하며 No Man's Sky, Valheim 및 Hydroneer를 포함한 복잡한 3D 환경에서 인간과 같은 플레이를 달성합니다.
연구실에서는 에이전트의 한계에 대해 솔직하게 말합니다. SIMA 2는 여전히 매우 긴 작업을 수행하는 데 어려움을 겪고 있으며 지연 시간이 짧은 상호 작용에 필요한 컨텍스트 창으로 인해 제한된 짧은 메모리에서 작동합니다. 이는 소수의 학계 및 게임 개발자 집단이 이용할 수 있는 제한된 연구 미리보기로 남아 있습니다.
EVE가 온라인인 이유
Fenris Creations 파트너십을 통해 DeepMind는 어떤 벤치마크도 복제할 수 없는 것에 액세스할 수 있습니다. 즉, 수천 명의 플레이어가 실제 수요와 공급 역학을 통해 하나의 경제를 공유하는 지속적인 단일 샤드 우주, 수천 개의 항성계에 걸친 무역 네트워크, 전적으로 플레이어 상호 작용으로 구축된 정치 구조입니다.
DeepMind는 환경이 실행하도록 설계된 네 가지 기능을 식별합니다. 즉, 잊지 않는 지속적인 학습, 오늘날의 모델 컨텍스트 창을 훨씬 뛰어 넘는 메모리, 몇 주, 몇 달, 심지어 몇 년에 걸친 장기 계획, 협력, 경쟁, 협상 및 경제를 포괄하는 복잡한 다중 에이전트 역학입니다.
펜리스 크리에이션스(Fenris Creations) CEO 힐마르 페투르손(Hilmar Pétursson)은 "구글 딥마인드와 함께 우리는 AI가 다른 게임 환경에서 요구하지 않는 시간 단위로 학습하고, 적응하고, 기억해야 하는 미지의 영역으로 나아가고 있으며, 실제 생활에서 동일한 질문에 직면하기 전에 인간과 AI가 가상 환경에서 어떻게 공존할 수 있는지 이해하는 데 도움을 주고 있다"고 말했습니다.
파트너십은 세 가지 서로 다른 환경에 걸쳐 있습니다. EVE Online은 대규모 영구 우주를 제공합니다. EVE Vanguard는 1인칭의 빠르게 진행되는 전술적 의사 결정을 추가하여 트위치 수준 전술에서 은하계 전략에 이르기까지 다양한 추상화 수준에서 작동하는 에이전트를 연구할 수 있는 기회를 만듭니다. 프로그래밍 가능한 스마트 어셈블리와 개방형 아키텍처를 갖춘 EVE Frontier는 규칙 자체가 바뀔 수 있는 세상을 제시합니다.
결정적으로, 연구 프로그램은 단계적인 경로를 따릅니다. 라이브 플레이어와 분리된 안전한 샌드박스인 EVE Online의 오프라인 인스턴스에서 시작됩니다. 그런 다음 EVE Frontier를 통해 지속적이고 개방적인 세계에서 인간과 에이전트가 어떻게 공존할 수 있는지 연구합니다. 기능이 성숙한 경우에만 DeepMind는 이를 라이브 게임에 도입하는 것을 고려할 것이며, 그런 다음 인간 플레이를 풍요롭게 하는 것을 목표로 게시물에서 강조합니다.
AI는 이미 조종석에 있습니다
협업의 결과물 중 하나는 이미 플레이어 앞에 있습니다. Gemini를 사용하여 실제 Rookie Help 질문과 답변에서 추출한 플레이어 생성 지식을 전달하여 신규 파일럿을 지원하는 Aura Guidance는 2026년 2월 17일에 프로토타입으로 출시되었으며 신규 플레이어 유지율을 향상하는지 여부를 측정하는 통제된 A/B 테스트로 실행되고 있습니다.
게임 개발자에게는 장기적인 이해관계가 중요합니다. 게임 코드를 수정하지 않고 기존 게임과 함께 작동하는 진정한 일반 게임 에이전트는 게임 세계를 진정으로 이해하는 AI 동료, 스크립트 시스템이 결코 할 수 없는 방식으로 적응하는 NPC, 커밋할 때마다 게임이 변경될 때 개발 중에 강력한 QA 테스트를 수행할 수 있습니다.
게시물은 연구실의 궁극적인 구성, 즉 대체가 아닌 촉매로서의 AI라는 말로 마무리됩니다. 저자는 "게임은 항상 지능의 거울이었습니다."라고 썼습니다. 게임이 더욱 복잡해지고, 지속적이고, 개방적이 됨에 따라 게임을 탐색하기 위해 구축된 AI 시스템도 마찬가지입니다. 이전의 AlphaGo 및 AlphaFold와 마찬가지로 DeepMind는 가상 세계에서 배운 교훈이 실제 게임의 문제로 전환될 것으로 기대합니다.
AI보다 앞서 나가세요
강화 학습 이정표부터 개척 연구 파트너십까지, 발견의 속도는 둔화될 기미를 보이지 않습니다. AI Buzz Wire는 추측이나 과대광고 없이 소스 검증 보고를 통해 모든 주요 AI 연구 개발을 다룹니다.
AI 연구 뉴스 자세히 보기 →