Google DeepMind ha publicado una retrospectiva detallada de su arco de 15 años de investigación de IA en juegos, que culmina en su asociación de investigación con Fenris Creations, el estudio independiente detrás de EVE Online, y presenta el programa de investigación por etapas que las dos organizaciones planean ejecutar dentro del universo EVE.
La publicación del 21 de agosto, escrita por Alexandre Moufarek y Adrian Bolton, conecta los primeros resultados del aprendizaje por refuerzo del laboratorio con su trabajo actual con agentes generalistas. Es la contabilidad más completa hasta el momento de una asociación presentada por primera vez a principios de este año, y señala dónde uno de los principales laboratorios de IA del mundo cree que está la próxima frontera de la investigación de IA: no en dominar un solo juego con una puntuación clara, sino en sobrevivir a un mundo vivo que ha estado funcionando continuamente desde 2003.
De los píxeles de Atari a AlphaStar
La retrospectiva rastrea la cadena de resultados del juego que construyeron el programa de investigación de DeepMind. Deep Q-Network (DQN), descrita en un artículo de Nature de 2015, aprendió a jugar 49 juegos de Atari 2600 directamente desde píxeles sin procesar (desde Pong hasta Breakout y Space Invaders) sin ninguna ingeniería específica del juego, lo que ayudó a catalizar la era moderna del aprendizaje por refuerzo profundo.
Cada hito posterior produjo sistemas más capaces y más generales. AlphaGo derrotó al campeón mundial Lee Sedol en 2016, una hazaña que muchos expertos pensaban que aún faltaba una década. AlphaGo Zero superó todas las versiones anteriores al aprender completamente del juego autónomo, y AlphaZero generalizó ese enfoque para dominar el ajedrez, el shogi y el Go con un único algoritmo. MuZero fue aún más lejos y aprendió a jugar sin siquiera conocer las reglas. En 2019, AlphaStar alcanzó el nivel Gran Maestro en StarCraft II, navegando por la complejidad en tiempo real y la información imperfecta.
DeepMind señala que este espíritu de exploración iba más allá de los juegos: AlphaFold aplicó los mismos fundamentos a la predicción de la estructura de las proteínas, un avance reconocido con el Premio Nobel de Química de 2024.
El cambio hacia agentes generalistas
La publicación enmarca un cambio fundamental de dirección. Trabajos anteriores demostraron que la IA podía dominar cualquier juego con un objetivo claro y suficiente entrenamiento. Pero, como escriben los autores, "el mundo real no viene con puntajes ni libros de reglas". Eso llevó a una pregunta diferente: ¿puede la IA comprender e interactuar con cualquier mundo de juego como lo haría una persona?
El vehículo para esa ambición es SIMA, el agente multimundo escalable e instructable. En lugar de optimizar para obtener una puntuación alta, SIMA percibe lo que un jugador ve en la pantalla, comprende instrucciones en lenguaje natural y actúa a través de controles normales de teclado y mouse, sin necesidad de API ni acceso al código fuente. SIMA 2, presentado en noviembre de 2025 con un modelo Gemini en su núcleo, actúa como un compañero interactivo capaz de razonar y conversar en tiempo real, y logra un juego similar al humano en entornos 3D complejos, incluidos No Man's Sky, Valheim e Hydroneer.
El laboratorio es sincero sobre los límites del agente: SIMA 2 todavía tiene dificultades con tareas de horizontes muy largos y funciona con una memoria corta limitada por la ventana de contexto necesaria para la interacción de baja latencia. Sigue siendo una vista previa de la investigación limitada disponible para un pequeño grupo de académicos y desarrolladores de juegos.
¿Por qué EVE en línea?
La asociación Fenris Creations le da a DeepMind acceso a algo que ningún punto de referencia puede replicar: un universo persistente de un solo fragmento donde miles de jugadores comparten una economía con dinámicas reales de oferta y demanda, redes comerciales que abarcan miles de sistemas estelares y estructuras políticas construidas enteramente por la interacción de los jugadores.
DeepMind identifica cuatro capacidades que el entorno está diseñado para ejercitar: aprendizaje continuo sin olvidar, memoria que se extiende mucho más allá de las ventanas de contexto del modelo actual, planificación a largo plazo durante semanas, meses o incluso años, y dinámicas complejas de múltiples agentes que abarcan la cooperación, la competencia, la negociación y la economía.
"Junto con Google DeepMind, estamos avanzando hacia un territorio inexplorado donde la IA debe aprender, adaptarse y recordar en escalas de tiempo que ningún otro entorno de juego exige, mientras nos ayuda a comprender cómo los humanos y la IA pueden coexistir en un entorno virtual antes de que tengamos que lidiar con las mismas preguntas en la vida real", dijo en la publicación el director ejecutivo de Fenris Creations, Hilmar Pétursson.
La asociación abarca tres entornos distintos. EVE Online ofrece el universo persistente a gran escala. EVE Vanguard agrega toma de decisiones tácticas de ritmo rápido en primera persona, creando oportunidades para estudiar agentes que operan en múltiples niveles de abstracción, desde tácticas de nivel de contracción hasta estrategias que abarcan galaxias. EVE Frontier, con sus ensamblajes inteligentes programables y su arquitectura abierta, presenta un mundo donde las mismas reglas pueden cambiar.
Fundamentalmente, el programa de investigación sigue un camino por etapas. Comienza en una instancia fuera de línea de EVE Online, un entorno seguro y separado de los jugadores en vivo. Luego avanza a través de EVE Frontier para estudiar cómo los humanos y los agentes pueden coexistir en un mundo persistente y abierto. Solo cuando las capacidades estén maduras, DeepMind consideraría llevarlas a los juegos en vivo, y luego, enfatiza la publicación, con el objetivo de enriquecer el juego humano.
La IA ya está en la cabina
Un resultado de la colaboración ya está ante los jugadores. Aura Guidance, que utiliza Gemini para brindar conocimiento generado por los jugadores a partir de preguntas y respuestas reales de Rookie Help para ayudar a los nuevos pilotos, se lanzó como prototipo el 17 de febrero de 2026 y se ejecuta como una prueba A/B controlada que mide si mejora la retención de nuevos jugadores.
Para los desarrolladores de juegos, lo que está en juego a largo plazo es significativo. Un agente de juegos verdaderamente general, uno que trabaje con juegos existentes sin modificaciones en el código del juego, podría impulsar compañeros de IA que comprendan genuinamente el mundo del juego, NPC que se adapten de maneras que los sistemas escritos nunca podrían hacerlo y pruebas sólidas de control de calidad durante el desarrollo cuando el juego cambia con cada compromiso.
La publicación cierra con el marco definitivo del laboratorio: la IA como catalizador, no como reemplazo. "Los juegos siempre han sido un espejo de la inteligencia", escriben los autores. A medida que los juegos se vuelven más complejos, más persistentes y más abiertos, también lo hacen los sistemas de inteligencia artificial creados para navegar por ellos y, como sucedió con AlphaGo y AlphaFold antes, DeepMind espera que las lecciones aprendidas en los mundos virtuales se transfieran a los problemas del mundo real.
Manténgase por delante de la IA
Desde los hitos del aprendizaje reforzado hasta las asociaciones de investigación de vanguardia, el ritmo de los descubrimientos no muestra signos de desaceleración. AI Buzz Wire cubre todos los principales desarrollos de investigación de IA con informes verificados por fuentes, sin especulaciones ni exageraciones.
Leer más noticias sobre investigación de IA →