Google DeepMind đã xuất bản bản hồi cứu chi tiết về hành trình 15 năm nghiên cứu AI trong trò chơi của mình, đỉnh cao là mối quan hệ hợp tác nghiên cứu với Fenris Creations, studio độc lập đằng sau EVE Online — và đưa ra chương trình nghiên cứu theo giai đoạn mà hai tổ chức dự định thực hiện bên trong vũ trụ EVE.

Bài đăng ngày 21 tháng 8, do Alexandre Moufarek và Adrian Bolton viết, kết nối các kết quả học tập tăng cường sớm nhất của phòng thí nghiệm với công việc hiện tại của họ về các tác nhân tổng quát. Đây là báo cáo đầy đủ nhất về mối quan hệ hợp tác lần đầu tiên được công bố vào đầu năm nay và nó báo hiệu rằng một trong những phòng thí nghiệm AI hàng đầu thế giới tin rằng biên giới tiếp theo của nghiên cứu AI nằm ở: không phải ở việc thành thạo một trò chơi duy nhất với số điểm rõ ràng mà ở việc sống sót trong một thế giới sống đã vận hành liên tục kể từ năm 2003.

Từ Atari Pixels đến AlphaStar

Quá trình hồi tưởng theo dõi chuỗi kết quả trò chơi đã xây dựng nên chương trình nghiên cứu của DeepMind. Deep Q-Network (DQN), được mô tả trong một bài báo trên Nature năm 2015, đã học cách chơi 49 trò chơi Atari 2600 trực tiếp từ các pixel thô — từ Pong đến Breakout đến Space Invaders — mà không cần bất kỳ kỹ thuật dành riêng cho trò chơi nào, giúp thúc đẩy kỷ nguyên hiện đại của học tăng cường sâu.

Mỗi cột mốc tiếp theo đều tạo ra những hệ thống có khả năng hơn và tổng quát hơn. AlphaGo đã đánh bại nhà vô địch thế giới Lee Sedol vào năm 2016, một kỳ tích mà nhiều chuyên gia cho rằng còn phải cả thập kỷ nữa mới có được. AlphaGo Zero vượt trội hơn mọi phiên bản trước bằng cách học hoàn toàn từ việc tự chơi và AlphaZero đã khái quát hóa cách tiếp cận đó để thành thạo cờ vua, shogi và cờ vây bằng một thuật toán duy nhất. MuZero còn tiến xa hơn nữa, học cách chơi mà không hề biết luật. Năm 2019, AlphaStar đạt cấp độ Cao thủ trong StarCraft II, điều hướng độ phức tạp trong thời gian thực và thông tin không hoàn hảo.

DeepMind lưu ý rằng tinh thần khám phá này còn vượt xa cả trò chơi: AlphaFold áp dụng nền tảng tương tự để dự đoán cấu trúc protein, một bước đột phá được công nhận với Giải Nobel Hóa học năm 2024.

Sự chuyển đổi sang các đại lý tổng hợp

Bài đăng tạo nên một sự thay đổi cơ bản về hướng đi. Công việc trước đó đã chứng minh rằng AI có thể thành thạo bất kỳ trò chơi nào nếu có mục tiêu rõ ràng và được đào tạo đầy đủ. Tuy nhiên, như các tác giả viết, “thế giới thực không có điểm số và sách luật.” Điều đó dẫn đến một câu hỏi khác: liệu AI có thể hiểu và tương tác với bất kỳ thế giới trò chơi nào theo cách con người làm không?

Phương tiện thực hiện tham vọng đó là SIMA, Tác nhân đa thế giới có thể hướng dẫn có thể mở rộng. Thay vì tối ưu hóa để đạt điểm cao, SIMA nhận biết những gì người chơi nhìn thấy trên màn hình, hiểu hướng dẫn bằng ngôn ngữ tự nhiên và hành động thông qua điều khiển chuột và bàn phím thông thường — không cần truy cập API hoặc mã nguồn. SIMA 2, được giới thiệu vào tháng 11 năm 2025 với mô hình Gemini làm cốt lõi, hoạt động như một người bạn đồng hành tương tác có khả năng suy luận và trò chuyện theo thời gian thực, đồng thời đạt được lối chơi giống con người trên các môi trường 3D phức tạp bao gồm No Man's Sky, Valheim và Hydroneer.

Phòng thí nghiệm thẳng thắn về các giới hạn của tác nhân: SIMA 2 vẫn gặp khó khăn với các tác vụ có thời gian rất dài và hoạt động trong bộ nhớ ngắn bị hạn chế bởi cửa sổ ngữ cảnh cần thiết để tương tác có độ trễ thấp. Nó vẫn là một bản xem trước nghiên cứu hạn chế dành cho một nhóm nhỏ các học giả và nhà phát triển trò chơi.

Tại sao EVE trực tuyến

Quan hệ đối tác của Fenris Creations mang lại cho DeepMind quyền truy cập vào thứ mà không tiêu chuẩn nào có thể sao chép: một vũ trụ đơn lẻ, bền bỉ, nơi hàng nghìn người chơi chia sẻ một nền kinh tế với động lực cung và cầu thực sự, mạng lưới thương mại trải rộng trên hàng nghìn hệ thống sao và cấu trúc chính trị được xây dựng hoàn toàn bằng sự tương tác của người chơi.

DeepMind xác định bốn khả năng mà môi trường được thiết kế để thực hiện: học tập liên tục mà không quên, trí nhớ mở rộng vượt xa các cửa sổ ngữ cảnh mô hình ngày nay, lập kế hoạch dài hạn trong nhiều tuần, tháng hoặc thậm chí nhiều năm và động lực đa tác nhân phức tạp bao gồm hợp tác, cạnh tranh, đàm phán và kinh tế.

“Cùng với Google DeepMind, chúng tôi đang tiến vào lãnh thổ chưa được khám phá, nơi AI phải học hỏi, thích nghi và ghi nhớ trong khoảng thời gian mà không môi trường trò chơi nào khác yêu cầu, đồng thời giúp chúng tôi hiểu cách con người và AI có thể cùng tồn tại trong môi trường ảo trước khi chúng ta phải đối mặt với những câu hỏi tương tự trong đời thực”, Giám đốc điều hành Fenris Creations, Hilmar Pétursson, cho biết trong bài đăng.

Sự hợp tác kéo dài ba môi trường riêng biệt. EVE Online cung cấp vũ trụ bền vững quy mô lớn. EVE Vanguard bổ sung khả năng ra quyết định chiến thuật ở góc nhìn thứ nhất, nhịp độ nhanh, tạo cơ hội nghiên cứu các tác nhân hoạt động trên nhiều cấp độ trừu tượng — từ chiến thuật cấp độ co giật đến chiến lược trải dài thiên hà. EVE Frontier, với các Hội đồng thông minh có thể lập trình và kiến ​​trúc mở, mang đến một thế giới nơi chính các quy tắc có thể thay đổi.

Điều quan trọng là chương trình nghiên cứu phải đi theo một lộ trình từng giai đoạn. Nó bắt đầu trong phiên bản ngoại tuyến của EVE Online, một hộp cát an toàn tách biệt với người chơi trực tiếp. Sau đó, nó tiến triển thông qua EVE Frontier để nghiên cứu cách con người và các tác nhân có thể cùng tồn tại trong một thế giới mở, bền bỉ. Chỉ khi các khả năng đã trưởng thành thì DeepMind mới xem xét đưa chúng vào các trò chơi trực tiếp — và sau đó, bài đăng nhấn mạnh, với mục đích làm phong phú thêm lối chơi của con người.

AI đã có trong buồng lái

Một đầu ra của sự hợp tác đã có sẵn trước mắt người chơi. Aura Guidance, sử dụng Gemini để cung cấp kiến ​​thức do người chơi tạo ra rút ra từ các câu hỏi và câu trả lời trong Trợ giúp tân binh thực sự để hỗ trợ các phi công mới, ra mắt dưới dạng nguyên mẫu vào ngày 17 tháng 2 năm 2026 và đang chạy dưới dạng thử nghiệm A/B có kiểm soát để đo lường xem liệu nó có cải thiện khả năng giữ chân người chơi mới hay không.

Đối với các nhà phát triển trò chơi, lợi ích dài hạn là rất đáng kể. Một tác nhân trò chơi thực sự tổng quát — một tác nhân hoạt động với các trò chơi hiện có mà không cần sửa đổi mã trò chơi — có thể hỗ trợ các đối tác AI thực sự hiểu thế giới trò chơi, các NPC thích ứng theo những cách mà các hệ thống theo kịch bản không bao giờ có thể làm được và kiểm tra QA mạnh mẽ trong quá trình phát triển khi trò chơi thay đổi theo từng cam kết.

Bài đăng kết thúc với khuôn khổ cuối cùng của phòng thí nghiệm: AI là chất xúc tác, không phải là vật thay thế. Các tác giả viết: “Trò chơi luôn là tấm gương phản chiếu trí thông minh”. Khi các trò chơi trở nên phức tạp hơn, bền bỉ hơn và có kết thúc mở hơn, thì hệ thống AI được xây dựng để điều hướng chúng cũng vậy — và, giống như AlphaGo và AlphaFold trước đó, DeepMind mong đợi những bài học rút ra trong thế giới ảo sẽ chuyển sang các vấn đề trong thế giới thực.

Đi trước AI

Từ các cột mốc học tập củng cố đến quan hệ đối tác nghiên cứu tiên phong, tốc độ khám phá không có dấu hiệu chậm lại. AI Buzz Wire đề cập đến mọi hoạt động phát triển nghiên cứu AI quan trọng bằng báo cáo đã được xác minh nguồn — không suy đoán, không cường điệu.

Đọc thêm tin tức nghiên cứu AI →