Google डीपमाइंड ने खेलों में एआई अनुसंधान के अपने 15-वर्षीय चक्र का एक विस्तृत पूर्वव्यापी विवरण प्रकाशित किया है, जो ईवीई ऑनलाइन के पीछे के स्वतंत्र स्टूडियो, फेनिस क्रिएशंस के साथ अपनी शोध साझेदारी में परिणत हुआ है - और दोनों संगठनों द्वारा ईवीई ब्रह्मांड के अंदर चलाने की योजना के चरणबद्ध अनुसंधान कार्यक्रम की रूपरेखा तैयार की गई है।

एलेक्जेंडर मौफारेक और एड्रियन बोल्टन द्वारा लिखित 21 अगस्त की पोस्ट, लैब के शुरुआती सुदृढीकरण सीखने के परिणामों को सामान्यवादी एजेंटों पर इसके वर्तमान काम से जोड़ती है। यह इस साल की शुरुआत में पहली बार अनावरण की गई साझेदारी का अब तक का सबसे पूर्ण लेखा-जोखा है, और यह संकेत देता है कि दुनिया की अग्रणी एआई प्रयोगशालाओं में से एक का मानना ​​है कि [एआई अनुसंधान] (https://aibuzzwire.news) की अगली सीमा स्पष्ट स्कोर के साथ एक भी खेल में महारत हासिल करने में नहीं है, बल्कि एक जीवित दुनिया में जीवित रहने में है जो 2003 से लगातार चल रही है।

अटारी पिक्सल से लेकर अल्फास्टार तक

पूर्वव्यापी गेम परिणामों की श्रृंखला का पता लगाता है जिसने डीपमाइंड के अनुसंधान कार्यक्रम का निर्माण किया। 2015 के नेचर पेपर में वर्णित डीप क्यू-नेटवर्क (डीक्यूएन) ने बिना किसी गेम-विशिष्ट इंजीनियरिंग के, बिना किसी गेम-विशिष्ट इंजीनियरिंग के, कच्चे पिक्सल से सीधे 49 अटारी 2600 गेम खेलना सीखा - पोंग से ब्रेकआउट से लेकर स्पेस इनवेडर्स तक, जो गहन सुदृढीकरण सीखने के आधुनिक युग को उत्प्रेरित करने में मदद करता है।

प्रत्येक आगामी मील के पत्थर ने अधिक सक्षम और अधिक सामान्य प्रणालियाँ उत्पन्न कीं। अल्फ़ागो ने 2016 में विश्व चैंपियन ली सेडोल को हराया, एक ऐसी उपलब्धि जिसके बारे में कई विशेषज्ञों का मानना ​​था कि अभी एक दशक दूर है। अल्फ़ागो ज़ीरो ने पूरी तरह से सेल्फ-प्ले से सीखकर हर पिछले संस्करण को पीछे छोड़ दिया, और अल्फ़ाज़ेरो ने एक ही एल्गोरिदम के साथ शतरंज, शोगी और गो में महारत हासिल करने के लिए उस दृष्टिकोण को सामान्यीकृत किया। मुज़ेरो और भी आगे बढ़ गया, उसने नियमों को जाने बिना ही खेलना सीख लिया। 2019 में, अल्फास्टार वास्तविक समय की जटिलता और अपूर्ण जानकारी को नेविगेट करते हुए, स्टारक्राफ्ट II में ग्रैंडमास्टर स्तर तक पहुंच गया।

डीपमाइंड नोट करता है कि अन्वेषण की यह भावना खेलों से परे है: अल्फाफोल्ड ने प्रोटीन संरचना भविष्यवाणी के लिए समान नींव लागू की, रसायन विज्ञान में 2024 के नोबेल पुरस्कार से मान्यता प्राप्त एक सफलता।

जनरलिस्ट एजेंटों की ओर बदलाव

पोस्ट दिशा में एक मूलभूत परिवर्तन की रूपरेखा प्रस्तुत करता है। पहले के काम से पता चला है कि स्पष्ट उद्देश्य और पर्याप्त प्रशिक्षण दिए जाने पर एआई किसी भी खेल में महारत हासिल कर सकता है। लेकिन, जैसा कि लेखक लिखते हैं, "वास्तविक दुनिया स्कोर और नियम पुस्तिकाओं के साथ नहीं आती है।" इससे एक अलग सवाल खड़ा हो गया: क्या एआई किसी भी गेम की दुनिया को उसी तरह समझ और इंटरैक्ट कर सकता है, जिस तरह एक व्यक्ति करता है?

उस महत्वाकांक्षा का माध्यम SIMA, स्केलेबल इंस्ट्रक्शनल मल्टीवर्ल्ड एजेंट है। उच्च स्कोर के लिए अनुकूलन करने के बजाय, SIMA यह समझता है कि एक खिलाड़ी स्क्रीन पर क्या देखता है, प्राकृतिक भाषा निर्देशों को समझता है, और सामान्य कीबोर्ड और माउस नियंत्रण के माध्यम से कार्य करता है - कोई एपीआई या स्रोत कोड एक्सेस की आवश्यकता नहीं है। SIMA 2, जिसे नवंबर 2025 में जेमिनी मॉडल के मूल में पेश किया गया था, वास्तविक समय में तर्क और बातचीत करने में सक्षम एक इंटरैक्टिव साथी के रूप में कार्य करता है, और नो मैन्स स्काई, वाल्हेम और हाइड्रोनीर सहित जटिल 3D वातावरणों में मानव-जैसा खेल प्राप्त करता है।

लैब एजेंट की सीमाओं के बारे में स्पष्ट है: SIMA 2 अभी भी बहुत लंबे-क्षितिज वाले कार्यों से जूझता है और कम-विलंबता इंटरैक्शन के लिए आवश्यक संदर्भ विंडो द्वारा बाधित छोटी मेमोरी से काम करता है। यह शिक्षाविदों और गेम डेवलपर्स के एक छोटे समूह के लिए उपलब्ध एक सीमित शोध पूर्वावलोकन है।

ईव ऑनलाइन क्यों

फेनरिस क्रिएशन्स की साझेदारी डीपमाइंड को कुछ ऐसी चीज़ों तक पहुंच प्रदान करती है जिसे कोई भी बेंचमार्क दोहरा नहीं सकता है: एक सतत, एकल-शार्क ब्रह्मांड जहां हजारों खिलाड़ी वास्तविक आपूर्ति-और-मांग गतिशीलता के साथ एक अर्थव्यवस्था साझा करते हैं, हजारों स्टार सिस्टम में फैले व्यापार नेटवर्क, और पूरी तरह से खिलाड़ी इंटरैक्शन द्वारा निर्मित राजनीतिक संरचनाएं।

डीपमाइंड उन चार क्षमताओं की पहचान करता है जिनका उपयोग करने के लिए पर्यावरण को डिज़ाइन किया गया है: बिना भूले निरंतर सीखना, स्मृति जो आज के मॉडल संदर्भ विंडो से कहीं आगे तक फैली हुई है, हफ्तों, महीनों या यहां तक ​​कि वर्षों में लंबी-क्षितिज योजना, और सहयोग, प्रतिस्पर्धा, बातचीत और अर्थशास्त्र तक फैली जटिल मल्टी-एजेंट गतिशीलता।

"Google डीपमाइंड के साथ मिलकर, हम अज्ञात क्षेत्र में आगे बढ़ रहे हैं जहां एआई को समय के पैमाने पर सीखना, अनुकूलित करना और याद रखना होगा जो कि कोई अन्य गेम वातावरण नहीं मांगता है, साथ ही हमें यह समझने में मदद करता है कि वास्तविक जीवन में समान प्रश्नों से जूझने से पहले इंसान और एआई एक आभासी वातावरण में कैसे सह-अस्तित्व में रह सकते हैं," फेनरिस क्रिएशंस के सीईओ हिल्मर पेटर्सन ने पोस्ट में कहा।

साझेदारी तीन अलग-अलग परिवेशों तक फैली हुई है। ईवीई ऑनलाइन बड़े पैमाने पर सतत ब्रह्मांड की पेशकश करता है। ईवीई वैनगार्ड प्रथम-व्यक्ति, तेज़-तर्रार सामरिक निर्णय लेने को जोड़ता है, जो अमूर्तता के कई स्तरों पर काम करने वाले एजेंटों का अध्ययन करने के अवसर पैदा करता है - चिकोटी-स्तर की रणनीति से लेकर आकाशगंगा-फैली रणनीति तक। ईवीई फ्रंटियर, अपनी प्रोग्राम योग्य स्मार्ट असेंबली और खुली वास्तुकला के साथ, एक ऐसी दुनिया प्रस्तुत करता है जहां नियम बदल सकते हैं।

महत्वपूर्ण रूप से, अनुसंधान कार्यक्रम एक चरणबद्ध पथ का अनुसरण करता है। इसकी शुरुआत ईवीई ऑनलाइन के ऑफ़लाइन उदाहरण से होती है, जो लाइव खिलाड़ियों से अलग एक सुरक्षित सैंडबॉक्स है। इसके बाद यह अध्ययन करने के लिए ईवीई फ्रंटियर के माध्यम से आगे बढ़ता है कि मनुष्य और एजेंट एक सतत, खुले अंत वाली दुनिया में कैसे सह-अस्तित्व में रह सकते हैं। जब क्षमताएं परिपक्व होंगी तभी डीपमाइंड उन्हें लाइव गेम में लाने पर विचार करेगा - और फिर, पोस्ट में मानव खेल को समृद्ध करने के उद्देश्य से जोर दिया गया है।

AI पहले से ही कॉकपिट में है

सहयोग का एक आउटपुट पहले से ही खिलाड़ियों के सामने है। ऑरा गाइडेंस, जो नए पायलटों की सहायता के लिए वास्तविक रूकी सहायता प्रश्नों और उत्तरों से प्राप्त खिलाड़ी-जनित ज्ञान प्रदान करने के लिए जेमिनी का उपयोग करता है, 17 फरवरी, 2026 को प्रोटोटाइप में लॉन्च किया गया था, और यह मापने के लिए एक नियंत्रित ए/बी परीक्षण के रूप में चल रहा है कि क्या यह नए-खिलाड़ी प्रतिधारण में सुधार करता है।

गेम डेवलपर्स के लिए, दीर्घकालिक दांव महत्वपूर्ण हैं। वास्तव में एक सामान्य गेमिंग एजेंट - जो गेम कोड में संशोधन के बिना मौजूदा गेम के साथ काम करता है - एआई साथियों को शक्ति प्रदान कर सकता है जो वास्तव में गेम की दुनिया को समझते हैं, एनपीसी जो स्क्रिप्टेड सिस्टम को कभी भी अनुकूलित नहीं कर सकते हैं, और विकास के दौरान मजबूत क्यूए परीक्षण जब गेम हर प्रतिबद्धता के साथ बदलता है।

पोस्ट लैब की अंतिम रूपरेखा के साथ समाप्त होती है: एआई एक उत्प्रेरक के रूप में है, प्रतिस्थापन के रूप में नहीं। लेखक लिखते हैं, "खेल हमेशा बुद्धिमत्ता का दर्पण रहे हैं।" जैसे-जैसे खेल अधिक जटिल, अधिक सतत और अधिक खुले-अंत वाले होते जाते हैं, वैसे-वैसे उन्हें नेविगेट करने के लिए बनाए गए एआई सिस्टम भी बनते हैं - और, इससे पहले अल्फ़ागो और अल्फ़ाफ़ोल्ड की तरह, डीपमाइंड को उम्मीद है कि आभासी दुनिया में सीखे गए पाठ वास्तविक समस्याओं में स्थानांतरित हो जाएंगे।

एआई से आगे रहें

सुदृढीकरण सीखने के मील के पत्थर से लेकर अग्रणी अनुसंधान साझेदारी तक, खोज की गति धीमी होने का कोई संकेत नहीं दिखाती है। एआई बज़ वायर स्रोत-सत्यापित रिपोर्टिंग के साथ हर प्रमुख एआई अनुसंधान विकास को कवर करता है - कोई अटकलें नहीं, कोई प्रचार नहीं।

अधिक AI शोध समाचार पढ़ें →