एक एआई सिस्टम ने आखिरकार दशकों तक मशीनों को चकमा देने वाले क्लासिक बोर्ड गेम स्ट्रेटेगो पर विजय प्राप्त कर ली है - और इसने यह काम बेहद कम बजट में किया। एर्स टेक्निका की रिपोर्ट के अनुसार, कार्नेगी मेलॉन यूनिवर्सिटी, एमआईटी, न्यूयॉर्क यूनिवर्सिटी और स्टैनफोर्ड यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने अटारैक्सोस नामक एक एआई का निर्माण किया, जिसने पिम निमेइजर को हराया, जिसे व्यापक रूप से सर्वकालिक सर्वश्रेष्ठ स्ट्रेटेगो खिलाड़ी माना जाता है, चार ड्रॉ के साथ 15 गेम के मुकाबले 1 के स्कोर से।

परिणाम मूल्य टैग की तुलना में स्कोरलाइन के लिए कम प्रभावशाली है। एटरैक्सोस ने लगभग एक सप्ताह तक केवल 16 जीपीयू पर प्रशिक्षण लिया, साथ ही एक साथी मॉडल को प्रशिक्षित करने के लिए चार दिनों के लिए चार अतिरिक्त जीपीयू पर प्रशिक्षण दिया - टीम का कहना है कि एक रन की लागत केवल कुछ हजार डॉलर है। डीपमाइंड का डीपनैश, 2022 प्रणाली जिसने सबसे पहले खेल में गंभीर एआई ध्यान आकर्षित किया, Google के 1,024 विशेष टीपीयू चिप्स पर दो से तीन महीने तक प्रशिक्षित किया गया, एटरैक्सोस टीम का अनुमान है कि 2025 की कीमतों पर $ 3 मिलियन और $ 4.5 मिलियन के बीच खर्च होगा। For more context on this story, see our ongoing AI industry coverage.

दशकों तक स्ट्रेटेगो ने एआई को पीछे क्यों रखा

डीप ब्लू ने 1997 में शतरंज में गैरी कास्पारोव को हराया। अल्फ़ागो ने 2016 में गो में ली सेडोल को हराया। पोकर बॉट्स ने वर्षों से पेशेवरों को हराया है। डीपमाइंड के पर्याप्त संसाधनों के बावजूद भी स्ट्रेटेगो ने जीत हासिल की।

खेल की कठिनाई छिपी हुई जानकारी, पैमाने और लंबाई के असामान्य संयोजन से आती है। प्रत्येक खिलाड़ी के पास मार्शल से लेकर जासूस तक, सैन्य रैंकों का प्रतिनिधित्व करने वाली 40 टुकड़ियों का कमांड होता है, साथ ही बम और एक झंडा भी होता है। आप प्रतिद्वंद्वी के झंडे पर कब्ज़ा करके जीतते हैं। आपका प्रतिद्वंद्वी यह देख सकता है कि आपके टुकड़े कहाँ हैं, लेकिन यह नहीं कि वे क्या हैं। पहचान तभी उजागर होती है जब दो टुकड़े टकराते हैं और कमजोर टुकड़ा हट जाता है।

एमआईटी के कंप्यूटर वैज्ञानिक और अध्ययन के सह-लेखक गैब्रिएल फ़रीना ने एर्स टेक्निका को बताया, "स्ट्रेटेगो में, बोर्ड पर 40 टुकड़े हैं जो किसी भी क्रम में हो सकते हैं।" यह एक डेसिलियन से अधिक संभावित सेटअप की अनुमति देता है - टेक्सास होल्डम में 1,326 संभावित हाथों को बौना कर देता है, एक गेम कंप्यूटर जिसे वर्षों पहले क्रैक किया गया था। लंबाई समस्या बढ़ाती है: "शतरंज में, आमतौर पर खेल 40 चालों तक चलता है, लेकिन स्ट्रेटेगो में, एक खेल आसानी से 2,000 चालों तक चल सकता है," फ़रीना ने कहा।

फिर झांसा दिया जाता है. एक कमज़ोर मोहरे को इस तरह हिलाना जैसे कि वह मार्शल हो, प्रतिद्वंद्वी को डरा सकता है, लेकिन बहुत बार धोखा देना और धमकियों का कोई मतलब नहीं होता; कभी भी धोखा न दें और आप पूर्वानुमानित हो जाएंगे। वह संतुलनकारी कार्य ही है जिसने दीपनैश जैसी पिछली प्रणालियों को शीर्ष पर पहुंचने से रोके रखा।

एनवाईयू के एक शोधकर्ता और एक अन्य सह-लेखक यूजीन विनित्स्की ने कहा, "स्ट्रैटेगो के बारे में कुछ बहुत विशिष्ट है, जो यह है कि यह बड़ी मात्रा में छिपी हुई जानकारी है जो बहुत लंबे समय के पैमाने पर सामने आती है।"

एक दूसरा तंत्रिका नेटवर्क जो अनुमान लगाता है

अटारैक्सोस ने वही बुनियादी तरीका सीखा जो दीपनैश ने सीखा था: खुद के खिलाफ खेलकर, कुल मिलाकर 163 मिलियन गेम, उन चालों को मजबूत करना जिनसे जीत मिली और जो नहीं जीत पाईं उन्हें कमजोर कर दिया। टीम का पहला सुधार यह था कि प्रत्येक गेम के बाद सिस्टम को कितना समायोजित किया गया, क्योंकि छिपी हुई जानकारी सर्कल में सेल्फ-प्ले एल्गोरिदम भेजती है। अटारैक्सोस ने प्रशिक्षण के आरंभ में बड़ी रणनीति में बदलाव किए और बाद में अधिक सावधानी बरती।

बड़ी सफलता वह थी जो दीपनैश को कभी नहीं मिली: प्रत्येक कदम से पहले आगे की सोच। अभिनय से पहले खोज-आधारित परिशोधन ने अल्फ़ागो को शक्तिशाली बना दिया, लेकिन डीपमाइंड इसे स्ट्रेटेगो में काम नहीं कर सका क्योंकि खोज स्थान बहुत विशाल था।

समाधान एक दूसरा तंत्रिका नेटवर्क था - एक विश्वास मॉडल, जिसे प्रतिद्वंद्वी के छिपे हुए टुकड़ों का अनुमान लगाने के लिए प्रशिक्षित किया गया था कि वे कैसे आगे बढ़ रहे थे। हर संभव व्यवस्था के माध्यम से पुनरावृत्ति करने के बजाय, अटारैक्सोस प्रशंसनीय लोगों का नमूना लेता है, प्रत्येक में उम्मीदवार की चालें चलाता है, और परिणामों के आधार पर चयन करता है। मुख्य लेखक सैमुअल सोकोटा और फ़रीना ने एक कस्टम सिम्युलेटर भी लिखा है जो ग्राफिक्स कार्ड पर प्रति सेकंड लाखों चालें चलाता है, जिससे एक अकादमिक प्रयोगशाला प्रशिक्षण चलाने का खर्च उठा सकती है। फ़रीना ने कहा, "जिस पैमाने पर हम अकादमिक क्षेत्र में हैं, हमारे पास वास्तव में जीपीयू के पूरे क्षेत्र तक पहुंच नहीं है।"

मानव चैंपियन को एक वापस मिल गया

निमीजेर, जिनके पास चार विश्व चैंपियनशिप हैं और उन्होंने दुनिया के शीर्ष क्रम के खिलाड़ी के रूप में 600 सप्ताह से अधिक समय बिताया है, ने तीन सप्ताह में अटारैक्सोस के खिलाफ 20 ऑनलाइन गेम खेले, और प्रत्येक जीत के लिए $100 कमाए। वह जानता था कि एआई उसके अनुकूल नहीं होगा, जिससे उसे कमजोरियों का पता लगाने का समय मिल जाएगा। वह ठीक एक बार जीतने में सफल रहे।

शोधकर्ताओं का कहना है कि एकल हानि कोई दोष नहीं थी। अच्छी रणनीति के लिए आपके सेटअप को यादृच्छिक बनाने की आवश्यकता होती है, इसलिए भाग्य हमेशा एक भूमिका निभाता है। फ़रीना ने कहा, "यहां तक ​​कि एक आदर्श रणनीति भी, कभी-कभी हार ही जाती है।"

2025 स्ट्रेटेगो वर्ल्ड चैंपियनशिप में मानव खिलाड़ियों का प्रदर्शन बहुत खराब रहा: अटारैक्सोस को चुनौती देने वाले प्रतिभागियों ने 40 में से केवल 2 गेम जीते। बॉट ने लोगों के खेलने के तरीके को भी बदल दिया, मेटागेम को असामान्य विकल्पों के साथ तिरछा कर दिया, जैसे कि अपने झंडे को सिर्फ दो बमों के पीछे एक कोने में छिपाना - एक शायद ही कभी खेला जाने वाला सेटअप।

सिस्टम का नाम शांति के लिए प्राचीन ग्रीक शब्द से आया है, और शोधकर्ताओं का कहना है कि गुणवत्ता इसके खेल में दिखती है। जबकि एक इंसान घाटे से उबरने के लिए बेतहाशा जुआ खेल सकता है, एटरैक्सोस धीरे-धीरे और व्यवस्थित तरीके से काम करता है। विनित्स्की ने कहा, "हम बॉट को दो प्रतिशत जीत की संभावना की तरह बहुत ही लापरवाही से 'धोखा' देते हुए देखेंगे।"

बोर्ड से परे इसका क्या मतलब है

छुपी जानकारी वाले खेलों में इंसानों को हराना एक पार्लर ट्रिक से कहीं अधिक है। प्रतिद्वंद्वी के निजी राज्य के बारे में तर्क करने की तकनीक वास्तविक अनुप्रयोगों को रेखांकित करती है जहां जानकारी अधूरी है - बातचीत प्रणाली, साइबर सुरक्षा, आर्थिक मॉडलिंग और बहु-एजेंट समन्वय, कुछ नाम।

दक्षता कोण कहानी का सबसे प्रभावशाली हिस्सा साबित हो सकता है। 2022 में एक फ्रंटियर लैब ने इस समस्या पर महीनों की गणना की; एक अकादमिक टीम ने 2026 में इस्तेमाल की गई कार की कीमत के परिणाम को दोहराया और पार कर लिया। चूंकि एआई अनुसंधान बड़े पैमाने पर गणना बजट का पर्याय बन गया है, अटारैक्सोस एक अनुस्मारक है कि एल्गोरिदमिक विचार - यहां, एक विश्वास मॉडल जो एक विशाल खोज स्थान को नियंत्रित करता है - अभी भी कच्चे पैमाने से अधिक मायने रख सकता है।

टीम का पेपर एक ऐसी मशीन का वर्णन करता है जो अनिश्चितता के तहत शांत रहती है, उस ज्ञान को नजरअंदाज कर देती है जिसे कोई इंसान नजरअंदाज नहीं कर सकता है, और दुनिया में सर्वश्रेष्ठ से भी बेहतर झांसा देता है। वे उपयोगी कौशल हैं, बोर्ड पर और उसके बाहर।

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →