एआय सिस्टीमने अखेरीस स्ट्रॅटेगोवर विजय मिळवला आहे, जो क्लासिक बोर्ड गेम आहे ज्याने अनेक दशकांपासून मशिनला स्टंप केले होते — आणि त्याने हे शुस्ट्रिंग बजेटमध्ये केले. कार्नेगी मेलॉन युनिव्हर्सिटी, एमआयटी, न्यूयॉर्क युनिव्हर्सिटी आणि स्टॅनफोर्ड युनिव्हर्सिटीच्या संशोधकांच्या टीमने एटारॅक्सोस नावाचे एआय तयार केले ज्याने पिम निमेइजर, ज्यांना सर्वकाळातील सर्वोत्कृष्ट स्ट्रॅटेगो प्लेयर म्हणून ओळखले जाते, 15 गेमच्या स्कोअरने चार ड्रॉसह 1 ने पराभूत केले, Ars Technica अहवाल देते.
परिणाम किंमत टॅगपेक्षा स्कोअरलाइनसाठी कमी उल्लेखनीय आहे. Ataraxos ने सुमारे एक आठवडा फक्त 16 GPU वर प्रशिक्षित केले, शिवाय चार अतिरिक्त GPU वर चार दिवसांसाठी सहचर मॉडेलला प्रशिक्षण दिले — एक रन टीम म्हणते की फक्त काही हजार डॉलर्सची किंमत आहे. DeepMind's DeepNash, 2022 ची सिस्टीम ज्याने गेमकडे प्रथम गंभीर AI लक्ष वेधले, Google च्या 1,024 विशेष TPU चिप्सवर दोन ते तीन महिने प्रशिक्षित केले गेले, ज्याची किंमत 2025 च्या किंमतींवर $3 दशलक्ष ते $4.5 दशलक्ष दरम्यान असेल असा Ataraxos टीमचा अंदाज आहे. For more context on this story, see our ongoing AI trends.
का स्ट्रॅटेगो एआयला दशकांपासून स्टंप केले
डीप ब्लूने 1997 मध्ये बुद्धीबळात गॅरी कास्पारोव्हला हरवले. अल्फागोने 2016 मध्ये गो येथे ली सेडोलचा पराभव केला. पोकर बॉट्सने अनेक वर्षांपासून व्यावसायिकांना हरवले आहे. स्ट्रॅटेगो बाहेर ठेवले — अगदी DeepMind च्या सिंहाचा संसाधने विरुद्ध.
गेमची अडचण लपलेली माहिती, स्केल आणि लांबी यांच्या असामान्य संयोजनातून येते. प्रत्येक खेळाडूला लष्करी रँकचे प्रतिनिधित्व करणाऱ्या ४० तुकड्या, मार्शलपासून ते गुप्तहेर, तसेच बॉम्ब आणि ध्वज यांचा आदेश असतो. प्रतिस्पर्ध्याचा झेंडा हस्तगत करून तुम्ही जिंकता. तुमचा विरोधक तुमचे तुकडे कोठे आहेत ते पाहू शकतो, परंतु ते काय आहेत ते पाहू शकत नाही. दोन तुकडे आदळल्यावरच ओळख उघड होते आणि कमकुवत तुकडा काढला जातो.
"स्ट्रॅटेगोमध्ये, बोर्डवर 40 तुकडे आहेत जे कोणत्याही क्रमाने असू शकतात," गॅब्रिएल फारिना, एमआयटी संगणक शास्त्रज्ञ आणि अभ्यासाचे सह-लेखक, आर्स टेक्निकाला सांगितले. ते एक decillion शक्य सेटअप पेक्षा अधिक परवानगी देते — टेक्सास Hold'em मध्ये 1,326 संभाव्य हात dwarfing, एक गेम संगणक वर्षांपूर्वी क्रॅक. लांबीमुळे समस्या निर्माण होते: "बुद्धिबळात, सहसा खेळ 40 चाली चालतो, परंतु स्ट्रॅटेगोमध्ये, एक खेळ सहजपणे 2,000 चाली चालतो," फारिना म्हणाली.
मग बडबड होते. एखाद्या कमकुवत तुकड्याला मार्शल असल्यासारखे हलवल्याने प्रतिस्पर्ध्याला घाबरवता येते, परंतु अनेकदा फुशारकी मारणे आणि धमक्यांना काहीही अर्थ नाही; कधीही बडबड करू नका आणि तुम्ही अंदाज लावू शकता. या समतोल कृतीने दीपनॅश सारख्या पूर्वीच्या प्रणालींना शीर्षस्थानी पोहोचण्यापासून रोखले.
NYU मधील संशोधक आणि दुसरे सह-लेखक युजीन विनितस्की म्हणाले, "स्ट्रॅटेगो बद्दल काहीतरी वेगळे आहे, ते म्हणजे ही खूप मोठ्या प्रमाणात लपलेली माहिती आहे जी खूप दीर्घ कालावधीत उलगडते."
अंदाज लावणारे दुसरे न्यूरल नेटवर्क
Ataraxos ने दीपनॅशने केले त्याच पद्धतीने शिकले: स्वतःच्या विरुद्ध खेळून, एकूण 163 दशलक्ष गेम, बळकट चाली ज्यामुळे जिंकले गेले आणि जे झाले नाहीत त्यांना ओलावणे. संघाची पहिली सुधारणा प्रत्येक गेमनंतर सिस्टम किती समायोजित करते, कारण लपलेली माहिती मंडळांमध्ये सेल्फ-प्ले अल्गोरिदम पाठवते. Ataraxos ने प्रशिक्षणाच्या सुरुवातीच्या काळात मोठ्या धोरणात बदल केले आणि नंतर अधिक सावधगिरी बाळगली.
डीपनॅशला कधीही न मिळालेले मोठे यश: प्रत्येक हालचालीपूर्वी पुढे विचार करणे. अभिनय करण्यापूर्वी शोध-आधारित परिष्करणामुळे अल्फागो शक्तिशाली बनले, परंतु डीपमाइंड ते स्ट्रॅटेगोमध्ये कार्य करू शकले नाही कारण शोध जागा खूप मोठी होती.
उपाय म्हणजे दुसरे न्यूरल नेटवर्क — एक विश्वास मॉडेल, प्रतिस्पर्ध्याच्या लपलेल्या तुकड्यांचा अंदाज लावण्याचे प्रशिक्षण दिले गेले की ते कसे हलवत आहेत. प्रत्येक संभाव्य व्यवस्थेद्वारे पुनरावृत्ती करण्याऐवजी, Ataraxos प्रशंसनीय नमुने घेतात, प्रत्येकामध्ये उमेदवाराच्या हालचाली दाखवतात आणि परिणामांवर आधारित निवड करतात. मुख्य लेखक सॅम्युअल सोकोटा आणि फारिना यांनी एक सानुकूल सिम्युलेटर देखील लिहिले जे ग्राफिक्स कार्ड्सवर प्रति सेकंद लाखो चाल चालवते, जे शैक्षणिक प्रयोगशाळेला प्रशिक्षण चालवण्याची क्षमता कशी आहे. "आम्ही शैक्षणिक क्षेत्रात आहोत त्या प्रमाणात, आम्हाला खरोखर GPU च्या संपूर्ण क्षेत्रात प्रवेश नाही," फरिना म्हणाली.
मानवी चॅम्पियनला एक परत मिळाले
निमेइजर, ज्यांच्याकडे चार जागतिक अजिंक्यपद आहे आणि त्याने जगातील अव्वल दर्जाचा खेळाडू म्हणून 600 आठवड्यांहून अधिक काळ घालवला आहे, त्याने अटाराक्सोसविरुद्ध तीन आठवड्यांत 20 ऑनलाइन गेम खेळले आणि प्रत्येक विजयासाठी $100 कमावले. त्याला माहित होते की एआय त्याच्याशी जुळवून घेणार नाही, त्याला कमकुवतपणा शोधण्यासाठी वेळ देत आहे. तो एकदाच जिंकण्यात यशस्वी झाला.
संशोधकांचे म्हणणे आहे की एकल नुकसान हा दोष नव्हता. चांगल्या स्ट्रॅटेगोसाठी तुमचा सेटअप यादृच्छिक करणे आवश्यक आहे, त्यामुळे नशीब नेहमीच भूमिका बजावते. "एक परिपूर्ण रणनीती देखील, कधी कधी ती फक्त गमावेल," फारिना म्हणाली.
2025 स्ट्रॅटेगो वर्ल्ड चॅम्पियनशिपमधील मानवी खेळाडूंनी खूपच वाईट कामगिरी केली: अटाराक्सोसला आव्हान देणाऱ्या उपस्थितांनी 40 पैकी फक्त 2 गेम जिंकले. बॉटने लोक कसे खेळतात ते देखील बदलले, मेटागेमला फक्त दोन बॉम्बच्या मागे एका कोपऱ्यात टेकवण्यासारख्या असामान्य पर्यायांसह मेटागेमला तिरकस केले - क्वचितच खेळला जाणारा सेटअप.
या प्रणालीचे नाव शांत या प्राचीन ग्रीक शब्दावरून आले आहे आणि संशोधकांचे म्हणणे आहे की त्याच्या नाटकात गुणवत्ता दिसून येते. एखादी व्यक्ती तूट भरून काढण्यासाठी जंगलीपणे जुगार खेळू शकते, तर अटारॅक्सोस हळूहळू आणि पद्धतशीरपणे त्याच्या मार्गावर काम करतो. "आम्ही बॉट 'ब्लफ'ला दोन टक्के विजयाच्या संभाव्यतेप्रमाणे परत येताना पाहणार आहोत, अगदी अनौपचारिकपणे," विनितस्की म्हणाला.
बोर्डाच्या पलीकडे याचा अर्थ काय
लपलेल्या-माहिती गेममध्ये मानवांना मारहाण करणे ही पार्लर युक्तीपेक्षा अधिक आहे. प्रतिस्पर्ध्याच्या खाजगी स्थितीबद्दल तर्क करण्याचे तंत्र वास्तविक अनुप्रयोगांना आधार देतात जेथे माहिती अपूर्ण आहे — वाटाघाटी प्रणाली, सायबर सुरक्षा, आर्थिक मॉडेलिंग आणि मल्टी-एजंट समन्वय, काही नावे.
कार्यक्षमतेचा कोन कथेचा सर्वात प्रभावशाली भाग सिद्ध करू शकतो. 2022 मध्ये फ्रंटियर लॅबने या समस्येवर अनेक महिने मोजणी केली; एका शैक्षणिक संघाने 2026 मध्ये वापरलेल्या कारच्या अंदाजे किमतीसाठी परिणामाची प्रतिकृती बनवली आणि ती ओलांडली. AI संशोधन मोठ्या मोजणी बजेटचा समानार्थी बनत असताना, Ataraxos हे अल्गोरिदमिक कल्पनांचे स्मरण करून देणारे आहे — येथे, एक विश्वास मॉडेल जे मोठ्या शोध जागेवर नियंत्रण ठेवते — तरीही कच्च्या स्केलपेक्षा जास्त महत्त्वाचे असू शकते.
संघाच्या पेपरमध्ये अशा मशीनचे वर्णन केले आहे जे अनिश्चिततेमध्ये शांत राहते, ज्या ज्ञानाकडे मानव दुर्लक्ष करू शकत नाही त्याकडे दुर्लक्ष करते आणि जगातील सर्वोत्कृष्टपेक्षा चांगले स्पष्ट करते. ती उपयुक्त कौशल्ये आहेत, बोर्डवर आणि त्यापासून दूर.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →