ஒரு AI அமைப்பு இறுதியாக ஸ்ட்ராடெகோவை வென்றது, இது பல தசாப்தங்களாக இயந்திரங்களை ஸ்டம்ப் செய்த கிளாசிக் போர்டு கேம் - அது ஒரு ஷூஸ்ட்ரிங் பட்ஜெட்டில் செய்தது. Carnegie Mellon University, MIT, New York University மற்றும் Stanford University ஆகியவற்றின் ஆராய்ச்சியாளர்கள் குழு Ataraxos எனப்படும் AI ஐ உருவாக்கியது, இது எல்லா காலத்திலும் சிறந்த ஸ்ட்ராடெகோ பிளேயராக பரவலாகக் கருதப்படும் Pim Niemeijer ஐ தோற்கடித்தது, 15 கேம்கள் 1 க்கு நான்கு டிராக்களுடன், ஆர்ஸ் டெக்னிகா அறிக்கைகள்.

இதன் விளைவாக விலைக் குறியை விட மதிப்பெண்ணைக் குறைவாகத் தாக்குகிறது. Ataraxos ஒரு வாரத்திற்கு வெறும் 16 GPU களில் பயிற்சி பெற்றது, மேலும் நான்கு நாட்களுக்கு நான்கு கூடுதல் GPUகள் துணை மாதிரியைப் பயிற்றுவிக்கின்றன - ஒரு ஓட்டத்திற்கு சில ஆயிரம் டாலர்கள் மட்டுமே செலவாகும் என்று குழு கூறுகிறது. டீப் மைண்டின் டீப்நாஷ், 2022 ஆம் ஆண்டு, விளையாட்டில் தீவிர AI கவனத்தை கொண்டு வந்தது, Google இன் சிறப்பு TPU சில்லுகள் 1,024 இல் இரண்டு முதல் மூன்று மாதங்கள் பயிற்சி பெற்றது, Ataraxos குழுவின் மதிப்பீட்டின்படி 2025 விலையில் $3 மில்லியன் முதல் $4.5 மில்லியன் வரை செலவாகும். For more context on this story, see our ongoing AI news.

ஸ்ட்ராடெகோ ஏன் பல தசாப்தங்களாக AI ஐ ஸ்டம்ப் செய்தது

டீப் ப்ளூ 1997 இல் செஸ்ஸில் கேரி காஸ்பரோவை தோற்கடித்தது. ஆல்பாகோ 2016 இல் கோவில் லீ செடோலை தோற்கடித்தது. போக்கர் போட்கள் பல ஆண்டுகளாக தொழில் வல்லுனர்களை தோற்கடித்துள்ளன. டீப் மைண்டின் கணிசமான வளங்களுக்கு எதிராகவும் - உத்திகள் நீடித்தன.

விளையாட்டின் சிரமமானது மறைக்கப்பட்ட தகவல், அளவு மற்றும் நீளம் ஆகியவற்றின் அசாதாரண கலவையிலிருந்து வருகிறது. ஒவ்வொரு வீரரும் மார்ஷல் முதல் உளவாளி வரை, வெடிகுண்டுகள் மற்றும் ஒரு கொடி வரை இராணுவ அணிகளைக் குறிக்கும் 40 துண்டுகளை கட்டளையிடுகிறார். எதிராளியின் கொடியை கைப்பற்றி வெற்றி பெறுவீர்கள். உங்கள் துண்டுகள் எங்குள்ளது என்பதை உங்கள் எதிரியால் பார்க்க முடியும், ஆனால் அவை என்னவென்று பார்க்க முடியாது. இரண்டு துண்டுகள் மோதும் போது மட்டுமே அடையாளம் தெரியவரும், மேலும் பலவீனமான துண்டு அகற்றப்படும்.

"ஸ்டிராடெகோவில், போர்டில் 40 துண்டுகள் உள்ளன, அவை எந்த வரிசையிலும் இருக்கலாம்" என்று எம்ஐடி கணினி விஞ்ஞானியும் ஆய்வின் இணை ஆசிரியருமான கேப்ரியல் ஃபரினா ஆர்ஸ் டெக்னிகாவிடம் கூறினார். இது ஒரு பத்து கோடிக்கு மேல் சாத்தியமான அமைப்புகளை அனுமதிக்கிறது - டெக்சாஸ் ஹோல்டிமில் 1,326 சாத்தியமான கைகளைக் குள்ளமாக்குகிறது, இது பல ஆண்டுகளுக்கு முன்பு ஒரு விளையாட்டு கணினிகள் சிதைந்தன. நீளம் சிக்கலை அதிகரிக்கிறது: "சதுரங்கத்தில், பொதுவாக விளையாட்டு 40 நகர்வுகள் நீடிக்கும், ஆனால் ஸ்ட்ராடெகோவில், ஒரு விளையாட்டு எளிதாக 2,000 நகர்வுகள் நீடிக்கும்," ஃபரினா கூறினார்.

பின்னர் மங்கலானது. ஒரு பலவீனமான துண்டை ஒரு மார்ஷல் போல் நகர்த்துவது எதிராளியை பயமுறுத்தலாம், ஆனால் அடிக்கடி மிரட்டல் மற்றும் அச்சுறுத்தல்கள் எதுவும் இல்லை; ஒருபோதும் முட்டாள்தனமாக இருப்பீர்கள், நீங்கள் யூகிக்கக்கூடியவராக மாறுவீர்கள். அந்த சமநிலைச் செயல்தான் டீப்நாஷ் போன்ற முந்தைய அமைப்புகளை உச்சத்தை அடைய விடாமல் தடுத்தது.

"ஸ்டிராடெகோவில் மிகவும் தனித்துவமான ஒன்று உள்ளது, அதாவது இது ஒரு பெரிய அளவு மறைக்கப்பட்ட தகவல், இது மிக நீண்ட கால அளவில் வெளிப்படுகிறது" என்று NYU இன் ஆராய்ச்சியாளரும் மற்றொரு இணை ஆசிரியருமான யூஜின் வினிட்ஸ்கி கூறினார்.

யூகிக்கும் இரண்டாவது நரம்பியல் நெட்வொர்க்

டீப்நாஷ் செய்த அதே அடிப்படை வழியை அடராக்ஸோஸ் கற்றுக்கொண்டது: தனக்கு எதிராக விளையாடுவதன் மூலம், மொத்தம் 163 மில்லியன் கேம்களை விளையாடி, வெற்றிகளுக்கு வழிவகுத்த நகர்வுகளை வலுப்படுத்தியது மற்றும் வெற்றி பெறாதவர்களைத் தணித்தது. அணியின் முதல் முன்னேற்றம், ஒவ்வொரு ஆட்டத்திற்குப் பிறகும் கணினி எவ்வளவு சரிசெய்தது என்பதுதான், ஏனெனில் மறைக்கப்பட்ட தகவல்கள் வட்டங்களில் சுய-விளையாட்டு வழிமுறைகளை அனுப்ப முனைகின்றன. Ataraxos பயிற்சியின் ஆரம்பத்தில் பெரிய மூலோபாய மாற்றங்களைச் செய்தார் மற்றும் பின்னர் அதிக கவனத்துடன் இருந்தார்.

பெரிய முன்னேற்றம் டீப்நாஷிடம் இல்லாத ஒன்று: ஒவ்வொரு அசைவிற்கும் முன் யோசிக்க வேண்டும். நடிப்பதற்கு முன் தேடல் அடிப்படையிலான சுத்திகரிப்புதான் AlphaGo ஐ சக்தி வாய்ந்ததாக மாற்றியது, ஆனால் தேடல் இடம் மிக அதிகமாக இருந்ததால் DeepMind அதை Strategoவில் வேலை செய்ய முடியவில்லை.

தீர்வு இரண்டாவது நரம்பியல் வலையமைப்பாகும் - ஒரு நம்பிக்கை மாதிரி, எதிராளியின் மறைக்கப்பட்ட துண்டுகள் எவ்வாறு நகர்கின்றன என்பதை யூகிக்க பயிற்சியளிக்கப்பட்டது. சாத்தியமான ஒவ்வொரு ஏற்பாட்டின் மூலமாகவும் திரும்பத் திரும்பப் பேசுவதற்குப் பதிலாக, அட்டராக்ஸோஸ் நம்பத்தகுந்தவற்றை மாதிரிகள் செய்து, ஒவ்வொன்றிலும் வேட்பாளர் நகர்வுகளை வெளிப்படுத்துகிறது மற்றும் விளைவுகளின் அடிப்படையில் தேர்ந்தெடுக்கிறது. முன்னணி எழுத்தாளர் சாமுவேல் சொகோடா மற்றும் ஃபரினாவும் ஒரு தனிப்பயன் சிமுலேட்டரை எழுதினர், இது கிராபிக்ஸ் கார்டுகளில் வினாடிக்கு மில்லியன் கணக்கான நகர்வுகளை இயக்குகிறது. "நாங்கள் கல்வித்துறையில் இருக்கும் அளவில், ஜிபியுக்களின் முழுத் துறைக்கும் எங்களிடம் உண்மையில் அணுகல் இல்லை" என்று ஃபரினா கூறினார்.

தி ஹ்யூமன் சாம்பியன் கிடைத்தது

நான்கு உலக சாம்பியன்ஷிப்களை பெற்ற நிமிஜெர், 600 வாரங்களுக்கும் மேலாக உலகின் முதல் தரவரிசை வீரராக விளையாடி, மூன்று வாரங்களில் அடராக்ஸுக்கு எதிராக 20 ஆன்லைன் கேம்களை விளையாடி, ஒவ்வொரு வெற்றிக்கும் $100 சம்பாதித்தார். AI தனக்கு ஒத்துப்போகாது என்பதை அவர் அறிந்திருந்தார், பலவீனங்களை வேட்டையாட அவருக்கு நேரம் கொடுத்தார். அவர் சரியாக ஒரு முறை வெற்றி பெற்றார்.

ஒற்றை இழப்பு ஒரு குறை இல்லை என்று ஆராய்ச்சியாளர்கள் கூறுகின்றனர். நல்ல உத்திக்கு உங்கள் அமைப்பை சீரற்றதாக மாற்ற வேண்டும், எனவே அதிர்ஷ்டம் எப்போதும் ஒரு பாத்திரத்தை வகிக்கிறது. "ஒரு சரியான மூலோபாயம் கூட, சில நேரங்களில் அது இழக்க நேரிடும்," ஃபரினா கூறினார்.

2025 ஸ்ட்ராடெகோ உலக சாம்பியன்ஷிப்பில் மனித வீரர்கள் மிகவும் மோசமாக இருந்தனர்: அட்டராக்ஸோஸுக்கு சவால் விடுத்த பங்கேற்பாளர்கள் 40 கேம்களில் 2ல் மட்டுமே வெற்றி பெற்றனர். மக்கள் விளையாடும் விதத்தை கூட போட் மாற்றியது, இரண்டு குண்டுகளுக்குப் பின்னால் ஒரு மூலையில் அதன் கொடியை வளைப்பது போன்ற அசாதாரண தேர்வுகளுடன் மெட்டாகேமை வளைத்தது - அரிதாக விளையாடப்படும் அமைப்பு.

அமைப்பின் பெயர் அமைதிக்கான பண்டைய கிரேக்க வார்த்தையிலிருந்து வந்தது, மேலும் அதன் நாடகத்தில் தரம் காட்டுகிறது என்று ஆராய்ச்சியாளர்கள் கூறுகின்றனர். பற்றாக்குறையிலிருந்து மீள்வதற்காக ஒரு மனிதன் பெருமளவில் சூதாட்டத்தில் ஈடுபடும்போது, ​​அடராக்ஸோஸ் மெதுவாகவும் முறையாகவும் திரும்பிச் செல்லும். "இரண்டு சதவீத வெற்றி நிகழ்தகவு போன்றவற்றிலிருந்து பாட் 'பிளஃப்' திரும்பி வருவதை நாங்கள் மிகவும் சாதாரணமாகப் பார்ப்போம்," என்று வினிட்ஸ்கி கூறினார்.

பலகைக்கு அப்பால் என்ன அர்த்தம்

மறைக்கப்பட்ட தகவல் விளையாட்டுகளில் மனிதர்களை அடிப்பது பார்லர் தந்திரத்தை விட அதிகம். தகவல் முழுமையடையாத உண்மையான பயன்பாடுகளுக்கு எதிராளியின் தனிப்பட்ட நிலையைப் பற்றி நியாயப்படுத்துவதற்கான நுட்பங்கள் - பேச்சுவார்த்தை அமைப்புகள், இணைய பாதுகாப்பு, பொருளாதார மாதிரியாக்கம் மற்றும் பல முகவர் ஒருங்கிணைப்பு, சிலவற்றைக் குறிப்பிடலாம்.

செயல்திறன் கோணம் கதையின் மிகவும் செல்வாக்குமிக்க பகுதியை நிரூபிக்கலாம். ஒரு எல்லைப்புற ஆய்வகம் 2022 இல் இந்தப் பிரச்சனையில் பல மாதங்கள் கணக்கிட்டது; ஒரு கல்விக் குழு 2026 ஆம் ஆண்டில் பயன்படுத்திய காரின் விலையை தோராயமாகப் பிரதியெடுத்து, அதன் முடிவைத் தாண்டியது. AI ஆராய்ச்சியானது பாரிய கணக்கீட்டு வரவு செலவுத் திட்டங்களுக்கு ஒத்ததாக மாறும் போது, ​​Ataraxos என்பது அல்காரிதம் யோசனைகள் - இங்கே, ஒரு பெரிய தேடல் இடத்தைக் கட்டுப்படுத்தும் ஒரு நம்பிக்கை மாதிரி - இன்னும் மூல அளவை விட முக்கியமானது என்பதை நினைவூட்டுகிறது.

நிச்சயமற்ற நிலையில் அமைதியாக இருக்கும், மனிதனால் புறக்கணிக்க முடியாத அறிவைப் புறக்கணிக்கும் மற்றும் உலகின் சிறந்ததை விட சிறந்ததாக இருக்கும் ஒரு இயந்திரத்தை அணியின் தாள் விவரிக்கிறது. அந்த பயனுள்ள திறன்கள், பலகையில் மற்றும் வெளியே இருக்கும்.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →