ایک AI سسٹم نے آخر کار Stratego کو فتح کر لیا، جو کلاسک بورڈ گیم ہے جس نے کئی دہائیوں تک مشینوں کو سٹمپ کیا — اور اس نے یہ کام بڑے بجٹ پر کیا۔ کارنیگی میلن یونیورسٹی، MIT، نیویارک یونیورسٹی اور اسٹینفورڈ یونیورسٹی کے محققین کی ایک ٹیم نے Ataraxos کے نام سے ایک AI بنایا جس نے Pim Niemeijer کو شکست دی، جسے وسیع پیمانے پر اب تک کا بہترین حکمت عملی کھلاڑی سمجھا جاتا ہے، 15 گیمز کے اسکور سے چار ڈراز کے ساتھ 1 سے، آرس ٹیکنیکا کی رپورٹ۔
نتیجہ قیمت کے ٹیگ کے مقابلے اسکور لائن کے لیے کم ہے۔ Ataraxos نے تقریباً ایک ہفتے کے لیے صرف 16 GPUs پر تربیت حاصل کی، اس کے علاوہ ایک ساتھی ماڈل کو تربیت دینے کے لیے چار اضافی GPUs چار دنوں کے لیے - ایک رن ٹیم کا کہنا ہے کہ اس کی قیمت صرف چند ہزار ڈالر ہے۔ DeepMind's DeepNash، 2022 کا نظام جس نے پہلی بار گیم پر سنجیدہ AI توجہ مبذول کروائی، جسے Google کے خصوصی TPU چپس کے 1,024 پر دو سے تین ماہ تک تربیت دی گئی، جسے Ataraxos ٹیم کا تخمینہ ہے کہ 2025 کی قیمتوں پر $3 ملین سے $4.5 ملین کے درمیان لاگت آئے گی۔ For more context on this story, see our ongoing artificial intelligence updates.
اسٹریٹیگو نے کئی دہائیوں تک AI کو اسٹمپ کیوں کیا۔
ڈیپ بلیو نے 1997 میں شطرنج میں گیری کاسپاروف کو شکست دی۔ AlphaGo نے 2016 میں Go میں Lee Sedol کو شکست دی۔ پوکر بوٹس نے سالوں سے پیشہ ور افراد کو شکست دی ہے۔ حکمت عملی کا انعقاد - یہاں تک کہ ڈیپ مائنڈ کے قابل ذکر وسائل کے خلاف بھی۔
گیم کی مشکل پوشیدہ معلومات، پیمانے اور لمبائی کے اس کے غیر معمولی امتزاج سے آتی ہے۔ ہر کھلاڑی 40 ٹکڑوں کو کمانڈ کرتا ہے جو فوجی صفوں کی نمائندگی کرتے ہیں، مارشل سے لے کر جاسوس تک، نیز بم اور جھنڈا۔ آپ مخالف کے جھنڈے کو پکڑ کر جیت جاتے ہیں۔ آپ کا مخالف دیکھ سکتا ہے کہ آپ کے ٹکڑے کہاں ہیں، لیکن یہ نہیں کہ وہ کیا ہیں۔ شناخت صرف اس وقت ظاہر ہوتی ہے جب دو ٹکڑے آپس میں ٹکراتے ہیں، اور کمزور ٹکڑا ہٹا دیا جاتا ہے۔
"اسٹریٹیگو میں، بورڈ پر 40 ٹکڑے ہیں جو کسی بھی ترتیب میں ہوسکتے ہیں،" گیبریل فارینا، ایک MIT کمپیوٹر سائنسدان اور مطالعہ کے شریک مصنف نے آرس ٹیکنیکا کو بتایا۔ اس سے ٹیکساس ہولڈم میں 1,326 ممکنہ ہاتھوں کو بونا کرنا، ایک گیم کمپیوٹرز جو برسوں پہلے ٹوٹ گیا تھا، ایک سے زیادہ ممکنہ سیٹ اپ کی اجازت دیتا ہے۔ طوالت مسئلہ کو پیچیدہ بناتی ہے: "شطرنج میں، عام طور پر کھیل 40 چالوں تک چلتا ہے، لیکن اسٹریٹگو میں، ایک کھیل آسانی سے 2000 چالوں تک چل سکتا ہے،" فارینہ نے کہا۔
پھر بلفنگ ہوتی ہے۔ ایک کمزور ٹکڑے کو اس طرح منتقل کرنا جیسے وہ مارشل ہو، مخالف کو ڈرا سکتا ہے، لیکن اکثر بلف اور دھمکیوں کا کوئی مطلب نہیں ہے۔ کبھی بلف نہ کریں اور آپ پیشین گوئی بن جائیں۔ یہ توازن عمل وہی ہے جس نے ڈیپ نیش جیسے پہلے سسٹمز کو چوٹی تک پہنچنے سے روکا۔
NYU کے ایک محقق اور ایک اور شریک مصنف، Eugene Vinitsky نے کہا، "سٹریٹیگو کے بارے میں ایک خاص چیز ہے، جو یہ ہے کہ یہ چھپی ہوئی معلومات کی ایک بہت بڑی مقدار ہے جو بہت طویل عرصے تک سامنے آتی ہے۔"
ایک دوسرا نیورل نیٹ ورک جو اندازہ لگاتا ہے۔
Ataraxos نے وہی بنیادی طریقہ سیکھا جو DeepNash نے کیا: اپنے آپ کے خلاف کھیل کر، مجموعی طور پر 163 ملین گیمز، ان چالوں کو تقویت بخشی جو جیتنے کا باعث بنیں اور جو نہیں ہوئیں ان کو نم کر دیں۔ ٹیم کی پہلی بہتری اس میں تھی کہ ہر گیم کے بعد سسٹم کتنا ایڈجسٹ ہوتا ہے، کیونکہ چھپی ہوئی معلومات حلقوں میں سیلف پلے الگورتھم بھیجتی ہے۔ Ataraxos نے تربیت کے شروع میں حکمت عملی میں بڑی تبدیلیاں کیں اور بعد میں زیادہ محتاط۔
بڑی پیش رفت وہ تھی جو ڈیپ نیش نے کبھی نہیں کی تھی: ہر حرکت سے پہلے سوچنا۔ اداکاری سے پہلے تلاش پر مبنی تطہیر وہی ہے جس نے AlphaGo کو طاقتور بنایا، لیکن DeepMind اسے Stratego میں کام نہیں کر سکا کیونکہ تلاش کی جگہ بہت وسیع تھی۔
اس کا حل ایک دوسرا نیورل نیٹ ورک تھا - ایک عقیدہ ماڈل، جو حریف کے چھپے ہوئے ٹکڑوں کا اندازہ لگانے کے لیے تربیت یافتہ تھا کہ وہ کس طرح حرکت کر رہے تھے۔ ہر ممکنہ انتظامات کو دہرانے کے بجائے، Ataraxos قابل فہم نمونوں کا نمونہ کرتا ہے، ہر ایک میں امیدواروں کی چالیں چلاتا ہے، اور نتائج کی بنیاد پر چنتا ہے۔ سرکردہ مصنف سیموئیل سوکوٹا اور فارینا نے ایک حسب ضرورت سمیلیٹر بھی لکھا جو گرافکس کارڈز پر فی سیکنڈ لاکھوں حرکتیں چلاتا ہے، جس طرح ایک تعلیمی لیبارٹری ٹریننگ چلانے کا متحمل ہو سکتی ہے۔ فارینہ نے کہا، "جس پیمانے پر ہم اکیڈمیا میں ہیں، ہمارے پاس واقعی GPUs کے پورے شعبے تک رسائی نہیں ہے۔"
ہیومن چیمپیئن کو ایک واپسی ملی
نیمیجر، جس کے پاس چار عالمی چیمپئن شپ ہیں اور انہوں نے دنیا کے اعلیٰ درجہ کے کھلاڑی کے طور پر 600 ہفتوں سے زیادہ وقت گزارا ہے، تین ہفتوں کے دوران Ataraxos کے خلاف 20 آن لائن گیمز کھیلے، ہر جیت پر $100 کمائے۔ وہ جانتا تھا کہ AI اس کے ساتھ موافقت نہیں کرے گا، اسے کمزوریوں کا شکار کرنے کا وقت دے گا۔ وہ بالکل ایک بار جیتنے میں کامیاب رہا۔
محققین کا کہنا ہے کہ واحد نقصان کوئی عیب نہیں تھا۔ اچھی حکمت عملی کے لیے آپ کے سیٹ اپ کو بے ترتیب کرنے کی ضرورت ہوتی ہے، لہذا قسمت ہمیشہ ایک کردار ادا کرتی ہے۔ فارینہ نے کہا، "یہاں تک کہ ایک بہترین حکمت عملی، بعض اوقات یہ صرف ہار جاتی ہے۔"
2025 سٹریٹیگو ورلڈ چیمپیئن شپ میں انسانی کھلاڑیوں کی کارکردگی اس سے کہیں زیادہ خراب رہی: جن شرکاء نے Ataraxos کو چیلنج کیا وہ 40 میں سے صرف 2 گیمز جیتے۔ بوٹ نے یہاں تک کہ لوگوں کے کھیلنے کے طریقے کو تبدیل کر دیا، غیر معمولی انتخاب کے ساتھ میٹاگیم کو ترچھا کرتے ہوئے جیسے کہ اس کے جھنڈے کو صرف دو بموں کے پیچھے ایک کونے میں ٹکانا — ایک شاذ و نادر ہی کھیلا جانے والا سیٹ اپ۔
اس نظام کا نام قدیم یونانی لفظ پرسکون سے آیا ہے، اور محققین کا کہنا ہے کہ اس کے ڈرامے میں کوالٹی شوز ہے۔ جب کہ ایک انسان خسارے سے نکلنے کے لیے جنگلی طور پر جوا کھیل سکتا ہے، Ataraxos آہستہ آہستہ اور طریقہ کار سے واپسی کا کام کرتا ہے۔ وِنِٹسکی نے کہا، "ہم بوٹ 'بلف' کو دو فیصد جیت کے امکان کی طرح واپس آتے ہوئے دیکھیں گے۔
بورڈ سے باہر اس کا کیا مطلب ہے۔
پوشیدہ معلوماتی گیمز میں انسانوں کو مارنا پارلر کی چال سے زیادہ ہے۔ کسی مخالف کی نجی ریاست کے بارے میں استدلال کرنے کی تکنیکیں حقیقی ایپلی کیشنز کی بنیاد رکھتی ہیں جہاں معلومات نامکمل ہیں — گفت و شنید کے نظام، سائبر سیکیورٹی، اقتصادی ماڈلنگ اور ملٹی ایجنٹ کوآرڈینیشن، چند ایک کے نام۔
کارکردگی کا زاویہ کہانی کا سب سے زیادہ اثر انگیز حصہ ثابت ہو سکتا ہے۔ ایک فرنٹیئر لیب نے 2022 میں اس مسئلے پر مہینوں حساب لگایا۔ اکیڈمک ٹیم نے 2026 میں استعمال شدہ کار کی قیمت کا نتیجہ نقل کیا اور اس سے تجاوز کیا۔ جیسا کہ AI تحقیق بڑے پیمانے پر کمپیوٹ بجٹ کا مترادف بن گئی ہے، Ataraxos ایک یاد دہانی ہے کہ الگورتھمک آئیڈیاز - یہاں، ایک ایسا یقین ماڈل جو تلاش کی ایک بڑی جگہ کو روکتا ہے - اب بھی خام پیمانے سے زیادہ اہمیت رکھتا ہے۔
ٹیم کا مقالہ ایک ایسی مشین کی وضاحت کرتا ہے جو غیر یقینی صورتحال میں پرسکون رہتی ہے، اس علم کو نظر انداز کرتی ہے جسے انسان نظر انداز نہیں کر سکتا، اور دنیا کی بہترین چیزوں سے بہتر طور پر بلف کرتا ہے۔ وہ مفید ہنر ہیں، بورڈ پر اور اس سے دور۔
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →