یک سیستم هوش مصنوعی سرانجام Stratego، بازی رومیزی کلاسیکی را که ماشین‌ها را برای دهه‌ها تحت تأثیر قرار می‌داد، فتح کرد - و این کار را با بودجه‌ای کم انجام داد. به گزارش Ars Technica، تیمی از محققان از دانشگاه کارنگی ملون، MIT، دانشگاه نیویورک و دانشگاه استنفورد یک هوش مصنوعی به نام Ataraxos ساختند که پیم نیمیجر را که به طور گسترده به عنوان بهترین بازیکن استراتژیک در تمام دوران شناخته می شود، با امتیاز 15 بر 1 با چهار تساوی شکست داد.

نتیجه برای امتیاز کمتر از برچسب قیمت قابل توجه است. آتاراکسوس برای حدود یک هفته فقط با 16 پردازنده گرافیکی، به علاوه چهار پردازنده گرافیکی اضافی به مدت چهار روز برای آموزش یک مدل همراه آموزش دید - اجرائی که تیم می گوید فقط چند هزار دلار هزینه دارد. DeepNash شرکت DeepMind، سیستمی که در سال 2022 برای اولین بار توجه جدی هوش مصنوعی را به بازی جلب کرد، به مدت دو تا سه ماه بر روی 1024 تراشه تخصصی TPU گوگل آموزش دید، اجرائی که تیم آتاراکسوس برآورد می‌کند بین 3 تا 4.5 میلیون دلار با قیمت‌های سال 2025 هزینه خواهد داشت. For more context on this story, see our ongoing more AI stories.

چرا Stratego چندین دهه هوش مصنوعی را تحت تأثیر قرار داد؟

دیپ بلو در سال 1997 گری کاسپاروف را در شطرنج شکست داد. AlphaGo در Go در سال 2016 لی سدول را شکست داد. ربات های پوکر سال ها حرفه ای ها را شکست داده اند. Stratego مقاومت کرد - حتی در برابر منابع قابل توجه DeepMind.

سختی بازی از ترکیب غیرمعمول اطلاعات پنهان، مقیاس و طول آن ناشی می شود. هر بازیکن 40 قطعه را که نشان دهنده درجات نظامی هستند، از یک مارشال گرفته تا یک جاسوس، به علاوه بمب و یک پرچم، فرمان می دهد. شما با گرفتن پرچم حریف برنده می شوید. حریف شما می‌تواند ببیند مهره‌های شما کجا هستند، اما نمی‌توانند ببینند چه هستند. هویت تنها زمانی آشکار می شود که دو قطعه با هم برخورد کنند و قطعه ضعیف تر حذف شود.

گابریل فارینا، دانشمند کامپیوتر MIT و یکی از نویسندگان این مطالعه، به Ars Technica گفت: در Stratego، 40 قطعه روی تخته وجود دارد که می توانند به هر ترتیبی باشند. این اجازه می دهد تا بیش از یک دسییلیون راه اندازی امکان پذیر باشد - 1326 عقربه ممکن در تگزاس هولدم، بازی که رایانه های بازی سال ها پیش کرک شده بودند را کوچکتر می کند. طول مشکل را تشدید می کند: "در شطرنج، بازی معمولا 40 حرکت طول می کشد، اما در Stratego، یک بازی به راحتی می تواند 2000 حرکت طول بکشد."

سپس بلوف زدن وجود دارد. حرکت دادن یک مهره ضعیف به عنوان یک مارشال می‌تواند حریف را بترساند، اما بلوف‌های بیش از حد و تهدیدها معنایی ندارند. هرگز بلوف نزنید و قابل پیش بینی می شوید. این عمل متعادل کننده همان چیزی است که سیستم های قبلی مانند DeepNash را از رسیدن به اوج نگه می دارد.

یوجین وینیتسکی، محقق دانشگاه نیویورک و یکی دیگر از نویسندگان، می‌گوید: «یک چیز فوق‌العاده متمایز درباره Stratego وجود دارد، این است که حجم عظیمی از اطلاعات پنهان است که در یک مقیاس زمانی بسیار طولانی آشکار می‌شود.

دومین شبکه عصبی که حدس می‌زند

آتاراکسوس همان روش اصلی را یاد گرفت که دیپ‌نش انجام داد: با بازی کردن علیه خودش، در مجموع 163 میلیون بازی، تقویت حرکاتی که منجر به برد می‌شد و کاهش دادن حرکاتی که انجام نمی‌دادند. اولین پیشرفت تیم در میزان تنظیم سیستم بعد از هر بازی بود، زیرا اطلاعات پنهان تمایل به ارسال الگوریتم های خودبازی در دایره دارند. آتاراکسوس در اوایل تمرین تغییرات زیادی در استراتژی ایجاد کرد و بعداً با دقت بیشتری تغییر کرد.

پیشرفت بزرگ‌تر چیزی بود که دیپ‌نش هرگز نداشت: پیش از هر حرکت فکر کردن. اصلاحات مبتنی بر جستجو قبل از بازیگری چیزی است که AlphaGo را قدرتمند کرده است، اما DeepMind نتوانست آن را در Stratego کار کند زیرا فضای جستجو بسیار وسیع بود.

راه حل یک شبکه عصبی دوم بود - یک مدل اعتقادی که برای حدس زدن قطعات پنهان حریف از نحوه حرکت آنها آموزش دیده بود. آتاراکسوس به جای تکرار از طریق هر ترتیب ممکن، موارد قابل قبول را نمونه برداری می کند، حرکات نامزد را در هر کدام انجام می دهد و بر اساس نتایج انتخاب می کند. نویسنده اصلی ساموئل سوکوتا و فارینا همچنین یک شبیه‌ساز سفارشی نوشتند که میلیون‌ها حرکت را در هر ثانیه روی کارت‌های گرافیک انجام می‌دهد، به همین دلیل است که یک آزمایشگاه دانشگاهی می‌تواند از عهده اجرای آموزش برآید. فرینا گفت: «در مقیاسی که ما در دانشگاه هستیم، واقعاً به یک حوزه کامل از GPU ها دسترسی نداریم.

قهرمان بشر یکی برگشت

نیمایر که چهار قهرمانی جهان را در کارنامه دارد و بیش از 600 هفته را به عنوان برترین بازیکن جهان سپری کرده است، در طول سه هفته 20 بازی آنلاین مقابل آتاراکسوس انجام داد و برای هر برد 100 دلار دریافت کرد. او می‌دانست که هوش مصنوعی با او سازگار نمی‌شود و به او فرصت می‌دهد تا نقاط ضعف را شکار کند. او دقیقا یک بار موفق شد برنده شود.

محققان می گویند که از دست دادن تنها یک نقص نبود. Good Stratego مستلزم تصادفی کردن تنظیمات شما است، بنابراین شانس همیشه نقش دارد. فرینا گفت: "حتی یک استراتژی عالی، گاهی اوقات فقط بازنده می شود."

بازیکنان انسانی در مسابقات قهرمانی جهانی استراتژی 2025 به مراتب بدتر عمل کردند: شرکت کنندگانی که آتاراکسوس را به چالش کشیدند تنها 2 بازی از 40 بازی را بردند. این ربات حتی نحوه بازی افراد را تغییر داد و متاگیم را با انتخاب‌های غیرمعمولی مانند گذاشتن پرچم خود در گوشه‌ای پشت دو بمب تغییر داد - تنظیماتی که به ندرت پخش می‌شود.

نام این سیستم از کلمه یونانی باستان برای آرامش گرفته شده است و محققان می گویند که کیفیت در بازی آن خودنمایی می کند. در حالی که یک انسان ممکن است برای بهبودی از کمبود قمار وحشیانه قمار کند، آتاراکسوس راه خود را به آرامی و روشمند انجام می دهد. وینیتسکی گفت: «ما ربات را از شانس دو درصدی، خیلی خیلی معمولی، «بلوف» می‌بینیم.

چه معنایی فراتر از هیئت مدیره دارد

کتک زدن انسان ها در بازی های اطلاعات پنهان چیزی بیش از یک ترفند سالنی است. تکنیک‌های استدلال در مورد دولت خصوصی حریف، زیربنای برنامه‌های واقعی است که در آن اطلاعات ناقص است - سیستم‌های مذاکره، امنیت سایبری، مدل‌سازی اقتصادی و هماهنگی چند عاملی، برای نام بردن از چند مورد.

زاویه کارایی ممکن است تاثیرگذارترین بخش داستان را ثابت کند. یک آزمایشگاه مرزی در سال 2022 ماه ها روی این مشکل محاسبه کرد. یک تیم دانشگاهی با تقریب قیمت یک خودروی دست دوم در سال 2026، نتیجه را تکرار کردند و از نتیجه فراتر رفتند. از آنجایی که تحقیقات هوش مصنوعی مترادف با بودجه‌های محاسباتی عظیم می‌شود، آتاراکسوس یادآوری می‌کند که ایده‌های الگوریتمی - در اینجا، یک مدل اعتقادی که فضای جستجوی عظیم را رام می‌کند - هنوز هم می‌تواند بیشتر از مقیاس خام اهمیت داشته باشد.

مقاله این تیم ماشینی را توصیف می‌کند که در شرایط عدم اطمینان آرام می‌ماند، دانشی را که انسان نمی‌تواند نادیده بگیرد نادیده می‌گیرد و بهتر از بهترین‌های دنیا بلوف می‌زند. اینها مهارت‌های مفیدی هستند، در هیئت مدیره و خارج از آن.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →