یک سیستم هوش مصنوعی سرانجام Stratego، بازی رومیزی کلاسیکی را که ماشینها را برای دههها تحت تأثیر قرار میداد، فتح کرد - و این کار را با بودجهای کم انجام داد. به گزارش Ars Technica، تیمی از محققان از دانشگاه کارنگی ملون، MIT، دانشگاه نیویورک و دانشگاه استنفورد یک هوش مصنوعی به نام Ataraxos ساختند که پیم نیمیجر را که به طور گسترده به عنوان بهترین بازیکن استراتژیک در تمام دوران شناخته می شود، با امتیاز 15 بر 1 با چهار تساوی شکست داد.
نتیجه برای امتیاز کمتر از برچسب قیمت قابل توجه است. آتاراکسوس برای حدود یک هفته فقط با 16 پردازنده گرافیکی، به علاوه چهار پردازنده گرافیکی اضافی به مدت چهار روز برای آموزش یک مدل همراه آموزش دید - اجرائی که تیم می گوید فقط چند هزار دلار هزینه دارد. DeepNash شرکت DeepMind، سیستمی که در سال 2022 برای اولین بار توجه جدی هوش مصنوعی را به بازی جلب کرد، به مدت دو تا سه ماه بر روی 1024 تراشه تخصصی TPU گوگل آموزش دید، اجرائی که تیم آتاراکسوس برآورد میکند بین 3 تا 4.5 میلیون دلار با قیمتهای سال 2025 هزینه خواهد داشت. For more context on this story, see our ongoing more AI stories.
چرا Stratego چندین دهه هوش مصنوعی را تحت تأثیر قرار داد؟
دیپ بلو در سال 1997 گری کاسپاروف را در شطرنج شکست داد. AlphaGo در Go در سال 2016 لی سدول را شکست داد. ربات های پوکر سال ها حرفه ای ها را شکست داده اند. Stratego مقاومت کرد - حتی در برابر منابع قابل توجه DeepMind.
سختی بازی از ترکیب غیرمعمول اطلاعات پنهان، مقیاس و طول آن ناشی می شود. هر بازیکن 40 قطعه را که نشان دهنده درجات نظامی هستند، از یک مارشال گرفته تا یک جاسوس، به علاوه بمب و یک پرچم، فرمان می دهد. شما با گرفتن پرچم حریف برنده می شوید. حریف شما میتواند ببیند مهرههای شما کجا هستند، اما نمیتوانند ببینند چه هستند. هویت تنها زمانی آشکار می شود که دو قطعه با هم برخورد کنند و قطعه ضعیف تر حذف شود.
گابریل فارینا، دانشمند کامپیوتر MIT و یکی از نویسندگان این مطالعه، به Ars Technica گفت: در Stratego، 40 قطعه روی تخته وجود دارد که می توانند به هر ترتیبی باشند. این اجازه می دهد تا بیش از یک دسییلیون راه اندازی امکان پذیر باشد - 1326 عقربه ممکن در تگزاس هولدم، بازی که رایانه های بازی سال ها پیش کرک شده بودند را کوچکتر می کند. طول مشکل را تشدید می کند: "در شطرنج، بازی معمولا 40 حرکت طول می کشد، اما در Stratego، یک بازی به راحتی می تواند 2000 حرکت طول بکشد."
سپس بلوف زدن وجود دارد. حرکت دادن یک مهره ضعیف به عنوان یک مارشال میتواند حریف را بترساند، اما بلوفهای بیش از حد و تهدیدها معنایی ندارند. هرگز بلوف نزنید و قابل پیش بینی می شوید. این عمل متعادل کننده همان چیزی است که سیستم های قبلی مانند DeepNash را از رسیدن به اوج نگه می دارد.
یوجین وینیتسکی، محقق دانشگاه نیویورک و یکی دیگر از نویسندگان، میگوید: «یک چیز فوقالعاده متمایز درباره Stratego وجود دارد، این است که حجم عظیمی از اطلاعات پنهان است که در یک مقیاس زمانی بسیار طولانی آشکار میشود.
دومین شبکه عصبی که حدس میزند
آتاراکسوس همان روش اصلی را یاد گرفت که دیپنش انجام داد: با بازی کردن علیه خودش، در مجموع 163 میلیون بازی، تقویت حرکاتی که منجر به برد میشد و کاهش دادن حرکاتی که انجام نمیدادند. اولین پیشرفت تیم در میزان تنظیم سیستم بعد از هر بازی بود، زیرا اطلاعات پنهان تمایل به ارسال الگوریتم های خودبازی در دایره دارند. آتاراکسوس در اوایل تمرین تغییرات زیادی در استراتژی ایجاد کرد و بعداً با دقت بیشتری تغییر کرد.
پیشرفت بزرگتر چیزی بود که دیپنش هرگز نداشت: پیش از هر حرکت فکر کردن. اصلاحات مبتنی بر جستجو قبل از بازیگری چیزی است که AlphaGo را قدرتمند کرده است، اما DeepMind نتوانست آن را در Stratego کار کند زیرا فضای جستجو بسیار وسیع بود.
راه حل یک شبکه عصبی دوم بود - یک مدل اعتقادی که برای حدس زدن قطعات پنهان حریف از نحوه حرکت آنها آموزش دیده بود. آتاراکسوس به جای تکرار از طریق هر ترتیب ممکن، موارد قابل قبول را نمونه برداری می کند، حرکات نامزد را در هر کدام انجام می دهد و بر اساس نتایج انتخاب می کند. نویسنده اصلی ساموئل سوکوتا و فارینا همچنین یک شبیهساز سفارشی نوشتند که میلیونها حرکت را در هر ثانیه روی کارتهای گرافیک انجام میدهد، به همین دلیل است که یک آزمایشگاه دانشگاهی میتواند از عهده اجرای آموزش برآید. فرینا گفت: «در مقیاسی که ما در دانشگاه هستیم، واقعاً به یک حوزه کامل از GPU ها دسترسی نداریم.
قهرمان بشر یکی برگشت
نیمایر که چهار قهرمانی جهان را در کارنامه دارد و بیش از 600 هفته را به عنوان برترین بازیکن جهان سپری کرده است، در طول سه هفته 20 بازی آنلاین مقابل آتاراکسوس انجام داد و برای هر برد 100 دلار دریافت کرد. او میدانست که هوش مصنوعی با او سازگار نمیشود و به او فرصت میدهد تا نقاط ضعف را شکار کند. او دقیقا یک بار موفق شد برنده شود.
محققان می گویند که از دست دادن تنها یک نقص نبود. Good Stratego مستلزم تصادفی کردن تنظیمات شما است، بنابراین شانس همیشه نقش دارد. فرینا گفت: "حتی یک استراتژی عالی، گاهی اوقات فقط بازنده می شود."
بازیکنان انسانی در مسابقات قهرمانی جهانی استراتژی 2025 به مراتب بدتر عمل کردند: شرکت کنندگانی که آتاراکسوس را به چالش کشیدند تنها 2 بازی از 40 بازی را بردند. این ربات حتی نحوه بازی افراد را تغییر داد و متاگیم را با انتخابهای غیرمعمولی مانند گذاشتن پرچم خود در گوشهای پشت دو بمب تغییر داد - تنظیماتی که به ندرت پخش میشود.
نام این سیستم از کلمه یونانی باستان برای آرامش گرفته شده است و محققان می گویند که کیفیت در بازی آن خودنمایی می کند. در حالی که یک انسان ممکن است برای بهبودی از کمبود قمار وحشیانه قمار کند، آتاراکسوس راه خود را به آرامی و روشمند انجام می دهد. وینیتسکی گفت: «ما ربات را از شانس دو درصدی، خیلی خیلی معمولی، «بلوف» میبینیم.
چه معنایی فراتر از هیئت مدیره دارد
کتک زدن انسان ها در بازی های اطلاعات پنهان چیزی بیش از یک ترفند سالنی است. تکنیکهای استدلال در مورد دولت خصوصی حریف، زیربنای برنامههای واقعی است که در آن اطلاعات ناقص است - سیستمهای مذاکره، امنیت سایبری، مدلسازی اقتصادی و هماهنگی چند عاملی، برای نام بردن از چند مورد.
زاویه کارایی ممکن است تاثیرگذارترین بخش داستان را ثابت کند. یک آزمایشگاه مرزی در سال 2022 ماه ها روی این مشکل محاسبه کرد. یک تیم دانشگاهی با تقریب قیمت یک خودروی دست دوم در سال 2026، نتیجه را تکرار کردند و از نتیجه فراتر رفتند. از آنجایی که تحقیقات هوش مصنوعی مترادف با بودجههای محاسباتی عظیم میشود، آتاراکسوس یادآوری میکند که ایدههای الگوریتمی - در اینجا، یک مدل اعتقادی که فضای جستجوی عظیم را رام میکند - هنوز هم میتواند بیشتر از مقیاس خام اهمیت داشته باشد.
مقاله این تیم ماشینی را توصیف میکند که در شرایط عدم اطمینان آرام میماند، دانشی را که انسان نمیتواند نادیده بگیرد نادیده میگیرد و بهتر از بهترینهای دنیا بلوف میزند. اینها مهارتهای مفیدی هستند، در هیئت مدیره و خارج از آن.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →