لقد انتصر نظام الذكاء الاصطناعي أخيرًا على لعبة Stratego، وهي لعبة اللوحة الكلاسيكية التي حيرت الآلات لعقود من الزمن، وقد فعلت ذلك بميزانية ضئيلة. قام فريق من الباحثين من جامعة كارنيجي ميلون، ومعهد ماساتشوستس للتكنولوجيا، وجامعة نيويورك، وجامعة ستانفورد ببناء الذكاء الاصطناعي المسمى Ataraxos الذي هزم Pim Niemeijer، الذي يعتبر على نطاق واسع أفضل لاعب Stratego على الإطلاق، بنتيجة 15 مباراة مقابل 1 مع أربعة تعادلات، وفقًا لتقارير Ars Technica.

والنتيجة أقل إثارة للإعجاب بالنسبة لخط النتيجة مقارنة بالسعر. تم تدريب Ataraxos على 16 وحدة معالجة رسوميات فقط لمدة أسبوع تقريبًا، بالإضافة إلى أربع وحدات معالجة رسوميات إضافية لمدة أربعة أيام لتدريب نموذج مصاحب - وهي عملية يقول الفريق إنها تكلف بضعة آلاف من الدولارات فقط. DeepMind's DeepNash، نظام 2022 الذي جلب لأول مرة اهتمامًا جديًا بالذكاء الاصطناعي للعبة، تم تدريبه لمدة شهرين إلى ثلاثة أشهر على 1024 شريحة TPU المتخصصة من Google، وهي عملية يقدر فريق Ataraxos أنها ستتكلف ما بين 3 ملايين دولار و4.5 مليون دولار بأسعار 2025. لمزيد من السياق حول هذه القصة، راجع أخبار الذكاء الاصطناعي.

لماذا أربكت شركة Stratego الذكاء الاصطناعي لعقود من الزمن

فاز Deep Blue على Garry Kasparov في لعبة الشطرنج عام 1997. وهزم AlphaGo Lee Sedol في Go عام 2016. وقد تغلبت روبوتات البوكر على المحترفين لسنوات. صمدت شركة Stratego، حتى في مواجهة موارد DeepMind الكبيرة.

تأتي صعوبة اللعبة من مزيجها غير العادي من المعلومات المخفية والحجم والطول. يطلب كل لاعب 40 قطعة تمثل الرتب العسكرية، من المارشال إلى الجاسوس، بالإضافة إلى القنابل والعلم. تفوز بالتقاط علم الخصم. يمكن لخصمك أن يرى مكان قطعك، ولكن ليس ما هي عليه. يتم الكشف عن الهويات فقط عندما تصطدم قطعتان، وتتم إزالة القطعة الأضعف.

قال غابرييل فارينا، عالم الكمبيوتر في معهد ماساتشوستس للتكنولوجيا والمؤلف المشارك للدراسة، لـ Ars Technica: "في Stratego، هناك 40 قطعة على السبورة يمكن أن تكون بأي ترتيب". وهذا يسمح بأكثر من ديليون من الإعدادات الممكنة، وهو ما يتضاءل أمام 1326 توزيع ورق ممكن في لعبة Texas Hold'em، وهي لعبة تم حلها على أجهزة الكمبيوتر منذ سنوات. يفاقم الطول المشكلة: "في لعبة الشطرنج، عادةً ما تستغرق اللعبة 40 نقلة، ولكن في لعبة Stratego، يمكن أن تستمر اللعبة بسهولة 2000 نقلة"، كما يقول فارينا.

ثم هناك الخداع. قد يؤدي تحريك قطعة ضعيفة كما لو كانت حشدًا إلى إخافة الخصم، لكن الخداع كثيرًا والتهديدات لا تعني شيئًا؛ لا تخدع أبدًا وستصبح متوقعًا. هذا التوازن هو ما منع الأنظمة السابقة مثل DeepNash من الوصول إلى القمة.

وقال يوجين فينيتسكي، الباحث في جامعة نيويورك ومؤلف مشارك آخر: "هناك شيء مميز للغاية في Stratego، وهو أنها كمية هائلة من المعلومات المخفية التي تتكشف على مدى فترة زمنية طويلة جدًا".

شبكة عصبية ثانية يمكنها التخمين

لقد تعلمت Ataraxos نفس الطريقة الأساسية التي تعلمتها DeepNash: من خلال اللعب ضد نفسها، في إجمالي 163 مليون لعبة، وتعزيز الحركات التي أدت إلى الانتصارات وإخماد تلك التي لم تفعل ذلك. كان أول تحسن للفريق هو مدى تعديل النظام بعد كل مباراة، لأن المعلومات المخفية تميل إلى إرسال خوارزميات اللعب الذاتي في دوائر. أجرى Ataraxos تغييرات كبيرة في الإستراتيجية في وقت مبكر من التدريب وزاد من الحذر لاحقًا.

كان الإنجاز الأكبر هو شيء لم تحققه شركة DeepNash مطلقًا: التفكير مسبقًا قبل كل خطوة. إن التحسين القائم على البحث قبل التصرف هو ما جعل AlphaGo قويًا، لكن DeepMind لم يتمكن من تشغيله في Stratego لأن مساحة البحث كانت واسعة جدًا.

كان الحل هو شبكة عصبية ثانية - نموذج اعتقادي، تم تدريبه على تخمين القطع المخفية للخصم من خلال كيفية حركتها. بدلاً من تكرار كل الترتيبات الممكنة، يقوم Ataraxos بتجربة الترتيبات المعقولة، ويلعب الحركات المرشحة في كل منها، ويختار بناءً على النتائج. كتب المؤلف الرئيسي صامويل سوكوتا وفارينا أيضًا جهاز محاكاة مخصصًا يقوم بتشغيل ملايين الحركات في الثانية على بطاقات الرسومات، وهي الطريقة التي يمكن بها للمختبر الأكاديمي أن يتحمل تكلفة تشغيل التدريب. وقال فارينا: "على النطاق الذي نحن فيه في الأوساط الأكاديمية، ليس لدينا حقًا إمكانية الوصول إلى مجال كامل من وحدات معالجة الرسومات".

استعاد البطل البشري عافيته

لعب Niemeijer، الحائز على أربع بطولات عالمية وقضى أكثر من 600 أسبوع كأفضل لاعب في العالم، 20 مباراة عبر الإنترنت ضد Ataraxos على مدار ثلاثة أسابيع، وحصل على 100 دولار مقابل كل فوز. كان يعلم أن الذكاء الاصطناعي لن يتكيف معه، مما يمنحه الوقت للبحث عن نقاط الضعف. تمكن من الفوز مرة واحدة بالضبط.

يقول الباحثون أن الخسارة الفردية لم تكن عيبًا. تتطلب الإستراتيجية الجيدة توزيع إعداداتك بطريقة عشوائية، لذا يلعب الحظ دورًا دائمًا. وقال فارينا: "حتى الإستراتيجية المثالية، ستخسر في بعض الأحيان".

كان أداء اللاعبين البشريين في بطولة Stratego العالمية لعام 2025 أسوأ بكثير: فقد فاز الحاضرون الذين تحدوا Ataraxos بمباراتين فقط من أصل 40 مباراة. حتى أن الروبوت غيّر طريقة لعب الأشخاص، حيث قام بتحريف اللعبة الوصفية بخيارات غير معتادة مثل وضع علمه في الزاوية خلف قنبلتين فقط - وهو إعداد نادرًا ما يتم لعبه.

يأتي اسم النظام من الكلمة اليونانية القديمة التي تعني الهدوء، ويقول الباحثون إن الجودة تظهر في طريقة لعبه. في حين أن الإنسان قد يقامر بشدة للتعافي من العجز، فإن Ataraxos يشق طريقه إلى الوراء ببطء ومنهجية. وقال فينيتسكي: "كنا نشاهد الروبوت وهو يخدع وهو يتراجع من احتمالية الفوز بنسبة 2%، بشكل عرضي للغاية".

ماذا يعني ذلك خارج نطاق مجلس الإدارة

إن التغلب على البشر في ألعاب المعلومات المخفية هو أكثر من مجرد خدعة. إن تقنيات التفكير في الحالة الخاصة للخصم تدعم التطبيقات الحقيقية حيث تكون المعلومات غير كاملة - أنظمة التفاوض، والأمن السيبراني، والنمذجة الاقتصادية، والتنسيق بين الوكلاء، على سبيل المثال لا الحصر.

قد تكون زاوية الكفاءة هي الجزء الأكثر تأثيرًا في القصة. أمضى أحد المختبرات الحدودية أشهرًا من الحوسبة لحل هذه المشكلة في عام 2022؛ قام فريق أكاديمي بتكرار النتيجة وتجاوزها بسعر سيارة مستعملة تقريبًا في عام 2026. وبما أن أبحاث الذكاء الاصطناعي أصبحت مرادفًا لميزانيات الحوسبة الضخمة، فإن Ataraxos هو تذكير بأن الأفكار الخوارزمية - هنا، نموذج الاعتقاد الذي يروض مساحة بحث ضخمة - لا يزال من الممكن أن تكون أكثر أهمية من النطاق الخام.

تصف ورقة الفريق البحثية آلة تظل هادئة في ظل عدم اليقين، وتتجاهل المعرفة التي لا يمكن للإنسان أن يتجاهلها، وتخادع بشكل أفضل من الأفضل في العالم. هذه مهارات مفيدة، على السبورة وخارجها.

---

ابق على اطلاع بأخبار الذكاء الاصطناعي

آخر أخبار وتحليلات وإنجازات الذكاء الاصطناعي — في مكان واحد.

اقرأ المزيد من أخبار الذكاء الاصطناعي →