מערכת בינה מלאכותית כבשה סוף סוף את סטרטגו, משחק הלוח הקלאסי שהכשיל מכונות במשך עשרות שנים - והיא עשתה זאת בתקציב נמוך. צוות חוקרים מאוניברסיטת קרנגי מלון, MIT, אוניברסיטת ניו יורק ואוניברסיטת סטנפורד בנה בינה מלאכותית בשם Ataraxos שהביסה את פים נימאייר, הנחשב כשחקן האסטרטגו הטוב בכל הזמנים, בתוצאה של 15 משחקים ל-1 עם ארבע תוצאות תיקו, מדווחת Ars Technica.
התוצאה בולטת פחות עבור קו הניקוד מאשר עבור תג המחיר. Ataraxos התאמן על 16 GPUs בלבד במשך כשבוע, בתוספת ארבעה GPUs נוספים במשך ארבעה ימים כדי להכשיר דגם נלווה - ריצה שלדברי הצוות עלתה רק כמה אלפי דולרים. DeepNash של DeepMind, מערכת 2022 שהביאה לראשונה תשומת לב רצינית לבינה מלאכותית למשחק, אומנה במשך חודשיים עד שלושה חודשים על 1,024 שבבי TPU המיוחדים של גוגל, ריצה שצוות Ataraxos מעריך שתעלה בין 3 מיליון דולר ל-4.5 מיליון דולר במחירי 2025. For more context on this story, see our ongoing AI trends.
מדוע Stratego הפסיק את הבינה המלאכותית במשך עשרות שנים
Deep Blue ניצח את גארי קספרוב בשחמט בשנת 1997. AlphaGo ניצחה את לי Sedol ב-Go בשנת 2016. בוטים של פוקר ניצחו מקצוענים במשך שנים. סטרטגו החזיק מעמד - אפילו מול המשאבים הרבים של DeepMind.
הקושי של המשחק נובע מהשילוב יוצא הדופן שלו של מידע נסתר, קנה מידה ואורך. כל שחקן מפקד על 40 חלקים המייצגים דרגות צבאיות, ממרשל ועד מרגל, בתוספת פצצות ודגל. אתה מנצח על ידי לכידת הדגל של היריב. היריב שלך יכול לראות איפה הכלים שלך, אבל לא מה הם. זהויות מתגלות רק כאשר שני חלקים מתנגשים, והחלק החלש יותר מוסר.
"באסטרטגו, יש 40 חלקים על הלוח שיכולים להיות בכל סדר", אמרה גבריאל פארינה, מדען מחשבים ב-MIT ומחברת שותפה של המחקר, לארס טכניקה. זה מאפשר יותר מעציליון הגדרות אפשריות - מגמד את 1,326 הידיים האפשריות בטקסס הולדם, משחק מחשבים שפוצחו לפני שנים. האורך מחמיר את הבעיה: "בשחמט, בדרך כלל המשחק נמשך 40 מהלכים, אבל בסטרטגו, משחק יכול להימשך בקלות 2,000 מהלכים", אמר פארינה.
ואז יש בלוף. הזזת חלק חלש כאילו היה מרשל יכול להפחיד את היריב, אבל בלוף לעתים קרובות מדי ואיומים לא אומרים כלום; לעולם אל תבלוף ואתה הופך להיות צפוי. פעולת האיזון הזו היא שמנעה ממערכות קודמות כמו DeepNash להגיע לפסגה.
"יש משהו סופר מיוחד באסטרטגו, שהוא שמדובר בכמות עצומה של מידע נסתר שמתגלה על פני קנה מידה ארוך מאוד", אמר יוג'ין ויניצקי, חוקר ב-NYU ומחבר נוסף.
רשת עצבית שנייה שמנחשת
Ataraxos למדה את אותה דרך בסיסית ש-DeepNash למדה: על ידי משחק נגד עצמה, 163 מיליון משחקים בסך הכל, חיזוק מהלכים שהובילו לניצחונות והפחתת אלו שלא. השיפור הראשון של הקבוצה היה במידת התאמה של המערכת לאחר כל משחק, מכיוון שמידע נסתר נוטה לשלוח אלגוריתמים של משחק עצמי במעגלים. Ataraxos ביצעה שינויים אסטרטגיים גדולים בשלב מוקדם באימון ובהמשך זהירים יותר ויותר.
פריצת הדרך הגדולה יותר הייתה משהו של DeepNash מעולם לא היה: חשיבה קדימה לפני כל מהלך. חידוד מבוסס חיפוש לפני משחק הוא מה שהפך את AlphaGo לעוצמתי, אבל DeepMind לא הצליחה לגרום לזה לעבוד ב-Strego מכיוון שמרחב החיפוש היה עצום מדי.
הפתרון היה רשת עצבית שנייה - מודל אמונה, שאומן לנחש את החלקים הנסתרים של היריב לפי איך הם נעו. במקום לחזור על כל סידור אפשרי, Ataraxos דוגמת מהלכים סבירים, מציגה מהלכי מועמדים בכל אחד מהם ובוחרת על סמך התוצאות. המחבר הראשי סמואל סוקוטה ופארינה כתבו גם סימולטור מותאם אישית שמריץ מיליוני מהלכים בשנייה בכרטיסים גרפיים, וכך יכלה מעבדה אקדמית להרשות לעצמה את ריצת ההדרכה. "בקנה מידה שאנחנו נמצאים באקדמיה, אין לנו באמת גישה לתחום שלם של GPUs," אמר פארינה.
האלוף האנושי קיבל אחד בחזרה
נימאייר, שמחזיק בארבע אליפויות עולם ובילה יותר מ-600 שבועות כשחקן המדורג בדירוג העליון בעולם, שיחק 20 משחקים מקוונים נגד Ataraxos במשך שלושה שבועות, והרוויח $100 עבור כל ניצחון. הוא ידע שה-AI לא יסתגל אליו, מה שנותן לו זמן לחפש חולשות. הוא הצליח לנצח בדיוק פעם אחת.
חוקרים אומרים שהפסד בודד לא היה פגם. Good Stratego דורש ביצוע אקראי של ההגדרה שלך, אז המזל תמיד משחק תפקיד. "אפילו אסטרטגיה מושלמת, לפעמים היא פשוט תפסיד", אמרה פארינה.
שחקנים אנושיים באליפות העולם ב-2025 באסטרטגו הצליחו הרבה יותר גרוע: משתתפים שאתגרו את אטארקסוס ניצחו רק בשני משחקים מתוך 40. הבוט אפילו שינה את האופן שבו אנשים משחקים, והטיף את המטא-משחק עם אפשרויות יוצאות דופן כמו להכניס את הדגל שלו לפינה מאחורי שתי פצצות בלבד - הגדרה שמשחקים לעתים רחוקות.
שמה של המערכת בא מהמילה היוונית העתיקה לרוגע, והחוקרים אומרים שהאיכות ניכרת במשחקה. בעוד שאדם עשוי להמר בפראות כדי להתאושש מגירעון, אטארקסוס חוזר לאט ובשיטתיות. "היינו צופים בבוט 'מבלף' את דרכו חזרה מהסתברות של שני אחוזים לניצחון, מאוד מאוד סתמי", אמר ויניצקי.
מה זה אומר מעבר ללוח
להרביץ לבני אדם במשחקי מידע סמוי זה יותר מטריק בסלון. טכניקות לחשיבה לגבי מדינתו הפרטית של יריב עומדות בבסיס יישומים אמיתיים שבהם המידע אינו שלם - מערכות משא ומתן, אבטחת סייבר, מודלים כלכליים ותיאום מרובה סוכנים, אם להזכיר כמה.
זווית היעילות עשויה להוכיח את החלק המשפיע ביותר בסיפור. מעבדת גבול השקיעה חודשים של מחשוב על בעיה זו בשנת 2022; צוות אקדמי שיכפל ועלה על התוצאה בערך במחיר של מכונית משומשת בשנת 2026. כאשר מחקר בינה מלאכותית הופך לשם נרדף לתקציבי מחשוב מסיביים, Ataraxos היא תזכורת לכך שרעיונות אלגוריתמיים - כאן, מודל אמונה המאלף מרחב חיפוש עצום - עדיין יכולים להיות חשובים יותר מקנה מידה גולמי.
המאמר של הצוות מתאר מכונה שנשארת רגועה תחת אי ודאות, מתעלמת מידע שאדם לא יכול להתעלם ממנו, ומבלף טוב יותר מהטובים בעולם. אלו כישורים שימושיים, על הלוח ומחוצה לו.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →