ในที่สุดระบบ AI ก็พิชิต Stratego ซึ่งเป็นเกมกระดานสุดคลาสสิกที่ทำให้เครื่องจักรต้องหยุดชะงักมานานหลายทศวรรษ และทำได้โดยใช้งบประมาณที่จำกัด ทีมนักวิจัยจาก Carnegie Mellon University, MIT, New York University และ Stanford University ได้สร้าง AI ชื่อ Ataraxos ที่เอาชนะ Pim Niemeijer ซึ่งได้รับการยกย่องอย่างกว้างขวางว่าเป็นผู้เล่น Stratego ที่เก่งที่สุดตลอดกาล ด้วยคะแนน 15 เกมต่อ 1 และเสมอ 4 เกม Ars Technica รายงาน
ผลลัพธ์ที่ได้นั้นโดดเด่นน้อยกว่าสำหรับสกอร์ไลน์มากกว่าป้ายราคา Ataraxos ฝึกฝน GPU เพียง 16 ตัวเป็นเวลาประมาณหนึ่งสัปดาห์ บวกกับ GPU เพิ่มเติมอีกสี่ตัวเป็นเวลาสี่วันเพื่อฝึกฝนโมเดลคู่หู ซึ่งทีมงานบอกว่ามีค่าใช้จ่ายเพียงไม่กี่พันดอลลาร์ DeepNash ของ DeepMind ซึ่งเป็นระบบปี 2022 ที่ดึงความสนใจจาก AI อย่างจริงจังมาสู่เกมเป็นครั้งแรก ได้รับการฝึกฝนเป็นเวลาสองถึงสามเดือนบนชิป TPU เฉพาะทางของ Google จำนวน 1,024 ตัว ซึ่งทีม Ataraxos คาดการณ์ว่าจะมีราคาอยู่ระหว่าง 3 ล้านถึง 4.5 ล้านดอลลาร์ในราคาปี 2568 For more context on this story, see our ongoing more AI stories.
เหตุใด Stratego จึงทำให้ AI นิ่งงันมานานหลายทศวรรษ
Deep Blue เอาชนะ Garry Kasparov ในการเล่นหมากรุกในปี 1997 AlphaGo เอาชนะ Lee Sedol ที่ Go ในปี 2016 บอทโป๊กเกอร์เอาชนะมืออาชีพมาหลายปีแล้ว Stratego โดดเด่น — แม้จะขัดแย้งกับทรัพยากรจำนวนมากของ DeepMind ก็ตาม
ความยากของเกมมาจากการผสมผสานข้อมูล ขนาด และความยาวที่ซ่อนอยู่อย่างผิดปกติ ผู้เล่นแต่ละคนสั่งการชิ้นส่วน 40 ชิ้นที่แสดงถึงยศทหาร ตั้งแต่จอมพลไปจนถึงสายลับ พร้อมด้วยระเบิดและธง คุณชนะโดยยึดธงของคู่ต่อสู้ คู่ต่อสู้ของคุณสามารถดูได้ว่าชิ้นส่วนของคุณอยู่ที่ไหน แต่ไม่รู้ว่าชิ้นส่วนเหล่านั้นอยู่ที่ไหน ตัวตนจะถูกเปิดเผยก็ต่อเมื่อชิ้นส่วนสองชิ้นชนกัน และชิ้นส่วนที่อ่อนแอกว่าจะถูกลบออก
"ใน Stratego มีชิ้นส่วน 40 ชิ้นบนกระดานที่สามารถเรียงลำดับอย่างไรก็ได้" Gabriele Farina นักวิทยาศาสตร์คอมพิวเตอร์ของ MIT และผู้ร่วมเขียนการศึกษากล่าวกับ Ars Technica นั่นทำให้สามารถตั้งค่าที่เป็นไปได้มากกว่าล้านล้าน – แคบกว่ามือที่เป็นไปได้ 1,326 มือใน Texas Hold'em คอมพิวเตอร์เกมแตกเมื่อหลายปีก่อน ความยาวทำให้ปัญหายุ่งยาก: "ในหมากรุก โดยปกติแล้วเกมจะใช้เวลา 40 กระบวนท่า แต่ใน Stratego เกมสามารถมีการเคลื่อนไหวได้ 2,000 กระบวนท่าอย่างง่ายดาย" Farina กล่าว
จากนั้นก็มีการบลัฟ การย้ายชิ้นส่วนที่อ่อนแอราวกับว่าเป็นจอมพลสามารถทำให้คู่ต่อสู้หวาดกลัวได้ แต่การบลัฟบ่อยเกินไปและการคุกคามไม่มีความหมายอะไร ไม่เคยป้านและคุณสามารถคาดเดาได้ การปรับสมดุลคือสิ่งที่ทำให้ระบบรุ่นก่อนๆ เช่น DeepNash ไม่สามารถขึ้นไปถึงจุดสูงสุดได้
Eugene Vinitsky นักวิจัยจาก NYU และผู้เขียนร่วมอีกคนกล่าวว่า "มีบางอย่างที่โดดเด่นเป็นพิเศษเกี่ยวกับ Stratego ซึ่งเป็นข้อมูลที่ซ่อนอยู่จำนวนมหาศาลซึ่งจะถูกเปิดเผยในช่วงเวลาที่ยาวนานมาก"
โครงข่ายประสาทเทียมอันที่สองที่คาดเดาได้
Ataraxos ได้เรียนรู้วิธีการพื้นฐานแบบเดียวกับที่ DeepNash ทำ นั่นคือการเล่นแข่งกับตัวเองมีทั้งหมด 163 ล้านเกม เสริมการเคลื่อนไหวที่นำไปสู่ชัยชนะและลดความเคลื่อนไหวของผู้ที่ไม่ได้ทำ การปรับปรุงครั้งแรกของทีมคือการปรับระบบหลังจากแต่ละเกมมากน้อยเพียงใด เนื่องจากข้อมูลที่ซ่อนไว้มีแนวโน้มที่จะส่งอัลกอริธึมการเล่นตัวเองเป็นวงกลม Ataraxos ได้ทำการเปลี่ยนแปลงกลยุทธ์ครั้งใหญ่ในช่วงเริ่มต้นของการฝึกซ้อม และระมัดระวังมากขึ้นในภายหลัง
ความก้าวหน้าที่ยิ่งใหญ่กว่าคือสิ่งที่ DeepNash ไม่เคยมี นั่นคือการคิดล่วงหน้าก่อนการเคลื่อนไหวแต่ละครั้ง การปรับแต่งตามการค้นหาก่อนดำเนินการคือสิ่งที่ทำให้ AlphaGo มีประสิทธิภาพ แต่ DeepMind ไม่สามารถทำให้มันทำงานใน Stratego ได้ เนื่องจากพื้นที่การค้นหากว้างเกินไป
วิธีแก้ไขคือโครงข่ายประสาทเทียมที่สอง ซึ่งเป็นแบบจำลองความเชื่อที่ได้รับการฝึกฝนให้เดาชิ้นส่วนที่ซ่อนอยู่ของคู่ต่อสู้จากวิธีที่พวกมันเคลื่อนไหว แทนที่จะวนซ้ำทุกการเตรียมการที่เป็นไปได้ Ataraxos จะสุ่มตัวอย่างสิ่งที่เป็นไปได้ เล่นการเคลื่อนไหวของผู้สมัครในแต่ละอย่าง และเลือกตามผลลัพธ์ ผู้เขียนนำ Samuel Sokota และ Farina ยังได้เขียนโปรแกรมจำลองแบบกำหนดเองที่ทำงานนับล้านการเคลื่อนไหวต่อวินาทีบนกราฟิกการ์ด ซึ่งเป็นวิธีที่ห้องปฏิบัติการทางวิชาการสามารถรองรับการฝึกอบรมได้ “ในระดับที่เราอยู่ในแวดวงวิชาการ เราไม่สามารถเข้าถึง GPU ได้ทุกสาขา” Farina กล่าว
แชมป์มนุษย์ได้หนึ่งคืน
Niemeijer ซึ่งครองแชมป์โลก 4 สมัยและใช้เวลามากกว่า 600 สัปดาห์ในฐานะผู้เล่นอันดับต้น ๆ ของโลก เล่นเกมออนไลน์ 20 เกมกับ Ataraxos ตลอดสามสัปดาห์ รับรายได้ 100 ดอลลาร์สำหรับการชนะแต่ละครั้ง เขารู้ว่า AI จะไม่ปรับตัวเข้ากับเขา ทำให้เขามีเวลาค้นหาจุดอ่อน เขาสามารถชนะได้เพียงครั้งเดียว
นักวิจัยกล่าวว่าการสูญเสียเพียงครั้งเดียวไม่ใช่ข้อบกพร่อง Good Stratego ต้องการการสุ่มการตั้งค่าของคุณ ดังนั้นโชคจึงมีบทบาทอยู่เสมอ “แม้จะเป็นกลยุทธ์ที่สมบูรณ์แบบ แต่บางครั้งก็อาจพ่ายแพ้” ฟารินากล่าว
ผู้เล่นที่เป็นมนุษย์ในการแข่งขัน Stratego World Championship ปี 2025 มีอาการแย่ลงมาก: ผู้เข้าร่วมที่ท้าชิง Ataraxos ชนะเพียง 2 จาก 40 เกม บอทยังเปลี่ยนวิธีการเล่นของผู้คน โดยบิดเบือนเมตาเกมด้วยตัวเลือกที่ผิดปกติ เช่น การปักธงไว้ที่มุมด้านหลังระเบิดเพียงสองลูก ซึ่งเป็นการตั้งค่าที่ไม่ค่อยได้เล่น
ชื่อของระบบมาจากคำภาษากรีกโบราณที่แปลว่าความสงบ และนักวิจัยกล่าวว่าคุณภาพนั้นแสดงให้เห็นในบทละครของมัน แม้ว่ามนุษย์อาจเล่นการพนันอย่างดุเดือดเพื่อฟื้นตัวจากการขาดดุล แต่ Ataraxos ก็พยายามกลับมาอย่างช้าๆ และมีระบบ “เราจะเฝ้าดูบอท 'บลัฟ' กลับมาจากความน่าจะเป็นชัยชนะประมาณ 2 เปอร์เซ็นต์ ไม่เป็นทางการมาก” Vinitsky กล่าว
มันหมายถึงอะไรนอกเหนือจากกระดาน
การทุบตีมนุษย์ในเกมที่มีข้อมูลลับนั้นเป็นมากกว่ากลอุบายในห้องนั่งเล่น เทคนิคในการให้เหตุผลเกี่ยวกับสถานะส่วนตัวของฝ่ายตรงข้ามเป็นรากฐานของการใช้งานจริงที่ข้อมูลไม่สมบูรณ์ เช่น ระบบการเจรจา ความปลอดภัยทางไซเบอร์ การสร้างแบบจำลองทางเศรษฐกิจ และการประสานงานหลายตัวแทน เป็นต้น
มุมประสิทธิภาพอาจพิสูจน์ได้ว่าเป็นส่วนที่มีอิทธิพลมากที่สุดของเรื่องราว ห้องปฏิบัติการชายแดนใช้เวลาหลายเดือนในการคำนวณกับปัญหานี้ในปี 2022 ทีมนักวิชาการทำซ้ำและเกินผลลัพธ์สำหรับราคารถยนต์มือสองโดยประมาณในปี 2026 เนื่องจากการวิจัย AI กลายเป็นเรื่องเดียวกันกับงบประมาณการประมวลผลจำนวนมาก Ataraxos จึงเป็นเครื่องเตือนใจว่าแนวคิดอัลกอริทึม ซึ่งเป็นแบบจำลองความเชื่อที่ทำให้พื้นที่การค้นหาขนาดใหญ่เชื่อง ยังคงมีความสำคัญมากกว่าขนาดดิบ
บทความของทีมอธิบายถึงเครื่องจักรที่อยู่นิ่งภายใต้ความไม่แน่นอน เพิกเฉยต่อความรู้ที่มนุษย์ไม่สามารถเพิกเฉยได้ และบลัฟได้ดีกว่าความรู้ที่ดีที่สุดในโลก สิ่งเหล่านี้เป็นทักษะที่มีประโยชน์ทั้งบนกระดานและนอกกระดาน
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →