একটি এআই সিস্টেম অবশেষে স্ট্র্যাটেগোকে জয় করেছে, ক্লাসিক বোর্ড গেম যা কয়েক দশক ধরে মেশিনগুলিকে স্টাম্প করেছে — এবং এটি একটি জুতার বাজেটে এটি করেছে। কার্নেগি মেলন ইউনিভার্সিটি, এমআইটি, নিউ ইয়র্ক ইউনিভার্সিটি এবং স্ট্যানফোর্ড ইউনিভার্সিটির গবেষকদের একটি দল অ্যাটারাক্সোস নামে একটি এআই তৈরি করেছে যা সর্বকালের সেরা স্ট্র্যাটেগো প্লেয়ার হিসেবে বিবেচিত পিম নিমেইজারকে 15 গেমের স্কোর দিয়ে চারটি ড্র সহ 1-এ পরাজিত করেছিল, আরস টেকনিকা রিপোর্ট করেছে।

ফলাফল মূল্য ট্যাগের তুলনায় স্কোরলাইনের জন্য কম আকর্ষণীয়। Ataraxos প্রায় এক সপ্তাহের জন্য মাত্র 16টি GPU-তে প্রশিক্ষিত হয়েছে, এবং একটি সহচর মডেলকে প্রশিক্ষণ দেওয়ার জন্য চার দিনের জন্য অতিরিক্ত চারটি GPU-তে প্রশিক্ষণ দিয়েছে — একটি দৌড় দল বলছে মাত্র কয়েক হাজার ডলার খরচ। DeepMind's DeepNash, 2022 সিস্টেম যেটি প্রথমে গেমের প্রতি গুরুতর AI মনোযোগ এনেছিল, Google-এর বিশেষায়িত TPU চিপগুলির 1,024-এর উপর দুই থেকে তিন মাসের জন্য প্রশিক্ষিত, একটি চালানো Ataraxos টিমের অনুমান 2025 মূল্যে $3 মিলিয়ন থেকে $4.5 মিলিয়নের মধ্যে হবে৷ For more context on this story, see our ongoing latest AI developments.

কেন কয়েক দশক ধরে স্ট্র্যাটেগো এআই স্টাম্পড

ডিপ ব্লু 1997 সালে দাবাতে গ্যারি কাসপারভকে পরাজিত করে। আলফাগো 2016 সালে গো-তে লি সেডলকে পরাজিত করেছিল। পোকার বটগুলি বছরের পর বছর ধরে পেশাদারদের পরাজিত করেছে। স্ট্র্যাটেগো রাখা হয়েছে — এমনকি ডিপমাইন্ডের যথেষ্ট সম্পদের বিরুদ্ধেও।

গেমটির অসুবিধাটি লুকানো তথ্য, স্কেল এবং দৈর্ঘ্যের অস্বাভাবিক সংমিশ্রণ থেকে আসে। প্রতিটি খেলোয়াড় সামরিক পদের প্রতিনিধিত্বকারী 40 টি টুকরো কমান্ড করে, একজন মার্শাল থেকে একজন গুপ্তচর, এছাড়াও বোমা এবং একটি পতাকা। আপনি প্রতিপক্ষের পতাকা দখল করে জিতেছেন। আপনার প্রতিপক্ষ দেখতে পারে আপনার টুকরা কোথায়, কিন্তু তারা কি না. দুটি টুকরো সংঘর্ষ হলেই পরিচয় প্রকাশ পায় এবং দুর্বল অংশটি সরানো হয়।

"স্ট্র্যাটেগোতে, বোর্ডে 40 টি টুকরো আছে যা যেকোনো ক্রমে হতে পারে," গ্যাব্রিয়েল ফারিনা, একজন এমআইটি কম্পিউটার বিজ্ঞানী এবং গবেষণার সহ-লেখক, আর্স টেকনিকাকে বলেছেন। এটি একটি ডিসিলিয়ন সম্ভাব্য সেটআপেরও বেশি অনুমতি দেয় — টেক্সাস হোল্ডেমে 1,326 সম্ভাব্য হাতকে বামন করে, একটি গেম কম্পিউটার বছর আগে ক্র্যাক হয়েছিল। দৈর্ঘ্য সমস্যাটিকে আরও জটিল করে তোলে: "দাবাতে, সাধারণত খেলাটি 40 চালে চলে, কিন্তু স্ট্র্যাটেগোতে, একটি খেলা সহজেই 2,000 চাল স্থায়ী হতে পারে," ফারিনা বলেন।

তারপর ব্লাফিং আছে। একটি মার্শাল হিসাবে একটি দুর্বল টুকরা সরানো একটি প্রতিপক্ষকে ভয় দেখাতে পারে, কিন্তু খুব প্রায়ই ব্লাফ এবং হুমকি কিছুই মানে না; কখনই ব্লাফ করবেন না এবং আপনি অনুমানযোগ্য হয়ে উঠবেন। সেই ভারসাম্যমূলক কাজটিই ডিপন্যাশের মতো আগের সিস্টেমকে শীর্ষে পৌঁছাতে বাধা দেয়।

এনওয়াইইউ-এর একজন গবেষক এবং অন্য একজন সহ-লেখক ইউজিন ভিনিটস্কি বলেন, "স্ট্র্যাটেগোর মধ্যে বিশেষ কিছু আছে, যা হল এটি একটি বিশাল পরিমাণ লুকানো তথ্য যা খুব দীর্ঘ সময়ের স্কেলে প্রকাশিত হয়।"

একটি দ্বিতীয় নিউরাল নেটওয়ার্ক যা অনুমান করে

Ataraxos একই প্রাথমিক পদ্ধতি শিখেছে যেভাবে DeepNash করেছিল: নিজের বিরুদ্ধে খেলে, মোট 163 মিলিয়ন গেম, চালগুলিকে শক্তিশালী করে যা জয়ের দিকে পরিচালিত করে এবং যেগুলি হয়নি তাদের স্যাঁতসেঁতে করে৷ দলের প্রথম উন্নতি ছিল প্রতিটি খেলার পরে সিস্টেম কতটা সামঞ্জস্য করে, কারণ লুকানো তথ্য চেনাশোনাগুলিতে সেলফ-প্লে অ্যালগরিদম পাঠাতে থাকে। Ataraxos প্রশিক্ষণের শুরুর দিকে বড় কৌশল পরিবর্তন করে এবং পরে ক্রমবর্ধমান সতর্কতা অবলম্বন করে।

সবচেয়ে বড় সাফল্য ছিল ডিপন্যাশের কখনোই ছিল না: প্রতিটি পদক্ষেপের আগে চিন্তা করা। অভিনয়ের আগে অনুসন্ধান-ভিত্তিক পরিমার্জন আলফাগোকে শক্তিশালী করেছে, কিন্তু ডিপমাইন্ড এটিকে স্ট্র্যাটেগোতে কাজ করতে পারেনি কারণ অনুসন্ধানের স্থানটি খুব বিস্তৃত ছিল।

সমাধানটি ছিল একটি দ্বিতীয় নিউরাল নেটওয়ার্ক - একটি বিশ্বাসের মডেল, প্রতিপক্ষের লুকানো অংশগুলি কীভাবে তারা চলছিল তা অনুমান করার জন্য প্রশিক্ষিত। প্রতিটি সম্ভাব্য ব্যবস্থার মাধ্যমে পুনরাবৃত্তি করার পরিবর্তে, Ataraxos প্রশংসনীয় নমুনাগুলি, প্রতিটিতে প্রার্থীর চালগুলি দেখায় এবং ফলাফলের উপর ভিত্তি করে বাছাই করে৷ প্রধান লেখক স্যামুয়েল সোকোটা এবং ফারিনা একটি কাস্টম সিমুলেটরও লিখেছেন যা গ্রাফিক্স কার্ডে প্রতি সেকেন্ডে লক্ষ লক্ষ চালনা চালায়, যেভাবে একটি একাডেমিক ল্যাব প্রশিক্ষণ চালানোর সামর্থ্য রাখে। ফারিনা বলেন, "আমরা যে স্কেলে একাডেমিয়ায় রয়েছি, আমাদের GPU-এর সম্পূর্ণ ক্ষেত্রের অ্যাক্সেস নেই।"

হিউম্যান চ্যাম্পিয়ন ওয়ান ব্যাক পেয়েছে

নিমেইজার, যিনি চারটি বিশ্ব চ্যাম্পিয়নশিপ ধারণ করেছেন এবং বিশ্বের শীর্ষস্থানীয় খেলোয়াড় হিসাবে 600 সপ্তাহেরও বেশি সময় কাটিয়েছেন, আতারাক্সোসের বিরুদ্ধে তিন সপ্তাহ ধরে 20টি অনলাইন গেম খেলেছেন, প্রতিটি জয়ের জন্য $100 উপার্জন করেছেন। তিনি জানতেন যে AI তার সাথে খাপ খাইয়ে নেবে না, তাকে দুর্বলতা খুঁজে বের করার জন্য সময় দেয়। তিনি ঠিক একবার জিততে সক্ষম হন।

গবেষকরা বলছেন যে একক ক্ষতি একটি ত্রুটি ছিল না. ভালো কৌশলের জন্য আপনার সেটআপকে এলোমেলো করার প্রয়োজন, তাই ভাগ্য সবসময় একটি ভূমিকা পালন করে। "এমনকি একটি নিখুঁত কৌশল, কখনও কখনও এটি শুধু হারাতে হবে," ফারিনা বলেন।

2025 স্ট্র্যাটেগো ওয়ার্ল্ড চ্যাম্পিয়নশিপে মানব খেলোয়াড়রা আরও খারাপ কাজ করেছিল: যে সমস্ত অংশগ্রহণকারীরা অ্যাটারাক্সোসকে চ্যালেঞ্জ করেছিল তারা 40টি গেমের মধ্যে মাত্র 2টি জিতেছিল৷ বটটি এমনকি লোকেদের খেলার পদ্ধতি পরিবর্তন করেছে, মেটাগেমটিকে অস্বাভাবিক পছন্দের সাথে স্কুইং করে যেমন তার পতাকাকে দুটি বোমার পিছনে একটি কোণায় আটকে রাখা - এটি খুব কমই খেলা সেটআপ।

সিস্টেমের নাম শান্ত জন্য প্রাচীন গ্রীক শব্দ থেকে এসেছে, এবং গবেষকরা বলছেন যে এর খেলায় গুণমান দেখায়। যদিও একজন মানুষ ঘাটতি থেকে পুনরুদ্ধারের জন্য বন্যভাবে জুয়া খেলতে পারে, Ataraxos ধীরে ধীরে এবং পদ্ধতিগতভাবে ফিরে আসার পথে কাজ করে। ভিনিতস্কি বলেন, "আমরা বটটিকে 'ব্লাফ'-এর দুই শতাংশ জয়ের সম্ভাবনা থেকে ফিরে আসার পথ দেখব, খুব, খুব স্বাভাবিকভাবেই," ভিনিতস্কি বলেন।

বোর্ডের বাইরে এর অর্থ কী

লুকানো-তথ্য গেমে মানুষকে মারধর করা একটি পার্লার কৌশলের চেয়ে বেশি। প্রতিপক্ষের ব্যক্তিগত রাষ্ট্র সম্পর্কে যুক্তির জন্য কৌশলগুলি বাস্তব অ্যাপ্লিকেশনগুলির উপর ভিত্তি করে যেখানে তথ্য অসম্পূর্ণ — আলোচনার ব্যবস্থা, সাইবার নিরাপত্তা, অর্থনৈতিক মডেলিং এবং মাল্টি-এজেন্ট সমন্বয়, কয়েকটি নাম।

দক্ষতার কোণ গল্পের সবচেয়ে প্রভাবশালী অংশ প্রমাণ করতে পারে। একটি ফ্রন্টিয়ার ল্যাব 2022 সালে এই সমস্যার জন্য কয়েক মাস গণনা করেছে; একটি একাডেমিক দল 2026 সালে ব্যবহৃত গাড়ির মোটামুটি মূল্যের জন্য ফলাফলের প্রতিলিপি তৈরি করেছে এবং অতিক্রম করেছে৷ যেহেতু AI গবেষণা বিশাল গণনা বাজেটের সমার্থক হয়ে উঠেছে, Ataraxos একটি অনুস্মারক যে অ্যালগরিদমিক ধারণাগুলি - এখানে, একটি বিশ্বাস মডেল যা একটি বিশাল অনুসন্ধান স্থানকে নিয়ন্ত্রণ করে - এখনও কাঁচা স্কেল থেকে বেশি গুরুত্বপূর্ণ হতে পারে৷

দলের পেপারে এমন একটি যন্ত্রের বর্ণনা দেওয়া হয়েছে যা অনিশ্চয়তার মধ্যে শান্ত থাকে, এমন জ্ঞানকে উপেক্ষা করে যা একজন মানুষ উপেক্ষা করতে পারে না এবং বিশ্বের সেরাদের থেকে ভালোভাবে ব্লাফ করে। যেগুলি দরকারী দক্ষতা, বোর্ডে এবং এটির বাইরে।

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →