Mfumo wa AI hatimaye umeshinda Stratego, mchezo wa kawaida wa ubao ambao ulidumaza mashine kwa miongo kadhaa - na ulifanya hivyo kwa bajeti ndogo. Timu ya watafiti kutoka Chuo Kikuu cha Carnegie Mellon, MIT, Chuo Kikuu cha New York na Chuo Kikuu cha Stanford walijenga AI iitwayo Ataraxos ambayo ilishinda Pim Niemeijer, inayozingatiwa sana kama mchezaji bora wa Stratego wa wakati wote, kwa alama ya michezo 15 hadi 1 na sare nne, Ars Technica inaripoti.

Matokeo yake ni ya kuvutia kidogo kwa alama kuliko lebo ya bei. Ataraxos walipata mafunzo kwenye GPU 16 pekee kwa takriban wiki moja, pamoja na GPU nne za ziada kwa siku nne ili kutoa mafunzo kwa modeli inayotumika - mbio ambayo timu inasema iligharimu dola elfu chache pekee. DeepMind's DeepNash, mfumo wa 2022 ambao ulileta umakini mkubwa wa AI kwenye mchezo, uliofunzwa kwa miezi miwili hadi mitatu juu ya chipsi 1,024 za TPU maalum za Google, mpango ambao timu ya Ataraxos inakadiria ingegharimu kati ya $ 3 milioni na $ 4.5 milioni kwa bei ya 2025. For more context on this story, see our ongoing breaking AI news.

Kwa Nini Stratego Ilikwaza AI kwa Miongo kadhaa

Deep Blue ilimshinda Garry Kasparov kwenye chess mwaka wa 1997. AlphaGo ilimshinda Lee Sedol kwenye Go mwaka wa 2016. Poker roboti imeshinda wataalamu kwa miaka mingi. Stratego ilishikilia - hata dhidi ya rasilimali nyingi za DeepMind.

Ugumu wa mchezo unatokana na mchanganyiko wake usio wa kawaida wa maelezo yaliyofichwa, ukubwa na urefu. Kila mchezaji anaamuru vipande 40 vinavyowakilisha safu za kijeshi, kutoka kwa marshal kwenda chini kwa jasusi, pamoja na mabomu na bendera. Unashinda kwa kukamata bendera ya mpinzani. Mpinzani wako anaweza kuona sehemu zako ziko, lakini sio zilivyo. Vitambulisho vinafunuliwa tu wakati vipande viwili vinapogongana, na kipande dhaifu kinaondolewa.

"Katika Stratego, kuna vipande 40 kwenye ubao ambavyo vinaweza kuwa kwa mpangilio wowote," Gabriele Farina, mwanasayansi wa kompyuta wa MIT na mwandishi mwenza wa utafiti huo, aliiambia Ars Technica. Hiyo inaruhusu zaidi ya decillion iwezekanavyo usanidi - kupunguza mikono 1,326 inayowezekana huko Texas Hold'em, mchezo wa kompyuta ulioharibika miaka iliyopita. Urefu huchanganya tatizo: "Katika chess, kwa kawaida mchezo huchukua hatua 40, lakini katika Stratego, mchezo unaweza kudumu kwa hatua 2,000 kwa urahisi," Farina alisema.

Kisha kuna bluffing. Kusonga kipande dhaifu kana kwamba ni marshal kunaweza kumtisha mpinzani, lakini bluff mara nyingi sana na vitisho haimaanishi chochote; kamwe bluff na wewe kuwa kutabirika. Kitendo hicho cha kusawazisha ndicho kilizuia mifumo ya awali kama DeepNash kufika kileleni.

"Kuna kitu cha kipekee kuhusu Stratego, ambacho ni kwamba ni habari nyingi zilizofichwa ambazo hujitokeza kwa muda mrefu," alisema Eugene Vinitsky, mtafiti katika NYU na mwandishi mwenza mwingine.

Mtandao wa Pili wa Neural Ambao Unakisia

Ataraxos ilijifunza njia sawa ya msingi ambayo DeepNash alijifunza: kwa kucheza dhidi yake yenyewe, jumla ya michezo milioni 163, kuimarisha hatua ambazo ziliongoza kwa ushindi na kupunguza wale ambao hawakufanya. Uboreshaji wa kwanza wa timu ulikuwa ni kiasi gani mfumo ulirekebishwa baada ya kila mchezo, kwa sababu maelezo yaliyofichwa huwa yanatuma algoriti za uchezaji wa kibinafsi kwenye miduara. Ataraxos ilifanya mabadiliko makubwa ya mkakati mapema katika mafunzo na kuwa makini zaidi baadaye.

Ufanisi mkubwa ulikuwa kitu ambacho DeepNash hakuwahi kuwa nacho: kufikiria mbele kabla ya kila hatua. Uboreshaji unaotegemea utafutaji kabla ya kuigiza ndio ulifanya AlphaGo kuwa na nguvu, lakini DeepMind haikuweza kuifanya ifanye kazi katika Stratego kwa sababu nafasi ya utafutaji ilikuwa kubwa sana.

Suluhisho lilikuwa mtandao wa pili wa neva - kielelezo cha imani, kilichofunzwa kukisia vipande vilivyofichwa vya mpinzani kutokana na jinsi walivyokuwa wanasonga. Badala ya kurudia kila mpangilio unaowezekana, Ataraxos hutoa sampuli zinazokubalika, hucheza mienendo ya watahiniwa katika kila moja, na kuchagua kulingana na matokeo. Mwandishi mkuu Samuel Sokota na Farina pia waliandika kiigaji maalum ambacho huendesha mamilioni ya hatua kwa sekunde kwenye kadi za michoro, ambayo ni jinsi maabara ya kitaaluma inaweza kumudu mafunzo hayo. "Kwa kiwango ambacho tuko katika taaluma, hatuna ufikiaji wa uwanja mzima wa GPU," Farina alisema.

Bingwa wa Binadamu Amepata Mrejesho Mmoja

Niemeijer, ambaye anashikilia ubingwa wa dunia mara nne na ametumia zaidi ya wiki 600 kama mchezaji bora wa dunia, alicheza michezo 20 mtandaoni dhidi ya Ataraxos kwa muda wa wiki tatu, akipata $100 kwa kila ushindi. Alijua AI haitamzoea, ikimpa wakati wa kuwinda udhaifu. Aliweza kushinda mara moja haswa.

Watafiti wanasema kwamba hasara moja haikuwa dosari. Stratego Nzuri inahitaji kubadilisha usanidi wako, kwa hivyo bahati huwa na jukumu kila wakati. "Hata mkakati mzuri, wakati mwingine utapotea," Farina alisema.

Wachezaji wa kibinadamu kwenye Mashindano ya Dunia ya Stratego ya 2025 walifanya vibaya zaidi: waliohudhuria ambao walishindana na Ataraxos walishinda michezo 2 pekee kati ya 40. Mfumo wa roboti hata ulibadilisha jinsi watu wanavyocheza, na kubadilisha metagame kwa chaguo zisizo za kawaida kama vile kuweka bendera yake kwenye kona nyuma ya mabomu mawili - usanidi ambao hauchezwi sana.

Jina la mfumo huo linatokana na neno la Kigiriki la kale kwa utulivu, na watafiti wanasema kwamba ubora unaonyesha katika mchezo wake. Ingawa mwanadamu anaweza kucheza kamari kwa fujo ili kuokoa nakisi, Ataraxos inarudi nyuma polepole na kwa utaratibu. "Tungetazama kijibu 'bluff' ikirudi kutoka kama uwezekano wa ushindi wa asilimia mbili, kwa kawaida sana," Vinitsky alisema.

Maana yake Zaidi ya Bodi

Kupiga wanadamu kwenye michezo ya habari iliyofichwa ni zaidi ya mbinu ya kawaida. Mbinu za hoja kuhusu hali ya faragha ya mpinzani huzingatia maombi halisi ambapo taarifa haijakamilika - mifumo ya mazungumzo, usalama wa mtandao, uundaji wa miundo ya kiuchumi na uratibu wa mawakala wengi, kutaja chache.

Pembe ya ufanisi inaweza kuthibitisha sehemu yenye ushawishi mkubwa zaidi wa hadithi. Maabara ya mipaka ilitumia miezi mingi ya kukokotoa tatizo hili mnamo 2022; timu ya wasomi iliiga na kuvuka matokeo kwa takriban bei ya gari lililotumika mwaka wa 2026. Utafiti wa AI unapozidi kuwa sawa na bajeti kubwa za kokotoo, Ataraxos ni ukumbusho kwamba mawazo ya algoriti - hapa, kielelezo cha imani ambacho hudhibiti nafasi kubwa ya utafutaji - bado inaweza kuwa muhimu zaidi kuliko kiwango ghafi.

Karatasi ya timu inaelezea mashine ambayo inatulia chini ya kutokuwa na uhakika, inapuuza maarifa ambayo mwanadamu hangeweza kupuuza, na bluffs bora zaidi kuliko bora zaidi duniani. Hizo ni ujuzi muhimu, kwenye ubao na nje yake.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →