Bir yapay zeka sistemi nihayet onlarca yıldır makineleri şaşkına çeviren klasik masa oyunu Stratego'yu fethetti ve bunu kısıtlı bir bütçeyle başardı. Ars Technica'nın raporuna göre Carnegie Mellon Üniversitesi, MIT, New York Üniversitesi ve Stanford Üniversitesi'nden bir araştırma ekibi, Ataraxos adında bir yapay zeka geliştirdi ve bu yapay zeka, tüm zamanların en iyi Stratego oyuncusu olarak kabul edilen Pim Niemeijer'i 15'e 1 skorla ve dört beraberlik ile mağlup etti.

Sonuç, puan tablosu açısından fiyat etiketinden daha az dikkat çekicidir. Ataraxos, yaklaşık bir hafta boyunca yalnızca 16 GPU ile eğitim aldı, ayrıca yardımcı bir modeli eğitmek için dört gün boyunca ilave dört GPU eğitimi aldı; ekip, bunun yalnızca birkaç bin dolara mal olduğunu söylüyor. DeepMind'in DeepNash'i, yani 2022'de oyuna yapay zekanın ciddi anlamda dikkatini çeken sistem, iki ila üç ay boyunca Google'ın 1.024 özel TPU çipi üzerinde eğitildi; Ataraxos ekibinin tahminlerine göre 2025 fiyatlarıyla 3 milyon ila 4,5 milyon dolar arasında bir maliyete sahip olacak. For more context on this story, see our ongoing AI news.

Stratego Yapay Zekayı On Yıllar Boyunca Neden Şaşırttı?

Deep Blue, 1997'de satrançta Garry Kasparov'u yendi. AlphaGo, 2016'da Go'da Lee Sedol'u yendi. Poker botları yıllardır profesyonelleri yendi. Stratego, DeepMind'ın hatırı sayılır kaynaklarına rağmen direndi.

Oyunun zorluğu, gizli bilgilerin, ölçeğin ve uzunluğun olağandışı birleşiminden kaynaklanmaktadır. Her oyuncu, mareşalden casusa kadar askeri rütbeleri temsil eden 40 parçanın yanı sıra bombalar ve bir bayrağa komuta eder. Rakibin bayrağını ele geçirerek kazanırsınız. Rakibiniz taşlarınızın nerede olduğunu görebilir ancak ne olduklarını göremez. Kimlikler yalnızca iki parça çarpıştığında ve daha zayıf olan parça çıkarıldığında ortaya çıkar.

MIT bilgisayar bilimcisi ve çalışmanın ortak yazarı Gabriele Farina, Ars Technica'ya "Stratego'da tahtada herhangi bir sırada olabilecek 40 parça var" dedi. Bu, bir desilyondan fazla olası kuruluma olanak tanıyor; yıllar önce oyun bilgisayarlarının kırdığı Texas Hold'em'deki 1.326 olası eli gölgede bırakıyor. Uzunluk sorunu daha da karmaşık hale getiriyor: "Satrançta oyun genellikle 40 hamle sürer, ancak Stratego'da bir oyun kolaylıkla 2.000 hamle sürebilir" dedi Farina.

Sonra blöf yapılıyor. Zayıf bir taşı sanki bir mareşalmiş gibi hareket ettirmek rakibi korkutabilir, ancak çok sık blöf yapılırsa tehditlerin hiçbir anlamı kalmaz; asla blöf yapmazsanız tahmin edilebilir olursunuz. Bu dengeleme eylemi, DeepNash gibi eski sistemlerin zirveye ulaşmasını engelleyen şeydi.

NYU'da araştırmacı ve başka bir ortak yazar olan Eugene Vinitsky, "Stratego'nun çok farklı bir yanı var; çok uzun bir zaman ölçeğinde ortaya çıkan muazzam miktarda gizli bilgi olmasıdır" dedi.

Tahmin Eden İkinci Bir Sinir Ağı

Ataraxos, DeepNash'in öğrendiği temel yöntemin aynısını öğrendi: kendine karşı oynayarak, toplamda 163 milyon oyun, galibiyete yol açan hamleleri güçlendirdi ve sağlamayanları sönümledi. Takımın ilk gelişimi, sistemin her oyundan sonra ne kadar ayarlandığıyla ilgiliydi, çünkü gizli bilgiler, kendi kendine oyun algoritmalarını daireler halinde gönderme eğilimindedir. Ataraxos eğitimin başlarında büyük strateji değişiklikleri yaptı ve daha sonra giderek daha dikkatli hale geldi.

Daha büyük ilerleme DeepNash'in asla sahip olmadığı bir şeydi: Her hareketten önce ileriyi düşünmek. AlphaGo'yu güçlü kılan şey oyunculuktan önce aramaya dayalı iyileştirmeydi, ancak arama alanı çok geniş olduğundan DeepMind onu Stratego'da çalıştıramadı.

Çözüm, ikinci bir sinir ağıydı; rakibin gizli parçalarını nasıl hareket ettiğine göre tahmin etmek için eğitilmiş bir inanç modeli. Ataraxos, mümkün olan her düzenlemeyi yinelemek yerine, makul olanları örnekliyor, her birinde aday hamleleri oynuyor ve sonuçlara göre seçim yapıyor. Başyazar Samuel Sokota ve Farina ayrıca grafik kartlarında saniyede milyonlarca hareket çalıştıran özel bir simülatör yazdılar; bu, bir akademik laboratuvarın eğitim çalıştırmasını bu şekilde karşılayabilmesinin yoluydu. Farina, "Akademide bulunduğumuz ölçekte, GPU'ların tamamına erişimimiz yok" dedi.

İnsan Şampiyon Birini Geri Aldı

Dört dünya şampiyonluğu bulunan ve 600 haftadan fazla süreyi dünyanın en iyi oyuncusu olarak geçiren Niemeijer, üç hafta boyunca Ataraxos'a karşı 20 çevrimiçi oyun oynadı ve her galibiyetten 100 dolar kazandı. Yapay zekanın kendisine uyum sağlamayacağını ve bu sayede zayıf yönlerini bulmasına zaman tanıyacağını biliyordu. Tam olarak bir kez kazanmayı başardı.

Araştırmacılar tek kaybın kusur olmadığını söylüyor. İyi Strateji, kurulumunuzu rastgele hale getirmeyi gerektirir, bu nedenle şans her zaman bir rol oynar. Farina, "Mükemmel bir strateji bile bazen kaybedebilir" dedi.

2025 Stratego Dünya Şampiyonası'ndaki insan oyuncular çok daha kötü sonuçlar aldı: Ataraxos'a meydan okuyan katılımcılar 40 oyundan yalnızca 2'sini kazandı. Bot, meta oyunu, bayrağını yalnızca iki bombanın arkasındaki bir köşeye sıkıştırmak gibi alışılmadık seçeneklerle çarpıtarak insanların oynama şeklini bile değiştirdi; bu, nadiren oynanan bir düzendir.

Sistemin adı eski Yunancada sakinlik anlamına gelen kelimeden geliyor ve araştırmacılar kalitenin oyunda kendini gösterdiğini söylüyor. Bir insan bir açıktan kurtulmak için çılgınca kumar oynayabilirken, Ataraxos yavaş ve sistemli bir şekilde geri dönüş yolunda ilerliyor. Vinitsky, "Botun 'blöfünü' yüzde ikilik bir zafer olasılığından çok çok gelişigüzel bir şekilde geri dönüşünü izlerdik" dedi.

Tahtanın Ötesinde Ne İfade Ediyor?

Gizli bilgi oyunlarında insanları yenmek bir salon numarasından daha fazlasıdır. Rakibin özel durumu hakkında akıl yürütme teknikleri, bilginin eksik olduğu gerçek uygulamaların temelini oluşturur; müzakere sistemleri, siber güvenlik, ekonomik modelleme ve çok-acenteli koordinasyon bunlardan birkaçıdır.

Verimlilik açısı hikayenin en etkili kısmı olabilir. Bir sınır laboratuvarı 2022'de bu sorun üzerinde aylarca hesaplama yaptı; Akademik bir ekip bu sonucu tekrarladı ve 2026'da yaklaşık olarak kullanılmış bir arabanın fiyatına ulaştı. Yapay zeka araştırması büyük bilgi işlem bütçeleriyle eşanlamlı hale geldikçe Ataraxos, algoritmik fikirlerin (burada, devasa bir arama alanını ehlileştiren bir inanç modeli) hala ham ölçekten daha önemli olabileceğini hatırlatıyor.

Ekibin makalesi, belirsizlik altında sakin kalabilen, bir insanın göz ardı edemeyeceği bilgileri göz ardı eden ve dünyanın en iyisinden daha iyi blöf yapan bir makineyi anlatıyor. Bunlar tahtada ve tahta dışında faydalı becerilerdir.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →