Ένα σύστημα τεχνητής νοημοσύνης κατέκτησε επιτέλους το Stratego, το κλασικό επιτραπέζιο παιχνίδι που παραβίαζε μηχανές για δεκαετίες — και το έκανε με περιορισμένο προϋπολογισμό. Μια ομάδα ερευνητών από το Carnegie Mellon University, το MIT, το Πανεπιστήμιο της Νέας Υόρκης και το Πανεπιστήμιο του Στάνφορντ κατασκεύασε ένα AI που ονομάζεται Ataraxos που νίκησε τον Pim Niemeijer, που θεωρείται ευρέως ως ο καλύτερος παίκτης Stratego όλων των εποχών, με σκορ 15 αγώνων προς 1 με τέσσερις ισοπαλίες, αναφέρει η Ars Technica.

Το αποτέλεσμα είναι λιγότερο εντυπωσιακό για το σκορ παρά για την τιμή. Η Ataraxos εκπαιδεύτηκε σε μόλις 16 GPU για περίπου μια εβδομάδα, συν τέσσερις επιπλέον GPU για τέσσερις ημέρες για να εκπαιδεύσει ένα συνοδευτικό μοντέλο - μια εκτέλεση που η ομάδα λέει ότι κόστισε μόνο μερικές χιλιάδες δολάρια. Το DeepNash της DeepMind, το σύστημα του 2022 που έφερε για πρώτη φορά την προσοχή της τεχνητής νοημοσύνης στο παιχνίδι, εκπαιδεύτηκε για δύο έως τρεις μήνες σε 1.024 εξειδικευμένα τσιπ TPU της Google, μια εκτέλεση που η ομάδα Ataraxos εκτιμά ότι θα κοστίσει μεταξύ 3 και 4,5 εκατομμυρίων δολαρίων σε τιμές 2025. For more context on this story, see our ongoing artificial intelligence updates.

Γιατί το Stratego παραβίασε την τεχνητή νοημοσύνη για δεκαετίες

Το Deep Blue κέρδισε τον Garry Kasparov στο σκάκι το 1997. Η AlphaGo νίκησε τον Lee Sedol στο Go το 2016. Τα ρομπότ πόκερ έχουν κερδίσει τους επαγγελματίες εδώ και χρόνια. Το Stratego άντεξε — ακόμη και ενάντια στους σημαντικούς πόρους του DeepMind.

Η δυσκολία του παιχνιδιού προέρχεται από τον ασυνήθιστο συνδυασμό κρυφών πληροφοριών, κλίμακας και μήκους. Κάθε παίκτης διατάζει 40 κομμάτια που αντιπροσωπεύουν στρατιωτικές τάξεις, από στρατάρχη μέχρι κατάσκοπο, συν βόμβες και μια σημαία. Κερδίζεις κατακτώντας τη σημαία του αντιπάλου. Ο αντίπαλός σας μπορεί να δει πού βρίσκονται τα κομμάτια σας, αλλά όχι τι είναι. Οι ταυτότητες αποκαλύπτονται μόνο όταν δύο κομμάτια συγκρούονται και το ασθενέστερο κομμάτι αφαιρείται.

«Στο Stratego, υπάρχουν 40 κομμάτια στον πίνακα που θα μπορούσαν να είναι με οποιαδήποτε σειρά», είπε στην Ars Technica ο Gabriele Farina, επιστήμονας υπολογιστών του MIT και συν-συγγραφέας της μελέτης. Αυτό επιτρέπει περισσότερες από ένα εκατομμύριο πιθανές ρυθμίσεις - να μειώσει τα 1.326 πιθανά χέρια στο Texas Hold'em, ένα παιχνίδι που οι υπολογιστές έσπασαν πριν από χρόνια. Το μήκος εντείνει το πρόβλημα: «Στο σκάκι, συνήθως το παιχνίδι διαρκεί 40 κινήσεις, αλλά στο Stratego, ένα παιχνίδι μπορεί εύκολα να διαρκέσει 2.000 κινήσεις», είπε η Farina.

Μετά υπάρχει η μπλόφα. Το να μετακινείς ένα αδύναμο κομμάτι σαν να ήταν στρατάρχης μπορεί να τρομάξει τον αντίπαλο, αλλά η μπλόφα πολύ συχνά και οι απειλές δεν σημαίνουν τίποτα. ποτέ μην μπλοφάρεις και γίνεσαι προβλέψιμος. Αυτή η πράξη εξισορρόπησης είναι που κράτησε προηγούμενα συστήματα όπως το DeepNash από το να φτάσουν στην κορυφή.

«Υπάρχει κάτι εξαιρετικά χαρακτηριστικό για το Stratego, το οποίο είναι ότι είναι ένας τεράστιος όγκος κρυφών πληροφοριών που ξεδιπλώνονται σε πολύ μεγάλη χρονική κλίμακα», δήλωσε ο Eugene Vinitsky, ερευνητής στο NYU και ένας άλλος συν-συγγραφέας.

Ένα δεύτερο νευρωνικό δίκτυο που μαντεύει

Ο Ataraxos έμαθε τον ίδιο βασικό τρόπο με τον DeepNash: παίζοντας ενάντια στον εαυτό του, 163 εκατομμύρια παιχνίδια συνολικά, ενισχύοντας κινήσεις που οδήγησαν σε νίκες και αμβλύνοντας εκείνες που δεν το έκαναν. Η πρώτη βελτίωση της ομάδας ήταν στο πόσο προσαρμόστηκε το σύστημα μετά από κάθε παιχνίδι, επειδή οι κρυφές πληροφορίες τείνουν να στέλνουν αλγόριθμους αυτο-παιχνιδιών σε κύκλους. Ο Ατάραξος έκανε μεγάλες αλλαγές στρατηγικής νωρίς στην προπόνηση και ολοένα και πιο προσεκτικές αργότερα.

Η μεγαλύτερη ανακάλυψη ήταν κάτι που ο DeepNash δεν είχε ποτέ: να σκεφτεί μπροστά πριν από κάθε κίνηση. Η βελτίωση που βασίζεται στην αναζήτηση πριν από την ενεργοποίηση είναι αυτό που έκανε το AlphaGo ισχυρό, αλλά το DeepMind δεν μπορούσε να το κάνει να λειτουργήσει στο Stratego επειδή ο χώρος αναζήτησης ήταν πολύ μεγάλος.

Η λύση ήταν ένα δεύτερο νευρωνικό δίκτυο - ένα μοντέλο πεποιθήσεων, εκπαιδευμένο να μαντεύει τα κρυμμένα κομμάτια του αντιπάλου από το πώς κινούνταν. Αντί να επαναλαμβάνει κάθε πιθανή διευθέτηση, ο Ataraxos δειγματίζει εύλογες, παίζει υποψήφιες κινήσεις σε καθεμία και επιλέγει με βάση τα αποτελέσματα. Ο κύριος συγγραφέας Samuel Sokota και Farina έγραψαν επίσης έναν προσαρμοσμένο προσομοιωτή που εκτελεί εκατομμύρια κινήσεις ανά δευτερόλεπτο σε κάρτες γραφικών, με τον οποίο ένα ακαδημαϊκό εργαστήριο θα μπορούσε να αντέξει οικονομικά τη διαδρομή της εκπαίδευσης. "Στην κλίμακα που βρισκόμαστε στον ακαδημαϊκό χώρο, δεν έχουμε πραγματικά πρόσβαση σε ένα ολόκληρο πεδίο GPU", είπε η Farina.

Ο Human Champion πήρε ένα πίσω

Ο Niemeijer, ο οποίος κατέχει τέσσερα παγκόσμια πρωταθλήματα και έχει περάσει περισσότερες από 600 εβδομάδες ως ο κορυφαίος παίκτης στον κόσμο, έπαιξε 20 διαδικτυακά παιχνίδια εναντίον του Ataraxos σε τρεις εβδομάδες, κερδίζοντας $100 για κάθε νίκη. Ήξερε ότι η τεχνητή νοημοσύνη δεν θα προσαρμοστεί σε αυτόν, δίνοντάς του χρόνο να κυνηγήσει τις αδυναμίες του. Κατάφερε να κερδίσει ακριβώς μία φορά.

Οι ερευνητές λένε ότι η μεμονωμένη απώλεια δεν ήταν ελάττωμα. Το Good Stratego απαιτεί τυχαιοποίηση της εγκατάστασης σας, επομένως η τύχη παίζει πάντα ρόλο. «Ακόμα και μια τέλεια στρατηγική, μερικές φορές απλά θα χάσει», είπε η Farina.

Οι ανθρώπινοι παίκτες στο Παγκόσμιο Πρωτάθλημα Stratego 2025 τα πήγαν πολύ χειρότερα: οι συμμετέχοντες που προκάλεσαν τον Ατάραξο κέρδισαν μόνο 2 από τα 40 παιχνίδια. Το ρομπότ άλλαξε ακόμη και τον τρόπο που παίζουν οι άνθρωποι, παραμορφώνοντας το metagame με ασυνήθιστες επιλογές, όπως το να βάζει τη σημαία του σε μια γωνία πίσω από δύο μόνο βόμβες - μια διάταξη που παίζεται σπάνια.

Το όνομα του συστήματος προέρχεται από την αρχαία ελληνική λέξη για την ηρεμία και οι ερευνητές λένε ότι η ποιότητα φαίνεται στο παιχνίδι του. Ενώ ένας άνθρωπος μπορεί να στοιχηματίσει άγρια ​​για να ανακάμψει από ένα έλλειμμα, ο Ατάραξος επιστρέφει αργά και μεθοδικά. «Θα παρακολουθούσαμε το ρομπότ να «μπλοφάρει» την επιστροφή του από πιθανότητες νίκης δύο τοις εκατό, πολύ, πολύ επιπόλαια», είπε ο Βινίτσκι.

Τι σημαίνει πέρα από το διοικητικό συμβούλιο

Το να χτυπάς ανθρώπους σε παιχνίδια κρυφής πληροφόρησης είναι κάτι περισσότερο από ένα τέχνασμα. Οι τεχνικές συλλογισμού σχετικά με το ιδιωτικό κράτος ενός αντιπάλου υποστηρίζουν πραγματικές εφαρμογές όπου οι πληροφορίες είναι ελλιπείς - συστήματα διαπραγμάτευσης, ασφάλεια στον κυβερνοχώρο, οικονομική μοντελοποίηση και συντονισμός πολλών πρακτόρων, για να αναφέρουμε μερικές.

Η γωνία απόδοσης μπορεί να αποδειχθεί το πιο σημαντικό μέρος της ιστορίας. Ένα συνοριακό εργαστήριο ξόδεψε μήνες υπολογισμού για αυτό το πρόβλημα το 2022. μια ακαδημαϊκή ομάδα αναπαρήγαγε και ξεπέρασε το αποτέλεσμα για περίπου την τιμή ενός μεταχειρισμένου αυτοκινήτου το 2026. Καθώς η έρευνα τεχνητής νοημοσύνης γίνεται συνώνυμη με τεράστιους υπολογιστικούς προϋπολογισμούς, το Ataraxos υπενθυμίζει ότι οι αλγοριθμικές ιδέες — εδώ, ένα μοντέλο πεποίθησης που εξημερώνει έναν τεράστιο χώρο αναζήτησης — μπορεί να έχουν μεγαλύτερη σημασία από την ακατέργαστη κλίμακα.

Το άρθρο της ομάδας περιγράφει ένα μηχάνημα που παραμένει ήρεμο κάτω από την αβεβαιότητα, αγνοεί τη γνώση που ένας άνθρωπος δεν θα μπορούσε να αγνοήσει και μπλοφάρει καλύτερα από τον καλύτερο στον κόσμο. Αυτές είναι χρήσιμες δεξιότητες, στο ταμπλό και εκτός αυτού.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →