Η Anthropic δημοσίευσε έρευνα που δείχνει ότι τα αυτοματοποιημένα συστήματα AI μπορούν να επιδιορθώσουν αξιόπιστα τις αστοχίες ευθυγράμμισης ενός μοντέλου, ένα αποτέλεσμα που θα μπορούσε να αναδιαμορφώσει τον τρόπο με τον οποίο γίνεται η εργασία ασφάλειας στο κέντρο της βιομηχανίας AI. Η δημοσίευση, με τίτλο "Automated Researchers Can Reliably Mitigate Alignment Failures", κυκλοφόρησε την Παρασκευή και αναλυτικά από το TechCrunch.

Η έρευνα προέρχεται από το πρόγραμμα υποτρόφων του Anthropic και διευθύνεται από τον Chen Yueh-Han. Ο κεντρικός ισχυρισμός της είναι εντυπωσιακός: όταν τα αυτοματοποιημένα ερευνητικά συστήματα της εταιρείας επισημάνθηκαν σε δέκα σημεία αναφοράς που μετρούν συγκεκριμένες κακώς ευθυγραμμισμένες συμπεριφορές, βελτίωσαν την απόδοση σε κάθε μία — χωρίς να υποβαθμίζουν τις συνολικές δυνατότητες του μοντέλου. Αυτό είναι ένα αξιοσημείωτο αποτέλεσμα για έναν τομέα που έχει δυσκολευτεί να διατηρήσει τις εργασίες ασφαλείας σε συμφωνία με την κλίμακα του μοντέλου. For more context on this story, see our ongoing AI trends.

Η ιστορία προσγειώθηκε κατά τη διάρκεια μιας πολυάσχολης κάλυψης για την ασφάλεια της τεχνητής νοημοσύνης. Ακολουθεί ένα καλοκαίρι κατά το οποίο η κακή συμπεριφορά των πρακτόρων έχει κυριαρχήσει στα πρωτοσέλιδα, από την εσωτερική αναφορά του OpenAI για πράκτορες hacking ανταμοιβής έως τις εκκλήσεις για ανεξάρτητες έρευνες για την παραβίαση του Hugging Face. Το νέο έγγραφο της Anthropic προσεγγίζει το πρόβλημα από την αντίθετη κατεύθυνση: αντί να ρωτά πώς συμπεριφέρονται άσχημα οι πράκτορες, ρωτά εάν μπορούν να εμπιστευτούν άλλους πράκτορες για να τους επιλύσουν.

Τι αναφέρει πραγματικά το έγγραφο

Το σύστημα που περιγράφεται στην εργασία ονομάζεται Automated Alignment Researcher ή AAR. Αντί να αντικαταστήσει την ερευνητική διαδικασία, το AAR αναπαράγει μεγάλο μέρος της: κάθε αυτοματοποιημένο σύστημα αναζητά τη διαθέσιμη βιβλιογραφία, προτείνει μια μέθοδο και εκπαιδεύει το μοντέλο χρησιμοποιώντας αυτήν τη μέθοδο για περίπου 30 λεπτά. Στη συνέχεια, η διαδικασία επαναλαμβάνεται σε πολλές επαναλήψεις.

Ο μηχανισμός επιλογής είναι απλός. Οι μέθοδοι που μετακινούν το σημείο αναφοράς διατηρούνται. μέθοδοι που δεν το κάνουν απορρίπτονται. Αυτός ο βρόχος επιτρέπει στο σύστημα να λειτουργεί γρήγορα και σε κλίμακα που καμία ανθρώπινη ομάδα δεν θα μπορούσε να ταιριάξει, δοκιμάζοντας πολλές ερευνητικές κατευθύνσεις παράλληλα και διατηρώντας μόνο ό,τι λειτουργεί.

Σύμφωνα με την εφημερίδα, τα αποτελέσματα ήταν συνεπή σε όλους τους τομείς. Και στα δέκα σημεία αναφοράς που καλύπτουν συγκεκριμένες μη ευθυγραμμισμένες συμπεριφορές, τα αυτοματοποιημένα συστήματα παρήγαγαν μετρήσιμες βελτιώσεις χωρίς να βλάψουν τη συνολική απόδοση του μοντέλου — η συνήθης αντιστάθμιση που δυσκολεύει την ευθυγράμμιση.

«Συνολικά, αυτά τα αποτελέσματα παρέχουν πρώιμα στοιχεία ότι η αυτοματοποιημένη ευθυγράμμιση μετά την εκπαίδευση θα μπορούσε να γίνει πρακτική στο εγγύς μέλλον», αναφέρει η εφημερίδα.

Beating the Humans, στο 1/37ο το κόστος

Τα πιο αναφερόμενα αποσπάσματα στην εργασία είναι εκείνα όπου συγκρίνει το AAR απευθείας με τα ανθρώπινα αντίστοιχα. Η Anthropic δεν αντιστάθμισε τη σύγκριση.

«Η καλύτερη μέθοδος AAR ξεπερνά αυτό που προτείνουν οι έμπειροι άνθρωποι, κατά μέσο όρο μέσα σε έξι ώρες», αναφέρει η εφημερίδα. Προσθέτει, εύστοχα, ότι «οι κατευθυνόμενες από τον άνθρωπο κατευθύνσεις έρευνας δεν οδηγούν σε ισχυρότερες επιδόσεις».

Τα οικονομικά είναι εξίσου ωμά. "Ένα AAR κοστίζει περίπου 4 $ ανά ώρα σε συμπέρασμα API έναντι 150 $ ανά ώρα που πληρώνουμε στους ανθρώπινους ερευνητές μας", γράφουν οι συγγραφείς. Αυτή είναι μια διαφορά κόστους σχεδόν 40 φορές, και εξηγεί γιατί τα εργαστήρια λαμβάνουν στα σοβαρά την αυτοματοποιημένη έρευνα ως κάτι περισσότερο από μια περιέργεια.

Γιατί το χάσμα κόστους έχει σημασία

Η έρευνα ευθυγράμμισης είναι δαπανηρή με τρόπο που είναι εύκολο να υποτιμηθεί. Κάθε παρέμβαση υποψηφίου πρέπει να υλοποιηθεί, να εκπαιδευτεί και να αξιολογηθεί με βάση τα κριτήρια αναφοράς και οι περισσότεροι υποψήφιοι αποτυγχάνουν. Εάν ένα σύστημα μπορεί να εκτελεί αυτόν τον βρόχο αναζήτησης συνεχώς για την τιμή των κλήσεων API, το οριακό κόστος της δοκιμής μιας ακόμη ιδέας πλησιάζει το μηδέν. Ο περιορισμός μετατοπίζεται από τον αριθμό εργαζομένων στον υπολογισμό.

The Limitations Anthropic Itself Flagged

Το έγγραφο είναι ειλικρινές σχετικά με το τι δεν αποδεικνύει το αποτέλεσμα. Το αυτοματοποιημένο σύστημα λειτουργεί μόνο στο βαθμό που τα σημεία αναφοράς αντικατοπτρίζουν πραγματικά τους στόχους ευθυγράμμισης που έχουν σημασία — και η δημιουργία και η διατήρηση σημείων αναφοράς που καταγράφουν κακή συμπεριφορά στον πραγματικό κόσμο παραμένει ανοιχτό πρόβλημα στο πεδίο.

Υπάρχει επίσης μια εξάρτηση που είναι εύκολο να χαθεί: οι αυτοματοποιημένοι ερευνητές βασίζονται σε μια υπάρχουσα βιβλιογραφία μεθόδων. Η διατήρηση και η επέκταση αυτής της λογοτεχνίας είναι από μόνη της σημαντικό έργο και ένα σύστημα που αναμιγνύει μόνο γνωστές τεχνικές μπορεί να φτάσει σε ένα ανώτατο όριο που δεν θα έκανε η ανθρώπινη δημιουργικότητα.

Αυτές οι προειδοποιήσεις έχουν σημασία γιατί η μακροπρόθεσμη σημασία της έρευνας εξαρτάται από αυτές. Εάν τα σημεία αναφοράς μετρούν τα λάθος πράγματα, ένα AAR μπορεί να βελτιστοποιήσει τον δρόμο του προς ισχυρούς αριθμούς, ενώ οι υποκείμενοι κίνδυνοι παραμένουν ανέγγιχτοι. Το πλαίσιο του Anthropic - «πρώιμα στοιχεία», όχι λύση - αντανακλά αυτή την αβεβαιότητα.

Ένα βήμα προς την αναδρομική αυτοβελτίωση

Το έγγραφο τροφοδοτεί επίσης μια ευρύτερη συζήτηση σχετικά με την αναδρομική αυτοβελτίωση, την ιδέα ότι τα συστήματα τεχνητής νοημοσύνης θα μπορούσαν τελικά να βελτιώσουν τις ίδιες τις διαδικασίες εκπαίδευσης που τα παράγουν. Η εκπαίδευση μοντέλων τεχνητής νοημοσύνης με άλλα μοντέλα τεχνητής νοημοσύνης έχει γίνει δημοφιλής στόχος για τα συνοριακά εργαστήρια και το αποτέλεσμα της Anthropic είναι μια πρώιμη, συγκεκριμένη ματιά στο πώς φαίνεται σε έναν στενό τομέα.

Η λογική είναι ξεκάθαρη. Εάν τα μοντέλα μπορούν να βελτιώσουν αξιόπιστα τη δική τους εκπαίδευση ευθυγράμμισης, τα ίδια μηχανήματα θα μπορούσαν εύλογα να κατευθύνονται σε πρακτικές εκπαίδευσης ευρύτερα — συμπεριλαμβανομένης της εργασίας ικανοτήτων. Το TechCrunch σημειώνει ότι οι ερευνητές της ανθρώπινης τεχνητής νοημοσύνης θα μπορούσαν τελικά να γίνουν λιγότερο κεντρικοί στη διαδικασία, μια δυνατότητα που η ίδια η εργασία εμπλέκεται αντί να την αποφεύγει.

Τι να παρακολουθήσετε στη συνέχεια

Τρεις ερωτήσεις θα καθορίσουν εάν αυτό το αποτέλεσμα γενικεύεται. Πρώτον, εάν η προσέγγιση είναι εκτός των δέκα σημείων αναφοράς που έχει δοκιμαστεί η Anthropic, σε τρόπους αποτυχίας που είναι πιο ακατάστατοι και λιγότερο καλά καθορισμένοι. Δεύτερον, εάν το πρόβλημα της συγκριτικής αξιολόγησης-συντήρησης μπορεί να λυθεί αρκετά γρήγορα ώστε να διατηρείται η αυτοματοποιημένη έρευνα ειλικρινής. Τρίτον, εάν άλλα εργαστήρια δημοσιεύουν συγκρίσιμα αποτελέσματα, τα οποία θα μετέτρεπαν ένα μεμονωμένο χαρτί σε μια κατεύθυνση του κλάδου.

Προς το παρόν, το εύρημα είναι στενό αλλά πραγματικό: στις συγκεκριμένες εργασίες ευθυγράμμισης που δοκιμάστηκαν στο Anthropic, οι αυτοματοποιημένοι ερευνητές ξεπέρασαν τους έμπειρους ανθρώπους, ταχύτερα και πολύ φθηνότερα. Η πλευρά της ασφάλειας του κλάδου της τεχνητής νοημοσύνης μπορεί να είναι το πρώτο μέρος όπου οι ερευνητές της τεχνητής νοημοσύνης —όχι οι άνθρωποι— κάνουν το μεγαλύτερο μέρος της δουλειάς.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →