Το Google DeepMind ανακοίνωσε στις 27 Αυγούστου αυτό που αποκαλεί την πρώτη διπλά τυφλή αξιολόγηση στον κόσμο ενός ιδιόκτητου μοντέλου τεχνητής νοημοσύνης, συνοριακής κλάσης — μια κρυπτογραφική εγκατάσταση που έχει σχεδιαστεί για να επιτρέπει σε εξωτερικούς ειδικούς να ελέγχουν τα μοντέλα της Google χωρίς καμία πλευρά να δει ποτέ τα μυστικά της άλλης.
Ο πιλότος, που περιγράφεται σε μια ανάρτηση ιστολογίου DeepMind από τους William Isaac, Sol Messing και Kristian Lum, τρέχει ένα μοντέλο Gemini Flash Lite μέσω εμπιστευτικών σημείων αναφοράς μέσα σε ένα κρυπτογραφικά ασφαλές περιβάλλον. Το Google DeepMind συνεργάζεται με το Singapore AI Safety Institute, OpenMined, AVERI και MLCommons για την προσπάθεια και δημοσίευσε μια τεχνική έκθεση που περιγράφει τη μεθοδολογία.
Η ανακοίνωση αντιμετωπίζει μια από τις πιο επίμονες αδυναμίες στην αξιολόγηση της τεχνητής νοημοσύνης: τη μόλυνση των σημείων αναφοράς. Για τους αναγνώστες που παρακολουθούν ερευνητικές ειδήσεις AI, αντιπροσωπεύει μια από τις πιο συγκεκριμένες προσπάθειες να γίνει επαληθεύσιμη καθαρή η δοκιμή μοντέλων τρίτων.
Το πρόβλημα μόλυνσης, εξηγείται
Το DeepMind ανοίγει την ανακοίνωσή του με μια αναλογία στην τάξη. Εάν ένας μαθητής δει κατά λάθος τις ερωτήσεις των εξετάσεων εκ των προτέρων, η τέλεια βαθμολογία δεν σημαίνει τίποτα. Η ίδια λογική ισχύει και για τα συνοριακά μοντέλα: εάν ένα μοντέλο έχει ήδη εκτεθεί στις ερωτήσεις σε ένα σημείο αναφοράς — μέσω δεδομένων εκπαίδευσης, διαρροών συνόλων αξιολόγησης ή προηγούμενης βελτιστοποίησης — οι βαθμολογίες που προκύπτουν μπορεί να υπερεκτιμήσουν σε μεγάλο βαθμό την πραγματική ικανότητα.
Αυτό δεν είναι μια υποθετική ανησυχία. Η επιμόλυνση των σημείων αναφοράς έχει επικρατήσει στο πεδίο για χρόνια, με τους ερευνητές να δείχνουν επανειλημμένα ότι δημοφιλή σύνολα δοκιμών διαρρέουν σε σώματα εκπαίδευσης κλίμακας ιστού και ότι τα μοντέλα μπορούν να ρυθμιστούν αθόρυβα για να έχουν καλή απόδοση σε γνωστές αξιολογήσεις. Όταν οι κυβερνήσεις και οι επιχειρήσεις χρησιμοποιούν βαθμολογίες αναφοράς για τη λήψη αποφάσεων προμηθειών και πολιτικής, οι διογκωμένοι αριθμοί έχουν πραγματικές συνέπειες.
Καθώς τα μοντέλα γίνονται πιο ικανά, υποστηρίζει η DeepMind, το διακύβευμα είναι υψηλότερο για τις ευαίσθητες κατηγορίες αξιολόγησης - δοκιμές κυβερνοασφάλειας και κυβερνητικές αξιολογήσεις μεταξύ αυτών - όπου μια μολυσμένη βαθμολογία δεν είναι απλώς παραπλανητική αλλά δυνητικά επικίνδυνη.
The Old Tradeoff: Οι προτροπές σας ή τα βάρη μας
Ιστορικά, οι εξωτερικές αξιολογήσεις υψηλού κινδύνου ανάγκασαν μια άβολη επιλογή. Είτε ο αξιολογητής παρέδωσε τις προτροπές δοκιμών του στον πάροχο του μοντέλου — διακινδυνεύοντας ο πάροχος να δει τις ερωτήσεις δοκιμής εκ των προτέρων — είτε ο πάροχος παρέδωσε τα βάρη του μοντέλου στον αξιολογητή — διακινδυνεύοντας την απώλεια της πολυτιμότερης πνευματικής ιδιοκτησίας του.
Τα πρωτόκολλα μηδενικής καταγραφής και οι αυστηρές συμβατικές διασφαλίσεις έχουν από καιρό κρατήσει εμπιστευτικές τις προτροπές εξωτερικών δοκιμών, γράφει η DeepMind, αλλά αυτές είναι υποσχέσεις που επιβάλλονται από την πολιτική και όχι από τα μαθηματικά. Οι διπλές τυφλές αξιολογήσεις αντικαθιστούν αυτή την εμπιστοσύνη με κρυπτογραφική απόδειξη.
Πώς λειτουργεί το κρυπτογραφικό πλαίσιο
Ο πιλότος χρησιμοποιεί το Confidential Space, μέρος του χαρτοφυλακίου Confidential Computing του Google Cloud, για να δημιουργήσει αυτό που η DeepMind περιγράφει ως κρυπτογραφικό «κουτί». Μέσα σε αυτό, και τα δύο μισά μιας αξιολόγησης - το εμπιστευτικό σημείο αναφοράς και το ιδιόκτητο μοντέλο - παραμένουν ιδιωτικά για τους αντίστοιχους ιδιοκτήτες τους και το περιβάλλον επαληθεύει κρυπτογραφικά αυτό το γεγονός.
Το αποτέλεσμα είναι πραγματικά διπλό τυφλό: ο εξωτερικός αξιολογητής δεν μπορεί να δει τα βάρη του μοντέλου Gemini και η Google δεν μπορεί να δει τις προτροπές δοκιμής του αξιολογητή. Καμία πλευρά δεν χρειάζεται να εμπιστευτεί τις υποσχέσεις της άλλης, γιατί η ίδια η αρχιτεκτονική καθιστά κατ' αρχήν αδύνατη τη διαρροή. Ουσιαστικά, η ρύθμιση αποτρέπει επίσης τη χρήση των δεδομένων αξιολόγησης αργότερα για τη βελτιστοποίηση της απόδοσης του μοντέλου πριν από μελλοντικές δοκιμές — κλείνοντας τον βρόχο μέσω του οποίου συνήθως επανέρχεται η μόλυνση.
Γιατί έχει σημασία για την επίβλεψη της τεχνητής νοημοσύνης
Η ευρύτερη σημασία ξεπερνά ένα μοντέλο Διδύμων. Ανεξάρτητοι οργανισμοί - ινστιτούτα ασφάλειας τεχνητής νοημοσύνης, ακαδημαϊκά εργαστήρια, ρυθμιστικές αρχές - αγωνίζονται για χρόνια να αξιολογήσουν αυστηρά τα μοντέλα κλειστών συνόρων, ακριβώς επειδή οι πάροχοι δεν μπορούν να παραδώσουν σταθμά και οι αξιολογητές δεν θα παραδώσουν σημεία αναφοράς. Κάθε σημαντικό ινστιτούτο ασφάλειας τεχνητής νοημοσύνης έχει αντιμετωπίσει εκδόσεις αυτού του προβλήματος όταν υπογράφει συμφωνίες αξιολόγησης με συνοριακά εργαστήρια.
Εάν ο πιλότος αντέχει, προσφέρει ένα πρότυπο βάσει του οποίου η κυριαρχία των δεδομένων και η πνευματική ιδιοκτησία επιβιώνουν σε επαφή με ανεξάρτητο έλεγχο. Η DeepMind λέει ότι ελπίζει ο πιλότος «να δημιουργήσει ένα νέο σύνορο για την επίβλεψη μοντέλων, βοηθώντας την ευρύτερη βιομηχανία να δημιουργήσει ασφαλέστερα, πιο αξιόπιστα και ευρέως αξιόπιστα συστήματα AI».
Η λίστα συνεργατών είναι από μόνη της αξιοσημείωτη. Το Ινστιτούτο Ασφάλειας AI της Σιγκαπούρης είναι ένας από τους πιο δραστήριους εθνικούς φορείς αξιολόγησης. Το OpenMined δημιουργεί υπολογιστικά εργαλεία που διατηρούν το απόρρητο. Το MLCommons τυποποιεί τη συγκριτική αξιολόγηση του κλάδου. Η AVERI ολοκληρώνει μια κοινοπραξία που περιλαμβάνει κυβερνητικούς, ακαδημαϊκούς και βιομηχανικούς φορείς προτύπων - τις εκλογικές περιφέρειες που θα έπρεπε να υιοθετήσουν διπλή τυφλή αξιολόγηση για να γίνει κανόνας και όχι επίδειξη.
Ένας αγώνας εξοπλισμών για την ακεραιότητα της αξιολόγησης
Η ανακοίνωση προσγειώνεται εν μέσω αυξανόμενου ελέγχου για τον τρόπο με τον οποίο οι εταιρείες τεχνητής νοημοσύνης βαθμολογούνται. Τα εργαστήρια αντιμετωπίζουν αυξανόμενες κατηγορίες ότι επιλέγουν ευνοϊκά σημεία αναφοράς και οι ανεξάρτητοι πίνακες κατάταξης έχουν αποκτήσει επιρροή ακριβώς επειδή βρίσκονται εκτός ελέγχου των προμηθευτών. Η διπλή τυφλή αξιολόγηση επεκτείνει αυτή την κίνηση ανεξαρτησίας εντός της υποδομής του ίδιου του προμηθευτή - μια αξιοσημείωτη αλλαγή για τις εταιρείες που ιστορικά επέμεναν να ελέγχουν κάθε λεπτομέρεια του τρόπου δοκιμής των μοντέλων τους.
Προς το παρόν, ο πιλότος καλύπτει ένα μοντέλο και ένα σύνολο εμπιστευτικών σημείων αναφοράς. Αλλά εάν επαληθευτεί κρυπτογραφικά, η αξιολόγηση χωρίς μόλυνση γίνει τεχνικά ρουτίνα, θα μπορούσε να αλλάξει αυτό που περιμένουν οι επιχειρήσεις και οι ρυθμιστικές αρχές από κάθε εργαστήριο συνόρων — και να καταστήσει την «εμπιστοσύνη μας» δυσκολότερη πώληση σε μια αγορά που βασίζεται ολοένα και περισσότερο σε επαληθεύσιμους ισχυρισμούς.
---
Μείνετε μπροστά από την τεχνητή νοημοσύνηΛάβετε τα τελευταία νέα, αναλύσεις και ανακαλύψεις AI — όλα σε ένα μέρος.
Διαβάστε περισσότερα νέα AI →