Η Google Research ανακοίνωσε ένα σύστημα ομοσπονδιακής εκμάθησης επόμενης γενιάς βασισμένο σε περιβάλλοντα αξιόπιστης εκτέλεσης και η ομάδα διατυπώνει έναν ισχυρισμό που θα είχε απορριφθεί ως μη προσβάσιμος πριν από μερικά χρόνια: εξωτερικά επαληθεύσιμες εγγυήσεις απορρήτου κεντρικής διαφοράς για ομοσπονδιακή μάθηση, για πρώτη φορά. Το σύστημα, το οποίο εφαρμόζεται στο Gboard, αντικαθιστά μια μακροχρόνια συμφωνία "εμπιστευτείτε μας" με κρυπτογραφική βεβαίωση και δημόσια αρχεία καταγραφής που μπορούν πραγματικά να επιθεωρήσουν εξωτερικοί ελεγκτές. Για συνεχή κάλυψη της μηχανικής εκμάθησης που διαφυλάσσει το απόρρητο, ακολουθήστε τις πιο πρόσφατες εξελίξεις AI.

Το χάσμα εμπιστοσύνης στην ομοσπονδιακή μάθηση

Η ομοσπονδιακή μάθηση, την οποία εισήγαγε η Google το 2017, υποτίθεται ότι έλυνε ένα συγκεκριμένο πρόβλημα: πώς να εκπαιδεύσετε χρήσιμα μοντέλα σε δεδομένα χρηστών χωρίς να συλλέγετε αυτά τα δεδομένα κεντρικά. Αντί να μεταφορτώνουν ακατέργαστη συμπεριφορά πληκτρολόγησης σε έναν διακομιστή, οι συσκευές υπολογίζουν τις ενημερώσεις μοντέλων τοπικά και συνεισφέρουν μόνο αυτές τις ενημερώσεις. Η προσέγγιση τροφοδοτεί αθόρυβα ένα αξιοσημείωτο ποσό από αυτά που αγγίζουν οι χρήστες καθημερινά — πρόβλεψη επόμενης λέξης και Έξυπνη σύνταξη στο Gboard, προτάσεις απαντήσεων στο Google Messages και Έξυπνη επιλογή κειμένου στο Android.

Αλλά η αρχική αρχιτεκτονική είχε ένα κενό εμπιστοσύνης στο κέντρο της. Οι συσκευές ανέβασαν τα δεδομένα τους για άμεση συγκέντρωση και οι ξένοι δεν είχαν τρόπο να επαληθεύσουν ότι τα δεδομένα δεν είχαν καταγραφεί, διατηρηθεί ή επιθεωρηθεί ποτέ στην πορεία. Οι χρήστες έπρεπε να δεχτούν τη λέξη της Google για το τι συνέβη από την πλευρά του διακομιστή. Αργότερα, το Secure Aggregation προσέθεσε κρυπτογραφική προστασία, έτσι ώστε οι μεμονωμένες συνεισφορές να μην μπορούν να διαβαστούν μεμονωμένα — αλλά αυτή η τεχνική δεν ήταν συμβατή με υπερσύγχρονους αλγόριθμους κεντρικών διαφορικών απορρήτου, όπως η παραγοντοποίηση μήτρας DP-FTRL, και άφησε ακόμα μια υπόθεση ανέγγιχτη: έπρεπε να εμπιστευθεί την Google για να μην προσθέσει σωστά το απόρρητο. Μια εσφαλμένη ρύθμιση παραμέτρων θορύβου θα ήταν αόρατη σε όλους εκτός από την εταιρεία που έκανε το λάθος.

Πώς λειτουργεί το νέο σύστημα

Ο νέος σχεδιασμός επιτίθεται άμεσα στην υπόθεση εμπιστοσύνης. Μετακινεί τον υπολογισμό διαβάθμισης πελάτη στον διακομιστή — μέσα σε ένα αξιόπιστο περιβάλλον εκτέλεσης — και στη συνέχεια καθιστά επιβεβαιώσιμη τη λογική του διακομιστή, επομένως ο χειριστής δεν χρειάζεται πλέον να είναι καθόλου αξιόπιστος. Το ΤΕΕ είναι ένας θύλακας επεξεργαστή απομονωμένου υλικού του οποίου ο τρέχων κώδικας μπορεί να επαληθευτεί κρυπτογραφικά από ξένους. αν ο θύλακας κάνει κάτι διαφορετικό από αυτό που ισχυρίζεται, η βεβαίωση σπάει.

Σύμφωνα με την ανακοίνωση της Google, το σύστημα συντονίζει τέσσερα βασικά στοιχεία. Πρώτον, μεταφόρτωση δεδομένων: οι συσκευές κρυπτογραφούν τοπικά παραδείγματα εκπαίδευσης και προεγκρίνουν μια πολιτική πρόσβασης που παραθέτει ακριβώς ποιοι υπολογισμοί ΤΕΕ μπορούν να επεξεργάζονται τα δεδομένα — και αυτές οι πολιτικές πρέπει να εμφανίζονται σε ένα αρχείο καταγραφής δημόσιας διαφάνειας. Δεύτερον, ένα Σύστημα Διαχείρισης Κλειδιών που δημιουργήθηκε από TEE που εκτελούν το πρωτόκολλο συναίνεσης RAFT απελευθερώνει κλειδιά αποκρυπτογράφησης μόνο σε φόρτους εργασίας που ταιριάζουν με τη δημοσιευμένη πολιτική. Τρίτον, εκτέλεση φόρτου εργασίας: ένα ριζικό ΤΕΕ εκτελεί έναν βρόχο εκπαίδευσης Python και εκχωρεί δευτερεύουσες εργασίες σε ΤΕΕ εργαζομένων, με την ενορχήστρωση να γίνεται από ένα σύστημα που ονομάζεται Ομοσπονδιακή Γλώσσα, που προέρχεται από το Ομοσπονδιακό πλαίσιο TensorFlow της Google. Μόνο διαφορετικά βάρη ιδιωτικών μοντέλων απελευθερώνονται ποτέ από τον θύλακα. Τέταρτον, ανάκτηση ανεκτική σε σφάλματα: κάθε γύρος προπόνησης αποθηκεύει μια κατάσταση ανάκτησης κρυπτογραφημένη με KMS, έτσι ώστε οι αποτυχίες root ή worker να μην καταστρέφουν την εκπαίδευση σε εξέλιξη.

Γιατί μπορούν πραγματικά να ελεγχθούν οι εγγυήσεις

Ο ισχυρισμός επαληθευσιμότητας βασίζεται σε μια αλυσίδα δημόσιων αποδεικτικών στοιχείων και όχι σε εταιρική βεβαίωση. Οι πολιτικές πρόσβασης δημοσιεύονται στο Rekor, το αρχείο καταγραφής δημόσιας διαφάνειας του Sigstore, έτσι ώστε οι εξωτερικοί ελεγκτές να μπορούν να παρακολουθούν κάθε φόρτο εργασίας διακομιστή που θα μπορούσαν ενδεχομένως να τροφοδοτήσουν τα δεδομένα μιας συσκευής. Το KMS και τα δυαδικά αρχεία επεξεργασίας δεδομένων μπορούν να αναπαραχθούν από κώδικα ανοιχτού κώδικα, που σημαίνει ότι ο καθένας μπορεί να μεταγλωττίσει τη δημοσιευμένη πηγή και να επιβεβαιώσει ότι ταιριάζει με τα δυαδικά που εκτελούνται στην παραγωγή.

Οι ίδιες οι πολιτικές περιγράφουν άμεσα το εκπαιδευτικό πρόγραμμα Python, το οποίο κλείνει το πιο κοινό κενό στις αρχιτεκτονικές απορρήτου: ένα χάσμα μεταξύ αυτού που λέει μια πολιτική απορρήτου και αυτού που κάνει στην πραγματικότητα ο κώδικας. Για την προστασία των ιδιόκτητων αρχιτεκτονικών μοντέλων, τα TEE υποστηρίζουν σειριακή λογική παράπλευρης φόρτωσης κατά το χρόνο εκτέλεσης — αλλά με έναν αυστηρό περιορισμό ότι όλη η λογική που σχετίζεται με το απόρρητο πρέπει να παραμείνει κωδικοποιημένη στο πιστοποιημένο πρόγραμμα. Οι χειριστές φόρτου εργασίας, συμπεριλαμβανομένου του προσωπικού υποδομής της Google, βλέπουν μόνο μετρήσεις και διαφορετικά βάρη ιδιωτικών μοντέλων. Τα κρυπτογραφημένα δεδομένα μπορούν να αποκρυπτογραφηθούν μόνο για περιορισμένο χρονικό διάστημα μετά τη μεταφόρτωση, περιορίζοντας το παράθυρο στο οποίο θα μπορούσε να επιθεωρηθεί οτιδήποτε.

Από υποσχέσεις σε αποδείξεις

Η σημασία του σχεδίου είναι λιγότερο μεμονωμένο στοιχείο από τη μετατόπιση του φόρτου που παράγει. Οι εγγυήσεις απορρήτου στη μηχανική εκμάθηση έχουν ιστορικά πλαισιωθεί ως υποσχέσεις που υποστηρίζονται από έγγραφα πολιτικής, εσωτερικούς ελέγχους και τη φήμη του χειριστή. Αυτό το σύστημα μετατρέπει αυτές τις υποσχέσεις σε τεχνουργήματα — αναφορές βεβαιώσεων, καταχωρίσεις καταγραφής διαφάνειας, αναπαραγώγιμες κατασκευές — που ένας σκεπτικιστής μπορεί να επαληθεύσει χωρίς πρόσβαση στα εσωτερικά στοιχεία της Google.

Σηματοδοτεί επίσης μια αξιοσημείωτη σύγκλιση δύο ερευνητικών κοινοτήτων που ως επί το πλείστον έχουν εργαστεί παράλληλα. Τα αξιόπιστα περιβάλλοντα εκτέλεσης και το διαφορικό απόρρητο επιλύουν διαφορετικά προβλήματα: τα TEE περιορίζουν ποιος μπορεί να υπολογίζει σε δεδομένα, ενώ το DP περιορίζει ό,τι μπορεί να διαρρεύσει οποιοσδήποτε υπολογισμός. Ο συνδυασμός τους σε ένα μόνο επιβεβαιώσιμο πρόγραμμα, με την ίδια τη δημιουργία θορύβου DP εντός του επαληθευμένου θύλακα, αντιμετωπίζει την υπολειπόμενη αδυναμία κάθε προσέγγισης μεμονωμένα.

Προς το παρόν, το σύστημα εκτελείται στη στοίβα της ίδιας της Google, τροφοδοτώντας φόρτους εργασίας εκπαίδευσης όπως το Gboard. Το αν το επαληθεύσιμο απόρρητο θα γίνει ανταγωνιστική προσδοκία σε ολόκληρο τον κλάδο - όπως έκανε το HTTPS μετά την τυποποίηση της καταγραφής διαφάνειας για πιστοποιητικά - θα εξαρτηθεί από το αν οι χρήστες και οι ρυθμιστικές αρχές θα αρχίσουν να ρωτούν άλλους παρόχους τεχνητής νοημοσύνης την ερώτηση που έχει σχεδιαστεί για να απαντήσει αυτό το σύστημα: να το αποδείξει.

---

Μείνετε μπροστά από την τεχνητή νοημοσύνη

Λάβετε τα τελευταία νέα, αναλύσεις και ανακαλύψεις AI — όλα σε ένα μέρος.

Διαβάστε περισσότερα νέα AI →