Badania Google ogłosiły wprowadzenie stowarzyszonego systemu nauczania nowej generacji opartego na zaufanych środowiskach wykonawczych, a zespół wysuwa twierdzenie, które kilka lat temu zostałoby odrzucone jako nieosiągalne: po raz pierwszy możliwe do zweryfikowania zewnętrznie centralne, różnicowe gwarancje prywatności dla stowarzyszonego uczenia się. System zastosowany w Gboard zastępuje wieloletnią umowę „zaufaj nam” poświadczeniami kryptograficznymi i dziennikami publicznymi, które mogą faktycznie sprawdzać zewnętrzni audytorzy. Aby na bieżąco omawiać systemy uczące się chroniące prywatność, śledź nasze najnowsze osiągnięcia w zakresie sztucznej inteligencji.

Luka w zaufaniu do zintegrowanego uczenia się

Federacyjne uczenie się, które Google wprowadziło w 2017 roku, miało rozwiązać konkretny problem: jak trenować przydatne modele na danych użytkownika bez centralnego gromadzenia tych danych. Zamiast przesyłać surowe zachowanie podczas pisania na serwer, urządzenia lokalnie obliczają aktualizacje modelu i udostępniają tylko te aktualizacje. To podejście po cichu obsługuje niezwykłą część tego, czego użytkownicy dotykają na co dzień – przewidywanie następnego słowa i inteligentne tworzenie wiadomości w Gboard, sugestie odpowiedzi w Wiadomościach Google i inteligentne zaznaczanie tekstu w systemie Android.

Jednak w oryginalnej architekturze istniała luka w zaufaniu. Urządzenia przesyłały dane w celu natychmiastowej agregacji, a osoby z zewnątrz nie miały możliwości sprawdzenia, czy dane nigdy nie zostały zarejestrowane, zachowane ani sprawdzone. Użytkownicy musieli wierzyć Google na słowo w sprawie tego, co wydarzyło się po stronie serwera. Później funkcja Secure Aggregation dodała ochronę kryptograficzną, aby poszczególne wpisy nie mogły być odczytywane w izolacji, ale technika ta nie była zgodna z najnowocześniejszymi centralnymi algorytmami prywatności różnicowej, takimi jak faktoryzacja macierzowa DP-FTRL, i nadal pozostawiała jedno założenie nietknięte: trzeba było ufać Google, jeśli chodzi o prawidłowe dodanie różnicowego szumu prywatności. Źle skonfigurowany parametr szumu byłby niewidoczny dla wszystkich z wyjątkiem firmy, która popełniła błąd.

Jak działa nowy system

Nowy projekt bezpośrednio atakuje założenie zaufania. Przenosi obliczenia gradientu klienta na serwer — w zaufanym środowisku wykonawczym — a następnie sprawia, że ​​logika serwera staje się wiarygodna, dzięki czemu nie trzeba już w ogóle ufać operatorowi. TEE to izolowana sprzętowo enklawa procesorów, której działający kod może zostać zweryfikowany kryptograficznie przez osoby z zewnątrz; jeśli enklawa robi coś innego niż twierdzi, poświadczenie zostaje zerwane.

Według zapowiedzi Google system koordynuje cztery podstawowe komponenty. Po pierwsze, przesyłanie danych: urządzenia lokalnie szyfrują przykłady szkoleniowe i wstępnie autoryzują politykę dostępu, która dokładnie określa, które obliczenia TEE mogą przetwarzać dane – a zasady te muszą pojawić się w publicznym dzienniku przejrzystości. Po drugie, system zarządzania kluczami zbudowany z TEE obsługujący protokół konsensusu RAFT udostępnia klucze deszyfrujące tylko dla obciążeń zgodnych z opublikowaną polityką. Po trzecie, wykonanie obciążenia: główny TEE uruchamia pętlę szkoleniową w języku Python i deleguje podzadania do roboczych TEE, a orkiestracją zarządza system o nazwie Federated Language, wywodzący się z platformy Google TensorFlow Federated. Z enklawy wypuszczane są tylko zróżnicowane wagi modeli prywatnych. Po czwarte, odzyskiwanie odporne na błędy: każda runda treningowa zapisuje stan odzyskiwania zaszyfrowany KMS, dzięki czemu awarie roota lub procesu roboczego nie niszczą trwającego szkolenia.

Dlaczego można sprawdzić gwarancje

Twierdzenie dotyczące weryfikowalności opiera się na łańcuchu dowodów publicznych, a nie na poświadczeniach korporacyjnych. Zasady dostępu są publikowane w Rekor, publicznym dzienniku przejrzystości Sigstore, dzięki czemu zewnętrzni audytorzy mogą śledzić każde obciążenie serwera, jakie mogą potencjalnie obsłużyć dane urządzenia. KMS i pliki binarne do przetwarzania danych można w powtarzalny sposób budować z kodu open source, co oznacza, że ​​każdy może skompilować opublikowane źródło i potwierdzić, że pasuje do plików binarnych działających w środowisku produkcyjnym.

Same zasady bezpośrednio opisują program szkoleniowy Pythona, który zamyka najczęstszą lukę w architekturach prywatności: lukę pomiędzy tym, co mówi polityka prywatności, a tym, co faktycznie robi kod. Aby chronić zastrzeżone architektury modeli, TEE obsługują boczne ładowanie serializowanej logiki w czasie wykonywania – ale z twardym ograniczeniem, że cała logika istotna dla prywatności musi pozostać zakodowana na stałe w atestowanym programie. Operatorzy zadań, w tym pracownicy infrastruktury Google, widzą tylko dane i zróżnicowane wagi modeli prywatnych. Zaszyfrowane dane można odszyfrować tylko przez ograniczony czas po przesłaniu, ograniczając okno, w którym można było sprawdzić cokolwiek.

Od obietnic po dowody

Znaczenie projektu nie polega na jakimkolwiek pojedynczym elemencie, ale na zmianie obciążenia, jakie ono powoduje. Gwarancje prywatności w uczeniu maszynowym były w przeszłości formułowane jako obietnice poparte dokumentami strategicznymi, audytami wewnętrznymi i reputacją operatora. System ten przekształca te obietnice w artefakty – raporty z atestów, wpisy w dzienniku przejrzystości, powtarzalne kompilacje – które sceptyk może zweryfikować bez dostępu do wewnętrznych elementów Google.

Oznacza to również zauważalną zbieżność dwóch środowisk badawczych, które w większości pracowały równolegle. Zaufane środowiska wykonawcze i zróżnicowana prywatność rozwiązują różne problemy: TEE ograniczają, kto może wykonywać obliczenia na danych, podczas gdy DP ogranicza to, co może wyciekać z obliczeń. Połączenie ich w ramach jednego, podlegającego atestowi programu, z samym generowaniem szumu DP w zweryfikowanej enklawie, eliminuje pozostałe słabości każdego podejścia z osobna.

Na razie system działa na własnym stosie Google, obsługując obciążenia szkoleniowe podobne do tych, które wykonuje Gboard. To, czy weryfikowalna prywatność stanie się konkurencyjnym oczekiwaniem w całej branży – tak jak zrobił to HTTPS po ujednoliceniu rejestrowania przezroczystości dla certyfikatów – będzie zależeć od tego, czy użytkownicy i organy regulacyjne zaczną zadawać innym dostawcom sztucznej inteligencji pytanie, na które ten system ma odpowiedzieć: udowodnić to.

---

Wyprzedź sztuczną inteligencję

Otrzymuj najnowsze wiadomości, analizy i przełomowe informacje dotyczące sztucznej inteligencji — wszystko w jednym miejscu.

Przeczytaj więcej aktualności o sztucznej inteligencji →