Google Research a anunțat un sistem de învățare federat de ultimă generație, construit pe medii de execuție de încredere, iar echipa face o afirmație care ar fi fost respinsă ca inaccesabilă cu câțiva ani în urmă: garanții de confidențialitate diferențiale centralizate verificabile extern pentru învățarea federată, pentru prima dată. Sistemul, care este aplicat la Gboard, înlocuiește un acord de lungă durată „ai încredere în noi” cu atestare criptografică și jurnale publice pe care auditorii externi le pot inspecta efectiv. Pentru o acoperire continuă a învățării automate care păstrează confidențialitatea, urmăriți cele mai recente evoluții AI.
Decalajul de încredere în învățarea federată
Învățarea federată, pe care Google a introdus-o în 2017, trebuia să rezolve o problemă specifică: cum să antrenezi modele utile cu privire la datele utilizatorilor fără a colecta acele date la nivel central. În loc să încarce comportamentul de tastare brut pe un server, dispozitivele calculează actualizările modelului la nivel local și contribuie doar cu acele actualizări. Abordarea alimentează în liniște o cantitate remarcabilă de ceea ce utilizatorii ating în fiecare zi — predicția cuvântului următor și Smart Compose în Gboard, sugestii de răspuns în Google Messages și Smart Text Selection în Android.
Dar arhitectura originală avea un decalaj de încredere în centrul ei. Dispozitivele și-au încărcat datele pentru o agregare imediată, iar persoanele din afara nu au avut nicio modalitate de a verifica dacă datele nu au fost niciodată înregistrate, reținute sau inspectate pe parcurs. Utilizatorii au trebuit să creadă pe cuvânt Google pentru ceea ce s-a întâmplat pe partea serverului. Mai târziu, Secure Aggregation a adăugat protecție criptografică, astfel încât contribuțiile individuale să nu poată fi citite izolat - dar acea tehnică nu era compatibilă cu algoritmii de confidențialitate diferențial central de ultimă generație, cum ar fi factorizarea matriceală DP-FTRL, și a lăsat încă neatinsă o presupunere: Google trebuia să aibă încredere pentru a adăuga corect zgomotul diferenţial de confidențialitate. Un parametru de zgomot configurat greșit ar fi invizibil pentru toată lumea, cu excepția companiei care a făcut greșeala.
Cum funcționează noul sistem
Noul design atacă direct ipoteza încrederii. Mută calculul gradientului clientului pe server – într-un mediu de execuție de încredere – și apoi face ca logica serverului să fie atestată, astfel încât operatorul nu mai trebuie să fie deloc de încredere. Un TEE este o enclavă de procesor izolată de hardware al cărei cod de rulare poate fi verificat criptografic de către persoane din afară; dacă enclava face altceva decât ceea ce pretinde, atestarea se rupe.
Potrivit anunțului Google, sistemul coordonează patru componente de bază. În primul rând, încărcarea datelor: dispozitivele criptează exemplele de antrenament la nivel local și preautorizează o politică de acces care listează exact ce calcule TEE pot procesa datele - iar acele politici trebuie să apară într-un jurnal de transparență public. În al doilea rând, un sistem de management al cheilor construit din TEE-uri care rulează protocolul de consens RAFT eliberează cheile de decriptare numai pentru sarcinile de lucru care se potrivesc cu politica publicată. În al treilea rând, execuția sarcinii de lucru: un TEE rădăcină rulează o buclă de antrenament Python și delegă sarcini secundare TEE-urilor lucrătorilor, cu orchestrarea gestionată de un sistem numit Federated Language, derivat din cadrul Google TensorFlow Federated. Numai greutățile modelelor private diferențiate sunt eliberate vreodată din enclavă. În al patrulea rând, recuperarea tolerantă la erori: fiecare rundă de antrenament salvează o stare de recuperare criptată KMS, astfel încât eșecurile de la rădăcină sau ale lucrătorului să nu distrugă antrenamentul în curs.
De ce garanțiile pot fi de fapt verificate
Cererea de verificabilitate se bazează mai degrabă pe un lanț de dovezi publice decât pe o atestare corporativă. Politicile de acces sunt publicate în Rekor, jurnalul de transparență public al Sigstore, astfel încât auditorii externi pot urmări fiecare sarcină de lucru pe server pe care ar putea-o alimenta datele unui dispozitiv. KMS și binarele de procesare a datelor pot fi reproduse din cod open-source, ceea ce înseamnă că oricine poate compila sursa publicată și poate confirma că se potrivește cu binarele care rulează în producție.
Politicile în sine descriu în mod direct programul de instruire Python, care închide cea mai comună lacună în arhitecturile de confidențialitate: un decalaj între ceea ce spune o politică de confidențialitate și ceea ce face de fapt codul. Pentru a proteja arhitecturile de modele proprietare, TEE-urile acceptă încărcare laterală a logicii serializate în timpul execuției - dar cu o constrângere dură că toată logica relevantă pentru confidențialitate trebuie să rămână codificată în programul atestat. Operatorii de sarcină de lucru, inclusiv personalul de infrastructură al Google, văd doar valori și ponderi diferențiate ale modelelor private. Datele criptate pot fi decriptate doar pentru o perioadă limitată de timp după încărcare, delimitând fereastra în care orice ar putea fi inspectat.
De la promisiuni la dovezi
Semnificația designului este mai puțin o singură componentă decât schimbarea sarcinii pe care o produce. Garanțiile de confidențialitate în învățarea automată au fost în mod istoric încadrate ca promisiuni susținute de documente de politică, audituri interne și reputația operatorului. Acest sistem convertește acele promisiuni în artefacte - rapoarte de atestare, intrări în jurnalul de transparență, versiuni reproductibile - pe care un sceptic le poate verifica fără acces la elementele interne ale Google.
De asemenea, marchează o convergență notabilă a două comunități de cercetare care au lucrat în mare parte în paralel. Mediile de execuție de încredere și confidențialitatea diferențială rezolvă diferite probleme: TEE-urile limitează cine poate calcula pe date, în timp ce DP restricționează ceea ce poate scurge orice calcul. Combinarea acestora într-un singur program atestabil, cu generarea de zgomot DP în sine în interiorul enclavei verificate, abordează slăbiciunea reziduală a fiecărei abordări în mod izolat.
Deocamdată sistemul rulează în propriul stack Google, alimentând sarcini de lucru de antrenament de tipul Gboard. Dacă confidențialitatea verificabilă devine o așteptare competitivă în întreaga industrie - așa cum a făcut HTTPS după ce înregistrarea transparenței a fost standardizată pentru certificate - va depinde dacă utilizatorii și autoritățile de reglementare încep să pună altor furnizori de AI întrebarea la care este conceput acest sistem: dovediți-o.
---
Rămâneți înaintea AIObțineți cele mai recente știri, analize și descoperiri despre AI - toate într-un singur loc.
Citiți mai multe știri AI →