Google Research oznámil novou generaci federovaného výukového systému postaveného na Trusted Execution Environments a tým uvádí tvrzení, které by bylo před několika lety zamítnuto jako nedosažitelné: poprvé externě ověřitelné centrální diferenciální záruky soukromí pro federované učení. Systém, který je aplikován na Gboard, nahrazuje dlouhotrvající ujednání „důvěřujte nám“ kryptografickým ověřením a veřejnými protokoly, které mohou externí auditoři skutečně kontrolovat. Pro průběžné pokrytí strojového učení chránícího soukromí sledujte náš [nejnovější vývoj AI] (https://aibuzzwire.news).

Mezera důvěry ve federovaném učení

Federované učení, které Google představil v roce 2017, mělo vyřešit konkrétní problém: jak trénovat užitečné modely na uživatelských datech bez centrálního sběru těchto dat. Namísto odesílání nezpracovaného chování při psaní na server zařízení počítají aktualizace modelu lokálně a přispívají pouze těmito aktualizacemi. Tento přístup tiše podporuje pozoruhodné množství toho, čeho se uživatelé každý den dotýkají – předvídání dalšího slova a chytré psaní v Gboard, návrhy odpovědí ve Zprávách Google a chytrý výběr textu v Androidu.

Ale původní architektura měla ve svém středu mezeru důvěry. Zařízení nahrávala svá data pro okamžitou agregaci a lidé zvenčí neměli žádný způsob, jak ověřit, že data nebyla nikdy zaznamenána, uchována nebo zkontrolována po cestě. Uživatelé museli vzít slovo Google, co se stalo na straně serveru. Později Secure Aggregation přidala kryptografickou ochranu, takže jednotlivé příspěvky nebylo možné číst izolovaně – tato technika však nebyla kompatibilní s nejmodernějšími algoritmy centrálního diferenciálního soukromí, jako je maticová faktorizace DP-FTRL, a stále ponechala jeden předpoklad nedotčený: Google musel být důvěryhodný, aby správně přidal diferenciální šum soukromí. Špatně nakonfigurovaný parametr hluku by byl neviditelný pro všechny kromě společnosti, která udělala chybu.

Jak nový systém funguje

Nový design útočí přímo na předpoklad důvěry. Přesouvá výpočet gradientu klienta na server – do důvěryhodného spouštěcího prostředí – a poté činí tuto serverovou logiku ověřenou, takže operátor již nemusí být vůbec důvěryhodný. TEE je hardwarově izolovaná procesorová enkláva, jejíž běžící kód může být kryptograficky ověřen cizími osobami; pokud enkláva udělá něco jiného, ​​než co tvrdí, atestace zaniká.

Podle oznámení Google koordinuje systém čtyři základní komponenty. Za prvé, nahrání dat: zařízení lokálně zašifrují příklady školení a předem autorizují zásady přístupu, které přesně uvádějí, které výpočty TEE mohou data zpracovávat – a tyto zásady se musí objevit ve veřejném protokolu transparentnosti. Za druhé, systém správy klíčů vytvořený z TEE běžících na konsensuálním protokolu RAFT uvolňuje dešifrovací klíče pouze pro pracovní zátěže, které odpovídají publikovaným zásadám. Za třetí, provádění pracovní zátěže: kořenový TEE spouští cvičnou smyčku Pythonu a deleguje dílčí úkoly na pracovní TEE, přičemž orchestraci zajišťuje systém nazvaný Federated Language, odvozený z rámce TensorFlow Federated společnosti Google. Z enklávy se vždy uvolňují pouze závaží soukromých modelů. Za čtvrté, obnova odolná proti chybám: každé kolo školení uloží stav obnovy zašifrovaný KMS, takže selhání uživatele root nebo worker nezničí probíhající školení.

Proč lze vlastně záruky zkontrolovat

Tvrzení o ověřitelnosti spočívá spíše na řetězci veřejných důkazů než na firemním atestaci. Zásady přístupu jsou publikovány v Rekor, veřejném protokolu transparentnosti Sigstore, takže externí auditoři mohou sledovat každou zátěž serveru, kterou by data zařízení mohla napájet. Binární soubory KMS a zpracování dat jsou reprodukovatelně sestavitelné z kódu s otevřeným zdrojovým kódem, což znamená, že kdokoli může zkompilovat publikovaný zdroj a potvrdit, že odpovídá binárním souborům spuštěným v produkci.

Samotné zásady přímo popisují školicí program Python, který uzavírá nejběžnější mezeru v architektuře ochrany soukromí: mezeru mezi tím, co říká politika ochrany osobních údajů, a tím, co kód skutečně dělá. Pro ochranu proprietárních modelových architektur TEE podporují sideloading serializovanou logiku za běhu – ale s pevným omezením, že veškerá logika související s ochranou soukromí musí zůstat pevně zakódována v ověřeném programu. Operátoři pracovní zátěže, včetně zaměstnanců vlastní infrastruktury společnosti Google, vidí pouze metriky a různé váhy soukromých modelů. Šifrovaná data lze po nahrání dešifrovat pouze po omezenou dobu, čímž je ohraničeno okno, ve kterém bylo možné prohlížet cokoli.

Od slibů k důkazům

Význam designu není ani tak v jakékoli jednotlivé součásti, jako v přesunu zátěže, kterou vytváří. Záruky ochrany soukromí ve strojovém učení byly historicky koncipovány jako sliby podložené dokumenty o zásadách, interními audity a pověstí operátora. Tento systém převádí tyto sliby na artefakty – atestační zprávy, záznamy v protokolu transparentnosti, reprodukovatelné sestavení – které si skeptik může ověřit bez přístupu k interním informacím společnosti Google.

Znamená to také pozoruhodné sblížení dvou výzkumných komunit, které většinou pracovaly paralelně. Důvěryhodná prováděcí prostředí a rozdílné soukromí řeší různé problémy: TEE omezují, kdo může s daty počítat, zatímco DP omezuje, co může jakýkoli výpočet uniknout. Jejich zkombinování v rámci jediného ověřitelného programu se samotným generováním DP šumu uvnitř ověřené enklávy řeší zbytkovou slabinu každého přístupu izolovaně.

Systém zatím běží ve vlastním zásobníku Google a pohání tréninkovou zátěž typu Gboard. Zda se ověřitelné soukromí stane konkurenčním očekáváním v celém odvětví – jako to udělal HTTPS poté, co bylo protokolování transparentnosti standardizováno pro certifikáty – bude záviset na tom, zda se uživatelé a regulační orgány začnou ptát jiných poskytovatelů umělé inteligence na otázku, na kterou má tento systém odpovědět: dokázat to.

---

Stay Ahead of AI

Získejte nejnovější zprávy, analýzy a průlomové informace o umělé inteligenci – vše na jednom místě.

Přečtěte si další zprávy o AI →