Google Research анонсувала систему федеративного навчання наступного покоління, побудовану на Trusted Execution Environments, і команда висуває заяву, яку кілька років тому можна було б відкинути як недосяжну: вперше зовнішні гарантії центральної диференціальної конфіденційності для федеративного навчання. Система, яка застосовується до Gboard, замінює давню домовленість «довіряйте нам» криптографічною атестацією та публічними журналами, які зовнішні аудитори можуть перевіряти. Для постійного висвітлення машинного навчання, яке зберігає конфіденційність, слідкуйте за нашими останніми розробками ШІ.

Розрив довіри до федеративного навчання

Інтегроване навчання, яке Google представила в 2017 році, мало вирішити конкретну проблему: як навчити корисні моделі на даних користувачів, не збираючи ці дані централізовано. Замість того, щоб завантажувати необроблену поведінку введення на сервер, пристрої обчислюють оновлення моделі локально та вносять лише ці оновлення. Цей підхід тихо забезпечує надзвичайну кількість того, до чого користувачі торкаються щодня — передбачення наступного слова та інтелектуальне введення тексту в Gboard, пропозиції відповідей у ​​Google Повідомленнях і розумний вибір тексту в Android.

Але в центрі оригінальної архітектури була прогалина довіри. Пристрої завантажували свої дані для негайного агрегування, і сторонні особи не мали можливості перевірити, чи дані ніколи не реєструвалися, не зберігалися та не перевірялися по дорозі. Користувачам довелося повірити Google на слово щодо того, що сталося на сервері. Пізніше Secure Aggregation додав криптографічний захист, щоб окремі внески не можна було прочитати ізольовано — але ця техніка була несумісна з найсучаснішими центральними диференціальними алгоритмами конфіденційності, такими як матрична факторізація DP-FTRL, і вона залишила одне припущення недоторканим: Google потрібно було довіряти правильному додаванню диференціального шуму конфіденційності. Неправильно налаштований параметр шуму буде невидимим для всіх, крім компанії, яка припустилася помилки.

Як працює нова система

Новий дизайн безпосередньо атакує припущення довіри. Він переміщує градієнтні обчислення клієнта на сервер — у надійне середовище виконання — а потім робить логіку сервера доступною для перевірки, тому оператору більше не потрібно довіряти. TEE — це апаратно ізольований анклав процесора, код якого може бути криптографічно перевірений сторонніми особами; якщо анклав робить щось інше, ніж те, що він заявляє, атестація ламається.

Згідно з повідомленням Google, система координує чотири основні компоненти. По-перше, завантаження даних: пристрої шифрують навчальні приклади локально та попередньо авторизують політику доступу, яка точно перераховує, які обчислення TEE можуть обробляти дані — і ці політики мають відображатися в публічному журналі прозорості. По-друге, система керування ключами, створена з TEE, що використовує консенсусний протокол RAFT, випускає ключі дешифрування лише для робочих навантажень, які відповідають опублікованій політиці. По-третє, виконання робочого навантаження: кореневий TEE запускає навчальний цикл Python і делегує підзавдання робочим TEE, а оркестровка обробляється системою під назвою Federated Language, похідною від інфраструктури Google TensorFlow Federated. З анклаву вивільняються лише диференціально приватні моделі ваги. По-четверте, відмовостійке відновлення: кожен раунд навчання зберігає зашифрований KMS стан відновлення, щоб коренева або робоча помилка не руйнувала поточне навчання.

Чому гарантії насправді можна перевірити

Твердження про можливість перевірки базується на ланцюжку публічних доказів, а не на корпоративних засвідченнях. Політики доступу публікуються в Rekor, загальнодоступному журналі прозорості Sigstore, тому зовнішні аудитори можуть відстежувати кожне робоче навантаження на сервер, яке можуть передати дані пристрою. KMS і двійкові файли для обробки даних можна відтворити з відкритого вихідного коду, тобто будь-хто може скомпілювати опублікований вихідний код і підтвердити його відповідність двійковим файлам, що працюють у робочому стані.

Самі політики безпосередньо описують програму навчання Python, яка закриває найпоширенішу лазівку в архітектурах конфіденційності: розрив між тим, що сказано в політиці конфіденційності, і тим, що насправді робить код. Щоб захистити власні архітектури моделей, TEE підтримують серіалізовану логіку стороннього завантаження під час виконання, але з жорстким обмеженням, що вся логіка, пов’язана з конфіденційністю, повинна залишатися жорстко закодованою в атестованій програмі. Оператори робочого навантаження, включно з персоналом власної інфраструктури Google, бачать лише показники та часткові ваги моделі. Зашифровані дані можна розшифрувати лише протягом обмеженого часу після завантаження, обмежуючи вікно, у якому будь-що можна перевірити.

Від обіцянок до доказів

Важливість дизайну менша за будь-який окремий компонент, ніж за зміну тягаря, який він створює. Гарантії конфіденційності в машинному навчанні історично були оформлені як обіцянки, підкріплені політичними документами, внутрішніми аудитами та репутацією оператора. Ця система перетворює ці обіцянки на артефакти — звіти про атестацію, записи в журналі прозорості, відтворювані збірки — які скептик може перевірити без доступу до внутрішніх засобів Google.

Це також знаменує помітне зближення двох дослідницьких спільнот, які здебільшого працювали паралельно. Довірене середовище виконання та диференціальна конфіденційність вирішують різні проблеми: TEE обмежують, хто може обчислювати дані, тоді як DP обмежує, які обчислення можуть витікати. Об’єднання їх у рамках однієї атестованої програми з власне генеруванням шуму DP всередині перевіреного анклаву усуває залишкову слабкість кожного підходу окремо.

Наразі система працює у власному стеку Google, забезпечуючи навчальні робочі навантаження типу Gboard. Чи стане перевірена конфіденційність конкурентним очікуванням у всій галузі — як це сталося з HTTPS після стандартизації протоколювання прозорості для сертифікатів — залежатиме від того, чи почнуть користувачі та регулятори ставити іншим постачальникам штучного інтелекту питання, на яке покликана відповісти ця система: доведіть це.

---

Будьте попереду ШІ

Отримуйте останні новини штучного інтелекту, аналіз і прориви — усе в одному місці.

Читати більше новин AI →