Компания Google Research анонсировала систему федеративного обучения следующего поколения, построенную на основе доверенных сред выполнения, и команда делает заявление, которое несколько лет назад было бы отклонено как недостижимое: впервые поддающиеся внешней проверке центральные дифференциальные гарантии конфиденциальности для федеративного обучения. Система, которая применяется к Gboard, заменяет давнее соглашение «доверьтесь нам» криптографической аттестацией и общедоступными журналами, которые фактически могут проверять сторонние аудиторы. Чтобы постоянно узнавать о машинном обучении, сохраняющем конфиденциальность, следите за нашими последними разработками в области искусственного интеллекта.
Разрыв доверия в федеративном обучении
Федеративное обучение, которое Google представил в 2017 году, должно было решить конкретную проблему: как обучать полезные модели на пользовательских данных без централизованного сбора этих данных. Вместо загрузки необработанных данных о поведении ввода на сервер устройства вычисляют обновления модели локально и вносят только эти обновления. Этот подход незаметно обеспечивает значительную часть того, к чему пользователи прикасаются каждый день: предсказание следующего слова и интеллектуальный ввод в Gboard, предложения ответов в сообщениях Google и интеллектуальный выбор текста в Android.
Но в центре оригинальной архитектуры был пробел в доверии. Устройства загружали свои данные для немедленного агрегирования, и посторонние не имели возможности убедиться, что данные никогда не регистрировались, не сохранялись и не проверялись в процессе. Пользователям пришлось поверить Google на слово относительно того, что произошло на стороне сервера. Позже Secure Aggregation добавила криптографическую защиту, чтобы отдельные вклады не могли быть прочитаны изолированно — но этот метод не был совместим с современными алгоритмами центральной дифференциальной конфиденциальности, такими как матричная факторизация DP-FTRL, и по-прежнему оставлял нетронутым одно предположение: Google нужно было доверять, чтобы правильно добавить дифференциальный шум конфиденциальности. Неправильно настроенный параметр шума будет невидим для всех, кроме компании, допустившей ошибку.
Как работает новая система
Новый дизайн напрямую атакует предположение о доверии. Он переносит вычисления градиента клиента на сервер — внутри доверенной среды выполнения — и затем делает эту серверную логику проверяемой, так что оператору больше не нужно вообще доверять. TEE — это аппаратно-изолированный процессорный анклав, рабочий код которого может быть криптографически проверен посторонними лицами; если анклав делает что-то иное, чем заявлено, аттестация прекращается.
Согласно заявлению Google, система координирует четыре основных компонента. Во-первых, загрузка данных: устройства локально шифруют обучающие примеры и предварительно авторизуют политику доступа, в которой точно указано, какие вычисления TEE могут обрабатывать данные — и эти политики должны появиться в общедоступном журнале прозрачности. Во-вторых, система управления ключами, построенная на основе TEE, использующих протокол консенсуса RAFT, выпускает ключи дешифрования только для рабочих нагрузок, соответствующих опубликованной политике. В-третьих, выполнение рабочей нагрузки: корневой TEE запускает цикл обучения Python и делегирует подзадачи рабочим TEE, а оркестрация осуществляется системой под названием Federated Language, созданной на основе федеративной платформы TensorFlow от Google. Из анклава всегда выпускаются только дифференциально частные модели. В-четвертых, отказоустойчивое восстановление: каждый раунд обучения сохраняет состояние восстановления, зашифрованное KMS, чтобы корневые или рабочие сбои не разрушали текущее обучение.
Почему гарантии действительно можно проверить
Заявление о проверяемости опирается на цепочку публичных доказательств, а не на корпоративную аттестацию. Политики доступа публикуются в Rekor, общедоступном журнале прозрачности Sigstore, поэтому внешние аудиторы могут отслеживать каждую рабочую нагрузку сервера, которую могут передавать данные устройства. Двоичные файлы KMS и обработки данных воспроизводимо создаются из открытого исходного кода. Это означает, что любой может скомпилировать опубликованный исходный код и подтвердить, что он соответствует двоичным файлам, работающим в рабочей среде.
Сами политики напрямую описывают программу обучения Python, которая закрывает наиболее распространенную лазейку в архитектурах конфиденциальности: разрыв между тем, что говорит политика конфиденциальности, и тем, что на самом деле делает код. Чтобы защитить архитектуру проприетарных моделей, TEE поддерживают загрузку неопубликованной сериализованной логики во время выполнения, но с жестким ограничением: вся логика, связанная с конфиденциальностью, должна оставаться жестко запрограммированной в аттестованной программе. Операторы рабочих нагрузок, включая сотрудников собственной инфраструктуры Google, видят только метрики и дифференциальные веса частных моделей. Зашифрованные данные можно расшифровать только в течение ограниченного времени после загрузки, что ограничивает окно, в котором можно что-либо проверить.
От обещаний к доказательствам
Значение дизайна заключается не в каком-либо отдельном компоненте, а в изменении нагрузки, которое он вызывает. Гарантии конфиденциальности в машинном обучении исторически оформлялись как обещания, подкрепленные политическими документами, внутренним аудитом и репутацией оператора. Эта система преобразует эти обещания в артефакты — отчеты об аттестации, записи журнала прозрачности, воспроизводимые сборки — которые скептик может проверить без доступа к внутренним устройствам Google.
Это также знаменует собой заметное сближение двух исследовательских сообществ, которые по большей части работали параллельно. Доверенные среды выполнения и дифференциальная конфиденциальность решают разные проблемы: TEE ограничивает круг лиц, которые могут выполнять вычисления на данных, а DP ограничивает утечку информации при любых вычислениях. Объединение их в рамках одной аттестуемой программы с генерацией шума DP внутри проверенного анклава устраняет остаточную слабость каждого подхода в отдельности.
На данный момент система работает в собственном стеке Google, обеспечивая выполнение обучающих нагрузок, подобных тем, которые выполняет Gboard. Станет ли поддающаяся проверке конфиденциальность конкурентоспособным ожиданием во всей отрасли (как это произошло с HTTPS после того, как ведение журналов прозрачности было стандартизировано для сертификатов) будет зависеть от того, начнут ли пользователи и регулирующие органы задавать другим поставщикам ИИ вопрос, на который призвана ответить эта система: доказать это.
---
Будьте впереди ИИПолучайте последние новости, анализ и открытия в области искусственного интеллекта — все в одном месте.
Подробнее новости AI →