O Google Research anunciou um sistema de aprendizagem federado de próxima geração construído em ambientes de execução confiáveis, e a equipe está fazendo uma afirmação que teria sido descartada como inacessível há alguns anos: garantias de privacidade diferenciais centrais verificáveis ​​externamente para aprendizagem federada, pela primeira vez. O sistema, que está sendo aplicado ao Gboard, substitui um acordo de longa data “confie em nós” por atestado criptográfico e registros públicos que auditores externos podem realmente inspecionar. Para cobertura contínua sobre aprendizado de máquina que preserva a privacidade, siga nossos últimos desenvolvimentos de IA.

A lacuna de confiança na aprendizagem federada

A aprendizagem federada, introduzida pelo Google em 2017, deveria resolver um problema específico: como treinar modelos úteis em dados do usuário sem coletar esses dados centralmente. Em vez de enviar o comportamento de digitação bruto para um servidor, os dispositivos calculam as atualizações do modelo localmente e contribuem apenas com essas atualizações. A abordagem silenciosamente potencializa uma quantidade notável do que os usuários tocam todos os dias: previsão da próxima palavra e Escrita inteligente no Gboard, sugestões de resposta no Mensagens do Google e seleção inteligente de texto no Android.

Mas a arquitetura original tinha uma lacuna de confiança no seu centro. Os dispositivos carregavam seus dados para agregação imediata, e pessoas de fora não tinham como verificar se os dados nunca foram registrados, retidos ou inspecionados ao longo do caminho. Os usuários tiveram que acreditar na palavra do Google sobre o que aconteceu no servidor. Mais tarde, a Secure Aggregation adicionou proteção criptográfica para que as contribuições individuais não pudessem ser lidas isoladamente – mas essa técnica não era compatível com algoritmos de privacidade diferencial central de última geração, como a fatoração de matriz DP-FTRL, e ainda deixou uma suposição intocada: era preciso confiar no Google para adicionar o ruído de privacidade diferencial corretamente. Um parâmetro de ruído mal configurado seria invisível para todos, exceto para a empresa que cometeu o erro.

Como funciona o novo sistema

O novo design ataca diretamente a suposição de confiança. Ele move a computação gradiente do cliente para o servidor — dentro de um Ambiente de Execução Confiável — e então torna a lógica do servidor atestável, de forma que o operador não precise mais ser confiável. Um TEE é um enclave de processador isolado por hardware cujo código em execução pode ser verificado criptograficamente por terceiros; se o enclave fizer algo diferente do que afirma, o atestado será quebrado.

De acordo com o anúncio do Google, o sistema coordena quatro componentes principais. Primeiro, o upload de dados: os dispositivos criptografam exemplos de treinamento localmente e pré-autorizam uma política de acesso que lista exatamente quais cálculos TEE podem processar os dados – e essas políticas devem aparecer em um registro público de transparência. Em segundo lugar, um sistema de gerenciamento de chaves construído a partir de TEEs que executam o protocolo de consenso RAFT libera chaves de descriptografia apenas para cargas de trabalho que correspondam à política publicada. Terceiro, execução da carga de trabalho: um TEE raiz executa um loop de treinamento Python e delega subtarefas aos TEEs trabalhadores, com orquestração controlada por um sistema chamado Federated Language, derivado da estrutura TensorFlow Federated do Google. Somente pesos de modelos diferencialmente privados são liberados do enclave. Quarto, recuperação tolerante a falhas: cada rodada de treinamento salva um estado de recuperação criptografado por KMS para que falhas de root ou de trabalho não destruam o treinamento em andamento.

Por que as garantias podem realmente ser verificadas

A reivindicação de verificabilidade baseia-se numa cadeia de provas públicas e não em atestados corporativos. As políticas de acesso são publicadas no Rekor, o registro de transparência pública da Sigstore, para que auditores externos possam rastrear cada carga de trabalho do servidor que os dados de um dispositivo possam alimentar. O KMS e os binários de processamento de dados podem ser reproduzidos a partir do código-fonte aberto, o que significa que qualquer pessoa pode compilar o código-fonte publicado e confirmar que ele corresponde aos binários em execução na produção.

As próprias políticas descrevem diretamente o programa de treinamento Python, que preenche a lacuna mais comum nas arquiteturas de privacidade: uma lacuna entre o que uma política de privacidade diz e o que o código realmente faz. Para proteger arquiteturas de modelos proprietários, os TEEs suportam o sideload de lógica serializada em tempo de execução – mas com uma restrição rígida de que toda lógica relevante para a privacidade deve permanecer codificada no programa atestado. Os operadores de carga de trabalho, incluindo a própria equipe de infraestrutura do Google, veem apenas métricas e pesos diferenciados de modelos privados. Os dados criptografados podem ser descriptografados apenas por um tempo limitado após o upload, limitando a janela na qual qualquer coisa pode ser inspecionada.

Das promessas às evidências

A importância do projeto é menos qualquer componente individual do que a mudança na carga que ele produz. As garantias de privacidade no aprendizado de máquina têm sido historicamente enquadradas como promessas apoiadas por documentos políticos, auditorias internas e pela reputação da operadora. Este sistema converte essas promessas em artefatos – relatórios de atestados, entradas de registros de transparência, construções reproduzíveis – que um cético pode verificar sem acesso aos internos do Google.

Também marca uma convergência notável de duas comunidades de pesquisa que trabalharam principalmente em paralelo. Ambientes de execução confiáveis ​​e privacidade diferencial resolvem problemas diferentes: os TEEs restringem quem pode computar os dados, enquanto o DP restringe o que qualquer computação pode vazar. Combiná-los sob um único programa atestável, com a própria geração de ruído DP dentro do enclave verificado, aborda a fraqueza residual de cada abordagem isoladamente.

Por enquanto, o sistema está rodando na própria pilha do Google, potencializando cargas de trabalho de treinamento do tipo que o Gboard executa. Se a privacidade verificável se tornará uma expectativa competitiva em todo o setor – como aconteceu com o HTTPS depois que o registro de transparência foi padronizado para certificados – dependerá de os usuários e reguladores começarem a fazer a outros provedores de IA a pergunta que este sistema foi projetado para responder: prove.

---

Fique à frente da IA

Receba as últimas notícias, análises e avanços sobre IA — tudo em um só lugar.

Leia mais notícias sobre IA →