Google Research는 신뢰할 수 있는 실행 환경(Trusted Execution Environments)을 기반으로 구축된 차세대 연합 학습 시스템을 발표했으며, 팀은 몇 년 전에는 도달할 수 없는 것으로 일축되었을 주장을 제기하고 있습니다. 즉, 처음으로 연합 학습에 대해 외부에서 검증 가능한 중앙 차등 개인 정보 보호를 보장한다는 것입니다. Gboard에 적용되고 있는 이 시스템은 오랫동안 지속된 "신뢰" 계약을 외부 감사자가 실제로 검사할 수 있는 암호화 증명 및 공개 로그로 대체합니다. 개인 정보 보호 기계 학습에 대한 지속적인 보도를 보려면 최신 AI 개발을 따르세요.
연합 학습의 신뢰 격차
Google이 2017년에 도입한 연합 학습은 특정 문제, 즉 데이터를 중앙에서 수집하지 않고 사용자 데이터에 대한 유용한 모델을 훈련하는 방법을 해결하기로 되어 있었습니다. 원시 입력 동작을 서버에 업로드하는 대신 장치는 모델 업데이트를 로컬로 계산하고 해당 업데이트만 제공합니다. 이 접근 방식은 Gboard의 다음 단어 예측 및 스마트 작성, Google 메시지의 답장 제안, Android의 스마트 텍스트 선택 등 사용자가 매일 터치하는 놀라운 기능을 조용히 지원합니다.
그러나 원래 아키텍처의 중심에는 신뢰 격차가 있었습니다. 장치는 즉각적인 집계를 위해 데이터를 업로드했으며 외부인은 데이터가 도중에 기록, 보관 또는 검사되지 않았는지 확인할 방법이 없었습니다. 사용자는 서버 측에서 발생한 일에 대해 Google의 말을 받아들여야 했습니다. 나중에 Secure Aggregation은 개별 기여를 별도로 읽을 수 없도록 암호화 보호를 추가했습니다. 하지만 이 기술은 행렬 분해 DP-FTRL과 같은 최첨단 중앙 차등 개인 정보 보호 알고리즘과 호환되지 않았으며 여전히 한 가지 가정이 그대로 남아 있습니다. 즉, 차등 개인 정보 보호 노이즈를 올바르게 추가하려면 Google을 신뢰해야 한다는 것입니다. 잘못 구성된 소음 매개변수는 실수를 저지른 회사를 제외한 모든 사람에게 보이지 않습니다.
새로운 시스템의 작동 방식
새로운 디자인은 신뢰 가정을 직접적으로 공격합니다. 클라이언트 기울기 계산을 신뢰할 수 있는 실행 환경 내부의 서버로 옮긴 다음 해당 서버 논리를 증명할 수 있도록 하므로 운영자를 더 이상 신뢰할 필요가 없습니다. TEE는 외부인이 실행 코드를 암호화 방식으로 확인할 수 있는 하드웨어 격리 프로세서 엔클레이브입니다. 엔클레이브가 주장하는 것과 다른 작업을 수행하면 증명이 중단됩니다.
Google의 발표에 따르면 시스템은 네 가지 핵심 구성 요소를 조정합니다. 첫째, 데이터 업로드: 장치는 교육 예제를 로컬로 암호화하고 데이터를 처리할 수 있는 TEE 계산을 정확하게 나열하는 액세스 정책을 사전 승인합니다. 이러한 정책은 공개 투명성 로그에 표시되어야 합니다. 둘째, RAFT 합의 프로토콜을 실행하는 TEE로 구축된 키 관리 시스템은 게시된 정책과 일치하는 워크로드에만 암호 해독 키를 릴리스합니다. 세 번째, 워크로드 실행: 루트 TEE는 Python 훈련 루프를 실행하고 Google의 TensorFlow Federated 프레임워크에서 파생된 Federated Language라는 시스템에 의해 처리되는 조정을 통해 하위 작업을 작업자 TEE에 위임합니다. 차등 비공개 모델 가중치만 엔클레이브에서 해제됩니다. 넷째, 내결함성 복구: 각 교육 라운드는 루트 또는 작업자 오류로 인해 진행 중인 교육이 파괴되지 않도록 KMS로 암호화된 복구 상태를 저장합니다.
실제로 보증을 확인할 수 있는 이유
검증 가능성 주장은 기업 증명이 아닌 일련의 공개 증거에 기초합니다. 액세스 정책은 Sigstore의 공개 투명성 로그인 Rekor에 게시되므로 외부 감사자는 장치의 데이터가 제공할 수 있는 모든 서버 작업 부하를 추적할 수 있습니다. KMS 및 데이터 처리 바이너리는 오픈 소스 코드에서 재현 가능하게 구축 가능합니다. 즉, 누구나 게시된 소스를 컴파일하고 프로덕션에서 실행 중인 바이너리와 일치하는지 확인할 수 있습니다.
정책 자체는 개인 정보 보호 아키텍처에서 가장 일반적인 허점, 즉 개인 정보 보호 정책에서 말하는 것과 코드가 실제로 수행하는 것 사이의 격차를 줄이는 Python 교육 프로그램을 직접 설명합니다. 독점 모델 아키텍처를 보호하기 위해 TEE는 런타임에 직렬화된 논리를 사이드로딩하는 것을 지원하지만 모든 개인 정보 보호 관련 논리는 증명된 프로그램에 하드코딩된 상태로 유지되어야 한다는 엄격한 제약이 있습니다. Google의 자체 인프라 직원을 포함한 워크로드 운영자는 측정항목과 차등 비공개 모델 가중치만 볼 수 있습니다. 암호화된 데이터는 업로드 후 제한된 시간 동안만 해독될 수 있으며, 이는 모든 것을 검사할 수 있는 기간을 제한합니다.
약속에서 증거로
디자인의 중요성은 단일 구성요소보다 그것이 만들어내는 부담의 변화에 있습니다. 기계 학습의 개인정보 보호 보장은 역사적으로 정책 문서, 내부 감사, 운영자의 평판을 바탕으로 뒷받침되는 약속으로 구성되어 왔습니다. 이 시스템은 이러한 약속을 회의론자가 Google 내부에 액세스하지 않고도 확인할 수 있는 아티팩트(증명 보고서, 투명성 로그 항목, 재현 가능한 빌드)로 변환합니다.
이는 또한 대부분 병행하여 작업해온 두 연구 커뮤니티의 주목할만한 수렴을 나타냅니다. 신뢰할 수 있는 실행 환경과 차등 개인 정보 보호는 다양한 문제를 해결합니다. TEE는 데이터를 계산할 수 있는 사람을 제한하는 반면 DP는 계산이 유출될 수 있는 것을 제한합니다. 검증된 엔클레이브 내부의 DP 잡음 생성 자체와 함께 증명 가능한 단일 프로그램에서 이를 결합하면 각 접근 방식의 잔여 약점을 개별적으로 해결합니다.
현재 시스템은 Google의 자체 스택에서 실행되어 Gboard가 수행하는 것과 같은 교육 작업 부하를 지원합니다. 검증 가능한 개인 정보 보호가 업계 전반에 걸쳐 경쟁적 기대가 되는지 여부(인증서에 대한 투명성 로깅이 표준화된 후 HTTPS가 수행한 방식)는 사용자와 규제 기관이 이 시스템이 대답하도록 설계된 질문, 즉 증명을 다른 AI 제공업체에 묻기 시작하는지 여부에 달려 있습니다.
---
AI보다 앞서 나가세요최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.
AI 뉴스 자세히 보기 →