Google Research は、信頼できる実行環境に基づいて構築された次世代のフェデレーテッド ラーニング システムを発表しました。このチームは、フェデレーテッド ラーニングに対する外部検証可能な中央差分プライバシー保証という、数年前なら到達不可能として却下されていたであろう主張を初めて主張しています。 Gboard に適用されているこのシステムは、長年の「私たちを信頼してください」という取り決めを、外部監査人が実際に検査できる暗号化証明と公開ログに置き換えます。プライバシー保護の機械学習に関する継続的な報道については、最新の AI 開発 をフォローしてください。
フェデレーテッド ラーニングにおける信頼ギャップ
Google が 2017 年に導入したフェデレーテッド ラーニングは、データを一元的に収集せずにユーザー データに基づいて有用なモデルをトレーニングする方法という特定の問題を解決することを目的としていました。デバイスは、生の入力動作をサーバーにアップロードする代わりに、ローカルでモデルの更新を計算し、それらの更新のみを提供します。このアプローチは、Gboard の次の単語予測とスマート作成、Google メッセージの返信候補、Android のスマート テキスト選択など、ユーザーが毎日触れる驚くべき量の機能を静かに強化します。
しかし、元のアーキテクチャの中心には信頼ギャップがありました。デバイスは即座に集約するためにデータをアップロードしましたが、部外者はその途中でデータが記録、保持、または検査されていないことを確認する方法がありませんでした。ユーザーはサーバー側で何が起こったのかについてGoogleの言葉を信じなければなりませんでした。その後、Secure Aggregation によって暗号保護が追加され、個々の投稿が単独で読み取られないようになりました。しかし、その技術は行列分解 DP-FTRL などの最先端の中央差分プライバシー アルゴリズムと互換性がなく、依然として 1 つの前提が手つかずのままでした。つまり、差分プライバシー ノイズを正しく追加するには Google を信頼する必要があるということです。ノイズ パラメータの設定が間違っていても、間違いを犯した企業以外には誰にもわかりません。
新しいシステムの仕組み
新しい設計は信頼の前提を直接攻撃します。クライアントの勾配計算を信頼できる実行環境内のサーバーに移動し、そのサーバー ロジックを証明可能にするため、オペレーターを信頼する必要がまったくなくなります。 TEE はハードウェアから分離されたプロセッサ エンクレーブであり、その実行コードは部外者が暗号的に検証できます。エンクレーブが主張以外のことを行うと、認証は破棄されます。
Googleの発表によると、このシステムは4つのコアコンポーネントを連携させるという。まず、データのアップロードです。デバイスはトレーニング サンプルをローカルで暗号化し、どの TEE 計算でデータを処理できるかを正確にリストするアクセス ポリシーを事前に承認します。これらのポリシーは公開透明性ログに表示される必要があります。 2 番目に、RAFT コンセンサス プロトコルを実行する TEE から構築されたキー管理システムは、公開されたポリシーに一致するワークロードにのみ復号キーをリリースします。 3 番目に、ワークロードの実行: ルート TEE は Python トレーニング ループを実行し、サブタスクをワーカー TEE に委任します。オーケストレーションは、Google の TensorFlow Federated フレームワークから派生した Federated Language と呼ばれるシステムによって処理されます。差分プライベート モデルの重みのみがエンクレーブから解放されます。 4 番目、フォールト トレラントなリカバリ: ルートまたはワーカーの障害によって進行中のトレーニングが破壊されないように、トレーニング ラウンドごとに KMS で暗号化されたリカバリ状態が保存されます。
保証が実際に確認できる理由
検証可能性の主張は、企業の証明ではなく、一連の公的証拠に基づいています。アクセス ポリシーは、Sigstore の公開透明性ログである Rekor に公開されるため、外部監査人はデバイスのデータがフィードする可能性のあるすべてのサーバー ワークロードを追跡できます。 KMS およびデータ処理バイナリは、オープンソース コードから再現可能にビルド可能です。つまり、誰でも公開されたソースをコンパイルし、本番環境で実行されているバイナリと一致することを確認できます。
ポリシー自体は Python トレーニング プログラムを直接記述しており、プライバシー アーキテクチャの最も一般的な抜け穴、つまりプライバシー ポリシーの内容とコードの実際の動作との間のギャップを塞ぎます。独自のモデル アーキテクチャを保護するために、TEE は実行時のシリアル化ロジックのサイドローディングをサポートしていますが、プライバシー関連のロジックはすべて、証明されたプログラム内でハードコーディングされたままにしなければならないという厳しい制約があります。 Google 自身のインフラストラクチャ スタッフを含むワークロード オペレータは、メトリクスと差分プライベート モデルの重みのみを参照します。暗号化されたデータは、アップロード後の限られた時間内のみ復号化でき、あらゆるものが検査できる期間が制限されます。
約束から証拠へ
設計の重要性は、単一のコンポーネントというよりも、それによって生じる負荷の変化にあります。機械学習におけるプライバシーの保証は、歴史的に、ポリシー文書、内部監査、およびオペレーターの評判に裏付けられた約束として組み立てられてきました。このシステムは、これらの約束を、懐疑論者が Google の内部にアクセスすることなく検証できる成果物 (構成証明レポート、透明性ログ エントリ、再現可能なビルド) に変換します。
また、これは、主に並行して活動してきた 2 つの研究コミュニティの注目すべき収束を示しています。信頼できる実行環境と差分プライバシーはさまざまな問題を解決します。TEE はデータを計算できる人を制限しますが、DP は計算によって漏洩する可能性のあるものを制限します。これらを単一の証明可能なプログラムの下で結合し、検証されたエンクレーブ内で DP ノイズ生成自体を行うことで、各アプローチの残存する弱点が個別に解決されます。
現時点では、このシステムは Google 独自のスタックで実行されており、Gboard が実行する種類のトレーニング ワークロードを強化しています。透明性ロギングが証明書で標準化された後に HTTPS が行ったように、検証可能なプライバシーが業界全体の競争上の期待になるかどうかは、ユーザーと規制当局が他の AI プロバイダーに対して、このシステムが答えるように設計された質問、つまりそれを証明するように設計されているかどうかによって決まります。
---
AI の先を行く最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。
AI ニュースをもっと読む→