Google Research telah mengumumkan sistem pembelajaran gabungan generasi berikutnya yang dibangun di Lingkungan Eksekusi Tepercaya, dan tim tersebut membuat klaim yang beberapa tahun lalu mungkin dianggap tidak dapat dijangkau: jaminan privasi diferensial terpusat yang dapat diverifikasi secara eksternal untuk pembelajaran gabungan, untuk pertama kalinya. Sistem ini, yang diterapkan pada Gboard, menggantikan pengaturan “percayalah pada kami” yang sudah lama ada dengan pengesahan kriptografi dan log publik yang benar-benar dapat diperiksa oleh auditor luar. Untuk liputan berkelanjutan tentang pembelajaran mesin yang menjaga privasi, ikuti perkembangan AI terbaru.

Kesenjangan kepercayaan dalam pembelajaran gabungan

Pembelajaran gabungan, yang diperkenalkan Google pada tahun 2017, seharusnya memecahkan masalah tertentu: bagaimana melatih model yang berguna pada data pengguna tanpa mengumpulkan data tersebut secara terpusat. Daripada mengunggah perilaku pengetikan mentah ke server, perangkat menghitung pembaruan model secara lokal dan hanya menyumbangkan pembaruan tersebut. Pendekatan ini secara diam-diam memberdayakan banyak hal yang disentuh pengguna setiap hari — prediksi kata berikutnya dan Smart Compose di Gboard, saran balasan di Google Message, dan Pemilihan Teks Cerdas di Android.

Namun arsitektur aslinya memiliki kesenjangan kepercayaan sebagai pusatnya. Perangkat mengunggah datanya untuk segera dikumpulkan, dan pihak luar tidak dapat memverifikasi bahwa data tersebut tidak pernah dicatat, disimpan, atau diperiksa selama proses tersebut. Pengguna harus mempercayai kata-kata Google atas apa yang terjadi di sisi server. Kemudian, Agregasi Aman menambahkan perlindungan kriptografi sehingga kontribusi individu tidak dapat dibaca secara terpisah — namun teknik tersebut tidak kompatibel dengan algoritme privasi diferensial sentral yang canggih seperti faktorisasi matriks DP-FTRL, dan masih ada satu asumsi yang tidak tersentuh: Google harus dipercaya untuk menambahkan gangguan privasi diferensial dengan benar. Parameter kebisingan yang salah dikonfigurasi tidak akan terlihat oleh semua orang kecuali perusahaan yang melakukan kesalahan.

Cara kerja sistem baru

Desain baru ini menyerang asumsi kepercayaan secara langsung. Ini memindahkan komputasi gradien klien ke server — di dalam Lingkungan Eksekusi Tepercaya — dan kemudian membuat logika server tersebut dapat dibuktikan, sehingga operator tidak perlu lagi dipercaya sama sekali. TEE adalah kantong prosesor yang terisolasi dengan perangkat keras yang kode pengoperasiannya dapat diverifikasi secara kriptografis oleh pihak luar; jika enklave melakukan sesuatu selain yang diklaimnya, pengesahan akan dibatalkan.

Menurut pengumuman Google, sistem ini mengoordinasikan empat komponen inti. Pertama, pengunggahan data: perangkat mengenkripsi contoh pelatihan secara lokal dan melakukan pra-otorisasi terhadap kebijakan akses yang mencantumkan secara tepat komputasi TEE mana yang dapat memproses data — dan kebijakan tersebut harus muncul dalam log transparansi publik. Kedua, Sistem Manajemen Kunci yang dibangun dari TEE yang menjalankan protokol konsensus RAFT melepaskan kunci dekripsi hanya untuk beban kerja yang sesuai dengan kebijakan yang dipublikasikan. Ketiga, eksekusi beban kerja: TEE root menjalankan loop pelatihan Python dan mendelegasikan subtugas ke TEE pekerja, dengan orkestrasi ditangani oleh sistem yang disebut Bahasa Federasi, yang berasal dari kerangka Federasi TensorFlow Google. Hanya anak timbangan model privat yang berbeda yang pernah dikeluarkan dari enklave. Keempat, pemulihan toleransi kesalahan: setiap putaran pelatihan menyimpan status pemulihan terenkripsi KMS sehingga kegagalan root atau pekerja tidak merusak pelatihan yang sedang berlangsung.

Kenapa garansi sebenarnya bisa dicek

Klaim verifikasi didasarkan pada rantai bukti publik dan bukan pada pengesahan perusahaan. Kebijakan akses dipublikasikan ke Rekor, log transparansi publik Sigstore, sehingga auditor eksternal dapat melacak setiap beban kerja server yang mungkin dapat disalurkan oleh data perangkat. KMS dan biner pemrosesan data dapat dibangun secara reproduktif dari kode sumber terbuka, yang berarti siapa pun dapat mengkompilasi sumber yang diterbitkan dan mengonfirmasi bahwa sumber tersebut cocok dengan biner yang berjalan dalam produksi.

Kebijakan itu sendiri secara langsung menggambarkan program pelatihan Python, yang menutup celah paling umum dalam arsitektur privasi: kesenjangan antara apa yang dinyatakan dalam kebijakan privasi dan apa yang sebenarnya dilakukan oleh kode tersebut. Untuk melindungi arsitektur model kepemilikan, TEE mendukung sideloading logika serial saat runtime — namun dengan batasan keras bahwa semua logika yang relevan dengan privasi harus tetap dikodekan dalam program yang telah dibuktikan. Operator beban kerja, termasuk staf infrastruktur Google, hanya melihat metrik dan bobot model privat yang berbeda. Data terenkripsi hanya dapat didekripsi untuk waktu terbatas setelah diunggah, membatasi jendela di mana apa pun dapat diperiksa.

Dari janji menjadi bukti

Arti penting dari desain ini adalah lebih kecilnya komponen tunggal dibandingkan dengan pergeseran beban yang dihasilkannya. Jaminan privasi dalam pembelajaran mesin secara historis dibingkai sebagai janji yang didukung oleh dokumen kebijakan, audit internal, dan reputasi operator. Sistem ini mengubah janji-janji tersebut menjadi artefak — laporan pengesahan, entri log transparansi, build yang dapat direproduksi — yang dapat diverifikasi oleh orang yang skeptis tanpa akses ke internal Google.

Hal ini juga menandai konvergensi penting antara dua komunitas penelitian yang sebagian besar bekerja secara paralel. Lingkungan eksekusi tepercaya dan privasi diferensial memecahkan berbagai masalah: TEE membatasi siapa yang dapat menghitung data, sementara DP membatasi kebocoran komputasi apa pun. Menggabungkan keduanya dalam satu program yang dapat dibuktikan, dengan pembangkitan kebisingan DP itu sendiri di dalam wilayah yang terverifikasi, dapat mengatasi kelemahan yang tersisa dari setiap pendekatan secara terpisah.

Untuk saat ini sistem berjalan di tumpukan Google sendiri, mendukung beban kerja pelatihan seperti yang dilakukan Gboard. Apakah privasi yang dapat diverifikasi menjadi ekspektasi kompetitif di seluruh industri – seperti yang dilakukan HTTPS setelah pencatatan transparansi distandarisasi untuk sertifikat – akan bergantung pada apakah pengguna dan regulator mulai menanyakan pertanyaan yang dirancang untuk dijawab oleh sistem ini kepada penyedia AI lainnya: buktikan.

---

Tetap Terdepan dalam AI

Dapatkan berita, analisis, dan terobosan AI terkini — semuanya di satu tempat.

Baca berita AI selengkapnya →