Google Research telah mengumumkan sistem pembelajaran bersekutu generasi akan datang yang dibina di atas Persekitaran Pelaksanaan Dipercayai dan pasukan itu membuat tuntutan yang akan ditolak sebagai tidak dapat dicapai beberapa tahun lalu: jaminan privasi pembezaan pusat yang boleh disahkan secara luaran untuk pembelajaran bersekutu, buat kali pertama. Sistem ini, yang digunakan pada Gboard, menggantikan susunan "percaya kepada kami" yang telah lama wujud dengan pengesahan kriptografi dan log awam yang sebenarnya boleh diperiksa oleh juruaudit luar. Untuk liputan berterusan pembelajaran mesin yang memelihara privasi, ikuti [perkembangan AI terkini] kami(https://aibuzzwire.news).

Jurang kepercayaan dalam pembelajaran bersekutu

Pembelajaran bersekutu, yang diperkenalkan oleh Google pada 2017, sepatutnya menyelesaikan masalah tertentu: cara melatih model berguna pada data pengguna tanpa mengumpul data itu secara berpusat. Daripada memuat naik tingkah laku menaip mentah ke pelayan, peranti mengira kemas kini model secara setempat dan hanya menyumbang kemas kini tersebut. Pendekatan ini secara senyap-senyap memberi kuasa kepada jumlah yang luar biasa daripada perkara yang disentuh pengguna setiap hari — ramalan perkataan seterusnya dan Karang Pintar dalam Gboard, cadangan balasan dalam Mesej Google dan Pemilihan Teks Pintar dalam Android.

Tetapi seni bina asal mempunyai jurang kepercayaan di tengahnya. Peranti memuat naik data mereka untuk pengagregatan segera, dan orang luar tidak mempunyai cara untuk mengesahkan bahawa data itu tidak pernah dilog, disimpan atau diperiksa sepanjang perjalanan. Pengguna terpaksa menerima kata-kata Google untuk apa yang berlaku di bahagian pelayan. Kemudian, Pengagregatan Selamat menambah perlindungan kriptografi supaya sumbangan individu tidak boleh dibaca secara berasingan — tetapi teknik itu tidak serasi dengan algoritma privasi pembezaan pusat yang canggih seperti pemfaktoran matriks DP-FTRL, dan ia masih meninggalkan satu andaian yang tidak disentuh: Google perlu dipercayai untuk menambah bunyi privasi pembezaan dengan betul. Parameter hingar yang salah konfigurasi tidak dapat dilihat oleh semua orang kecuali syarikat yang melakukan kesilapan.

Cara sistem baharu berfungsi

Reka bentuk baharu menyerang andaian amanah secara langsung. Ia memindahkan pengiraan kecerunan pelanggan ke pelayan — di dalam Persekitaran Pelaksanaan Dipercayai — dan kemudian menjadikan logik pelayan itu boleh dibuktikan, jadi pengendali tidak lagi perlu dipercayai sama sekali. TEE ialah enklaf pemproses terpencil perkakasan yang kod lariannya boleh disahkan secara kriptografi oleh orang luar; jika enklaf melakukan sesuatu selain daripada apa yang didakwanya, pengesahan itu akan rosak.

Menurut pengumuman Google, sistem menyelaraskan empat komponen teras. Pertama, muat naik data: peranti menyulitkan contoh latihan secara setempat dan pra-kebenaran dasar akses yang menyenaraikan dengan tepat pengiraan TEE yang boleh memproses data — dan dasar tersebut mesti dipaparkan dalam log ketelusan awam. Kedua, Sistem Pengurusan Utama yang dibina daripada TEE yang menjalankan protokol konsensus RAFT mengeluarkan kunci penyahsulitan hanya kepada beban kerja yang sepadan dengan dasar yang diterbitkan. Ketiga, pelaksanaan beban kerja: TEE akar menjalankan gelung latihan Python dan mewakilkan subtugas kepada TEE pekerja, dengan orkestrasi dikendalikan oleh sistem yang dipanggil Federated Language, yang diperoleh daripada rangka kerja TensorFlow Federated Google. Hanya pemberat model persendirian berbeza yang pernah dilepaskan dari enklaf. Keempat, pemulihan toleran kesalahan: setiap pusingan latihan menyimpan keadaan pemulihan yang disulitkan KMS supaya kegagalan akar atau pekerja tidak memusnahkan latihan yang sedang berjalan.

Mengapa jaminan sebenarnya boleh disemak

Tuntutan kebolehpercayaan terletak pada rangkaian bukti awam dan bukannya pengesahan korporat. Dasar akses diterbitkan ke Rekor, log ketelusan awam Sigstore, jadi juruaudit luar boleh menjejaki setiap beban kerja pelayan yang mungkin disuapkan oleh data peranti. KMS dan perduaan pemprosesan data boleh dihasilkan semula daripada kod sumber terbuka, bermakna sesiapa sahaja boleh menyusun sumber yang diterbitkan dan mengesahkan ia sepadan dengan perduaan yang dijalankan dalam pengeluaran.

Dasar itu sendiri secara langsung menerangkan program latihan Python, yang menutup kelemahan paling biasa dalam seni bina privasi: jurang antara perkara yang dinyatakan oleh dasar privasi dan perkara yang sebenarnya dilakukan oleh kod tersebut. Untuk melindungi seni bina model proprietari, TEE menyokong logik bersiri pemuatan sisi semasa masa jalan — tetapi dengan kekangan keras bahawa semua logik berkaitan privasi mesti kekal dikod keras dalam program yang disahkan. Pengendali beban kerja, termasuk kakitangan infrastruktur Google sendiri, hanya melihat metrik dan berat model persendirian yang berbeza. Data yang disulitkan boleh dinyahsulit hanya untuk masa yang terhad selepas muat naik, mengehadkan tetingkap di mana apa-apa sahaja boleh diperiksa.

Daripada janji kepada bukti

Kepentingan reka bentuk adalah kurang komponen tunggal daripada anjakan beban yang dihasilkannya. Jaminan privasi dalam pembelajaran mesin secara sejarah telah dirangka sebagai janji yang disokong oleh dokumen dasar, audit dalaman dan reputasi pengendali. Sistem ini menukar janji tersebut kepada artifak — laporan pengesahan, entri log ketelusan, binaan boleh dihasilkan semula — yang boleh disahkan oleh orang yang ragu-ragu tanpa akses kepada dalaman Google.

Ia juga menandakan penumpuan ketara dua komuniti penyelidikan yang kebanyakannya bekerja secara selari. Persekitaran pelaksanaan yang dipercayai dan privasi pembezaan menyelesaikan masalah yang berbeza: TEE mengehadkan siapa yang boleh mengira data, manakala DP mengehadkan apa yang mana-mana pengiraan boleh bocor. Menggabungkannya di bawah satu program yang boleh dibuktikan, dengan penjanaan hingar DP itu sendiri di dalam enklaf yang disahkan, menangani kelemahan baki setiap pendekatan secara berasingan.

Buat masa ini sistem berjalan dalam timbunan Google sendiri, menjanakan beban kerja latihan seperti yang dilakukan oleh Gboard. Sama ada privasi yang boleh disahkan menjadi jangkaan yang kompetitif di seluruh industri — cara HTTPS lakukan selepas pengelogan ketelusan diseragamkan untuk sijil — akan bergantung pada sama ada pengguna dan pengawal selia mula bertanya kepada pembekal AI lain soalan yang direka bentuk untuk dijawab oleh sistem ini: buktikan.

---

Kekal Mendahului AI

Dapatkan berita, analisis dan penemuan terkini AI — semuanya di satu tempat.

Baca lebih banyak berita AI →