Google Research đã công bố hệ thống học tập liên kết thế hệ tiếp theo được xây dựng trên Môi trường thực thi đáng tin cậy và nhóm đang đưa ra một tuyên bố mà lẽ ra đã bị bác bỏ vì không thể truy cập được vài năm trước: lần đầu tiên, các đảm bảo về quyền riêng tư khác biệt trung tâm có thể kiểm chứng được bên ngoài cho học tập liên kết. Hệ thống đang được áp dụng cho Gboard sẽ thay thế thỏa thuận "tin tưởng chúng tôi" lâu đời bằng chứng thực mật mã và nhật ký công khai mà các kiểm toán viên bên ngoài thực sự có thể kiểm tra. Để biết thông tin liên tục về công nghệ máy học bảo vệ quyền riêng tư, hãy theo dõi sự phát triển AI mới nhất của chúng tôi.
Khoảng cách tin cậy trong học tập liên kết
Học tập liên kết, được Google giới thiệu vào năm 2017, được cho là sẽ giải quyết một vấn đề cụ thể: cách đào tạo các mô hình hữu ích về dữ liệu người dùng mà không cần thu thập dữ liệu đó một cách tập trung. Thay vì tải hành vi nhập thô lên máy chủ, các thiết bị sẽ tính toán các cập nhật mô hình cục bộ và chỉ đóng góp những cập nhật đó. Cách tiếp cận này lặng lẽ cung cấp năng lượng đáng kể cho những gì người dùng chạm vào hàng ngày — dự đoán từ tiếp theo và Soạn thư thông minh trong Gboard, trả lời đề xuất trong Google Messages và Lựa chọn văn bản thông minh trong Android.
Nhưng kiến trúc ban đầu có một khoảng cách tin cậy ở trung tâm. Các thiết bị đã tải dữ liệu của họ lên để tổng hợp ngay lập tức và người ngoài không có cách nào để xác minh rằng dữ liệu chưa bao giờ được ghi lại, lưu giữ hoặc kiểm tra trong quá trình thực hiện. Người dùng phải tin lời Google về những gì đã xảy ra ở phía máy chủ. Sau đó, Secure Aggregation đã thêm tính năng bảo vệ bằng mật mã để không thể đọc riêng từng đóng góp — nhưng kỹ thuật đó không tương thích với các thuật toán bảo mật vi sai trung tâm hiện đại như hệ số hóa ma trận DP-FTRL và nó vẫn giữ nguyên một giả định: Google phải được tin cậy để thêm tiếng ồn về quyền riêng tư khác biệt một cách chính xác. Thông số tiếng ồn được định cấu hình sai sẽ không hiển thị đối với mọi người ngoại trừ công ty mắc lỗi.
Cách thức hoạt động của hệ thống mới
Thiết kế mới tấn công trực tiếp vào giả định về sự tin cậy. Nó di chuyển tính toán độ dốc của máy khách đến máy chủ — bên trong Môi trường thực thi đáng tin cậy — và sau đó làm cho logic máy chủ đó có thể chứng thực được, do đó người vận hành không còn cần phải được tin cậy nữa. TEE là một vùng bộ xử lý được cách ly bằng phần cứng mà mã chạy của nó có thể được người ngoài xác minh bằng mật mã; nếu khu vực này làm điều gì đó khác với những gì nó tuyên bố thì chứng thực sẽ bị phá vỡ.
Theo thông báo của Google, hệ thống phối hợp bốn thành phần cốt lõi. Đầu tiên, tải lên dữ liệu: thiết bị mã hóa các ví dụ đào tạo cục bộ và ủy quyền trước chính sách truy cập liệt kê chính xác những tính toán TEE nào có thể xử lý dữ liệu — và các chính sách đó phải xuất hiện trong nhật ký minh bạch công khai. Thứ hai, Hệ thống quản lý khóa được xây dựng từ các TEE chạy giao thức đồng thuận RAFT chỉ phát hành khóa giải mã cho khối lượng công việc phù hợp với chính sách đã xuất bản. Thứ ba, thực thi khối lượng công việc: TEE gốc chạy vòng đào tạo Python và ủy quyền các nhiệm vụ phụ cho TEE công nhân, với việc điều phối được xử lý bởi một hệ thống có tên là Ngôn ngữ liên kết, bắt nguồn từ khung Liên kết TensorFlow của Google. Chỉ những trọng lượng mô hình riêng tư khác nhau mới được đưa ra khỏi khu vực bao quanh. Thứ tư, khả năng phục hồi có khả năng chịu lỗi: mỗi vòng đào tạo sẽ lưu trạng thái khôi phục được mã hóa KMS để các lỗi gốc hoặc lỗi của nhân viên không làm hỏng quá trình đào tạo đang diễn ra.
Tại sao thực sự có thể kiểm tra được sự đảm bảo
Tuyên bố có thể kiểm chứng dựa trên một chuỗi bằng chứng công khai hơn là sự chứng thực của công ty. Chính sách truy cập được xuất bản lên Rekor, nhật ký minh bạch công khai của Sigstore, do đó, kiểm toán viên bên ngoài có thể theo dõi mọi khối lượng công việc của máy chủ mà dữ liệu của thiết bị có thể cung cấp. KMS và các tệp nhị phân xử lý dữ liệu có thể được xây dựng lại từ mã nguồn mở, nghĩa là bất kỳ ai cũng có thể biên dịch nguồn đã xuất bản và xác nhận nó khớp với các tệp nhị phân đang chạy trong sản xuất.
Bản thân các chính sách này mô tả trực tiếp chương trình đào tạo Python, giúp khắc phục lỗ hổng phổ biến nhất trong kiến trúc quyền riêng tư: khoảng cách giữa nội dung chính sách quyền riêng tư và nội dung thực sự của mã. Để bảo vệ kiến trúc mô hình độc quyền, TEE hỗ trợ tải logic nối tiếp trong thời gian chạy — nhưng có một ràng buộc cứng rắn là tất cả logic liên quan đến quyền riêng tư phải luôn được mã hóa cứng trong chương trình đã được chứng thực. Những người vận hành khối lượng công việc, bao gồm cả nhân viên cơ sở hạ tầng của chính Google, chỉ xem các số liệu và trọng số mô hình riêng tư khác nhau. Dữ liệu được mã hóa chỉ có thể được giải mã trong một khoảng thời gian giới hạn sau khi tải lên, giới hạn cửa sổ trong đó mọi thứ đều có thể được kiểm tra.
Từ lời hứa đến bằng chứng
Tầm quan trọng của thiết kế không phải ở bất kỳ thành phần đơn lẻ nào mà là sự thay đổi gánh nặng mà nó tạo ra. Các đảm bảo về quyền riêng tư trong học máy trước đây được coi là những lời hứa được hỗ trợ bởi các tài liệu chính sách, kiểm toán nội bộ và danh tiếng của nhà điều hành. Hệ thống này chuyển đổi những lời hứa đó thành các tạo phẩm — báo cáo chứng thực, mục nhập nhật ký minh bạch, bản dựng có thể tái tạo — mà những người hoài nghi có thể xác minh mà không cần truy cập vào nội bộ của Google.
Nó cũng đánh dấu sự hội tụ đáng chú ý của hai cộng đồng nghiên cứu hầu hết hoạt động song song. Môi trường thực thi đáng tin cậy và quyền riêng tư khác biệt giải quyết các vấn đề khác nhau: TEE hạn chế ai có thể tính toán trên dữ liệu, trong khi DP hạn chế nội dung mà bất kỳ tính toán nào có thể rò rỉ. Việc kết hợp chúng trong một chương trình có thể chứng thực duy nhất, với chính việc tạo ra tiếng ồn DP bên trong khu vực đã được xác minh, sẽ giải quyết điểm yếu còn sót lại của từng phương pháp một cách riêng biệt.
Hiện tại, hệ thống đang chạy trong hệ thống riêng của Google, hỗ trợ khối lượng công việc đào tạo giống như Gboard thực hiện. Liệu quyền riêng tư có thể kiểm chứng có trở thành kỳ vọng mang tính cạnh tranh trong toàn ngành hay không — cách HTTPS thực hiện sau khi tính năng ghi nhật ký minh bạch được chuẩn hóa cho các chứng chỉ — sẽ phụ thuộc vào việc liệu người dùng và cơ quan quản lý có bắt đầu hỏi các nhà cung cấp AI khác câu hỏi mà hệ thống này được thiết kế để trả lời hay không: chứng minh điều đó.
---
Đi trước AINhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.
Đọc thêm tin tức về AI →