Google Research ได้ประกาศระบบการเรียนรู้แบบสหพันธรัฐยุคถัดไปที่สร้างขึ้นบนสภาพแวดล้อมการดำเนินการที่เชื่อถือได้ และทีมงานกำลังอ้างสิทธิ์ที่อาจจะถูกเพิกเฉยว่าไม่สามารถเข้าถึงได้เมื่อไม่กี่ปีก่อน: การรับประกันความเป็นส่วนตัวส่วนต่างส่วนกลางที่ตรวจสอบได้จากภายนอกสำหรับการเรียนรู้แบบสมาพันธ์ เป็นครั้งแรก ระบบซึ่งใช้กับ Gboard จะเข้ามาแทนที่ข้อตกลง "เชื่อใจเรา" ที่มีมายาวนานด้วยการรับรองการเข้ารหัสและบันทึกสาธารณะที่ผู้ตรวจสอบภายนอกสามารถตรวจสอบได้จริง หากต้องการความคุ้มครองอย่างต่อเนื่องของแมชชีนเลิร์นนิงที่รักษาความเป็นส่วนตัว โปรดติดตาม การพัฒนา AI ล่าสุด
ช่องว่างความไว้วางใจในการเรียนรู้แบบสหพันธรัฐ
การเรียนรู้แบบสหพันธรัฐซึ่ง Google เปิดตัวในปี 2560 ควรจะแก้ปัญหาเฉพาะ: วิธีฝึกโมเดลที่เป็นประโยชน์เกี่ยวกับข้อมูลผู้ใช้โดยไม่ต้องรวบรวมข้อมูลนั้นจากส่วนกลาง แทนที่จะอัปโหลดพฤติกรรมการพิมพ์ดิบไปยังเซิร์ฟเวอร์ อุปกรณ์จะคำนวณการอัปเดตโมเดลในเครื่องและสนับสนุนเฉพาะการอัปเดตเหล่านั้นเท่านั้น วิธีการนี้ช่วยขับเคลื่อนสิ่งที่ผู้ใช้สัมผัสในแต่ละวันได้อย่างน่าทึ่ง ไม่ว่าจะเป็นการคาดเดาคำถัดไปและการเขียนอัจฉริยะใน Gboard คำแนะนำในการตอบกลับใน Google Messages และการเลือกข้อความอัจฉริยะใน Android
แต่สถาปัตยกรรมดั้งเดิมมีช่องว่างความไว้วางใจที่ศูนย์กลาง อุปกรณ์อัปโหลดข้อมูลเพื่อการรวมกลุ่มทันที และบุคคลภายนอกไม่มีวิธีตรวจสอบได้ว่าข้อมูลนั้นไม่เคยถูกบันทึก เก็บรักษา หรือตรวจสอบระหว่างทาง ผู้ใช้ต้องเชื่อคำพูดของ Google เกี่ยวกับสิ่งที่เกิดขึ้นฝั่งเซิร์ฟเวอร์ ต่อมา Secure Aggregation ได้เพิ่มการป้องกันการเข้ารหัส เพื่อไม่ให้อ่านการมีส่วนร่วมแต่ละรายการแบบแยกกันได้ แต่เทคนิคดังกล่าวเข้ากันไม่ได้กับอัลกอริธึมความเป็นส่วนตัวส่วนต่างส่วนกลางที่ล้ำสมัย เช่น การแยกตัวประกอบเมทริกซ์ DP-FTRL และยังคงทิ้งข้อสันนิษฐานไว้ข้อหนึ่ง: Google ต้องได้รับความไว้วางใจในการเพิ่มสัญญาณรบกวนความเป็นส่วนตัวที่แตกต่างกันอย่างถูกต้อง ทุกคนจะมองไม่เห็นพารามิเตอร์เสียงรบกวนที่กำหนดค่าไม่ถูกต้อง ยกเว้นบริษัทที่ทำผิดพลาด
ระบบใหม่ทำงานอย่างไร
การออกแบบใหม่โจมตีสมมติฐานความน่าเชื่อถือโดยตรง โดยจะย้ายการคำนวณการไล่ระดับไคลเอ็นต์ไปยังเซิร์ฟเวอร์ — ภายในสภาพแวดล้อมการดำเนินการที่เชื่อถือได้ — จากนั้นทำให้ตรรกะของเซิร์ฟเวอร์นั้นสามารถพิสูจน์ได้ ดังนั้นผู้ปฏิบัติงานจึงไม่จำเป็นต้องเชื่อถืออีกต่อไป TEE คือกลุ่มโปรเซสเซอร์ที่แยกด้วยฮาร์ดแวร์ ซึ่งโค้ดที่ทำงานอยู่สามารถตรวจสอบโดยบุคคลภายนอกโดยใช้การเข้ารหัสลับได้ หากวงล้อมทำอย่างอื่นนอกเหนือจากที่อ้าง การรับรองจะขาดไป
ตามประกาศของ Google ระบบจะประสานองค์ประกอบหลักสี่ประการ ขั้นแรก การอัปโหลดข้อมูล: อุปกรณ์เข้ารหัสตัวอย่างการฝึกอบรมในเครื่องและอนุญาตล่วงหน้าสำหรับนโยบายการเข้าถึงที่แสดงรายการที่แน่ชัดว่าการคำนวณ TEE ใดที่อาจประมวลผลข้อมูล และนโยบายเหล่านั้นจะต้องปรากฏในบันทึกความโปร่งใสสาธารณะ ประการที่สอง ระบบการจัดการคีย์ที่สร้างขึ้นจาก TEE ที่รันโปรโตคอลฉันทามติ RAFT จะปล่อยคีย์ถอดรหัสเฉพาะกับปริมาณงานที่ตรงกับนโยบายที่เผยแพร่เท่านั้น ประการที่สาม การดำเนินการกับปริมาณงาน: TEE รูทจะรันลูปการฝึกอบรม Python และมอบหมายงานย่อยให้กับ TEE ของผู้ปฏิบัติงาน โดยมีการจัดการประสานที่จัดการโดยระบบที่เรียกว่า Federated Language ซึ่งได้มาจากเฟรมเวิร์ก TensorFlow Federated ของ Google เฉพาะตุ้มน้ำหนักโมเดลส่วนตัวที่แตกต่างกันเท่านั้นที่จะถูกปล่อยออกมาจากวงล้อม ประการที่สี่ การกู้คืนที่ทนต่อข้อผิดพลาด: แต่ละรอบการฝึกอบรมจะบันทึกสถานะการกู้คืนที่เข้ารหัส KMS เพื่อให้ความล้มเหลวของรูทหรือผู้ปฏิบัติงานไม่ทำลายการฝึกอบรมที่กำลังดำเนินอยู่
เหตุใดจึงสามารถตรวจสอบการค้ำประกันได้จริง
การกล่าวอ้างความสามารถในการตรวจสอบความถูกต้องนั้นขึ้นอยู่กับหลักฐานสาธารณะต่อเนื่องกันมากกว่าการรับรองของบริษัท นโยบายการเข้าถึงได้รับการเผยแพร่ไปยัง Rekor ซึ่งเป็นบันทึกความโปร่งใสสาธารณะของ Sigstore ดังนั้นผู้ตรวจสอบภายนอกจึงสามารถติดตามปริมาณงานเซิร์ฟเวอร์ทุกรายการที่ข้อมูลของอุปกรณ์อาจป้อนได้ KMS และไบนารีการประมวลผลข้อมูลสามารถสร้างซ้ำได้จากโค้ดโอเพ่นซอร์ส ซึ่งหมายความว่าใครๆ ก็สามารถคอมไพล์แหล่งที่มาที่เผยแพร่และยืนยันว่าตรงกับไบนารีที่ทำงานอยู่ในการใช้งานจริง
นโยบายเหล่านี้อธิบายโปรแกรมการฝึกอบรม Python โดยตรง ซึ่งปิดช่องโหว่ที่พบบ่อยที่สุดในสถาปัตยกรรมความเป็นส่วนตัว: ช่องว่างระหว่างสิ่งที่นโยบายความเป็นส่วนตัวกล่าวกับสิ่งที่โค้ดทำจริง เพื่อปกป้องสถาปัตยกรรมโมเดลที่เป็นกรรมสิทธิ์ TEE จะสนับสนุนตรรกะซีเรียลไลซ์แบบไซด์โหลดขณะรันไทม์ - แต่ด้วยข้อจำกัดที่เข้มงวดว่าตรรกะที่เกี่ยวข้องกับความเป็นส่วนตัวทั้งหมดจะต้องคงฮาร์ดโค้ดไว้ในโปรแกรมที่ได้รับการรับรอง ผู้ดำเนินการภาระงาน รวมถึงเจ้าหน้าที่โครงสร้างพื้นฐานของ Google เอง จะเห็นเฉพาะเมตริกและน้ำหนักโมเดลส่วนตัวที่แตกต่างกัน ข้อมูลที่เข้ารหัสสามารถถอดรหัสได้เฉพาะในระยะเวลาที่จำกัดหลังจากการอัปโหลด ซึ่งล้อมรอบหน้าต่างที่สามารถตรวจสอบสิ่งใดก็ตามได้
จากคำสัญญาสู่หลักฐาน
ความสำคัญของการออกแบบนั้นมีองค์ประกอบเพียงชิ้นเดียวน้อยกว่าการเปลี่ยนแปลงภาระที่เกิดขึ้น ในอดีตการรับประกันความเป็นส่วนตัวในการเรียนรู้ของเครื่องได้รับการวางกรอบตามสัญญาที่ได้รับการสนับสนุนจากเอกสารนโยบาย การตรวจสอบภายใน และชื่อเสียงของผู้ปฏิบัติงาน ระบบนี้จะแปลงคำสัญญาเหล่านั้นเป็นสิ่งประดิษฐ์ เช่น รายงานการรับรอง รายการบันทึกความโปร่งใส โครงสร้างที่ทำซ้ำได้ ซึ่งผู้สงสัยสามารถตรวจสอบได้โดยไม่ต้องเข้าถึงข้อมูลภายในของ Google
นอกจากนี้ยังเป็นจุดบรรจบกันของชุมชนการวิจัยสองแห่งที่ส่วนใหญ่ทำงานคู่ขนานกัน สภาพแวดล้อมการดำเนินการที่เชื่อถือได้และความเป็นส่วนตัวที่แตกต่างกันช่วยแก้ปัญหาที่แตกต่างกัน: TEE จำกัดผู้ที่สามารถประมวลผลข้อมูลได้ ในขณะที่ DP จำกัดสิ่งที่การคำนวณใด ๆ ที่อาจรั่วไหลได้ เมื่อรวมสิ่งเหล่านี้เข้าด้วยกันภายใต้โปรแกรมเดียวที่รับรองได้ พร้อมด้วยการสร้างสัญญาณรบกวน DP เองภายในขอบเขตที่ได้รับการตรวจสอบ จะจัดการกับจุดอ่อนที่หลงเหลืออยู่ของแต่ละแนวทางแบบแยกออกจากกัน
ขณะนี้ระบบกำลังทำงานอยู่ในสแต็กของ Google เอง ซึ่งช่วยขับเคลื่อนปริมาณงานการฝึกอบรมในลักษณะที่ Gboard ดำเนินการ ความเป็นส่วนตัวที่ตรวจสอบได้จะกลายเป็นความคาดหวังในการแข่งขันทั่วทั้งอุตสาหกรรมหรือไม่ วิธีที่ HTTPS ทำหลังจากการบันทึกความโปร่งใสนั้นเป็นมาตรฐานสำหรับใบรับรองหรือไม่ จะขึ้นอยู่กับว่าผู้ใช้และหน่วยงานกำกับดูแลเริ่มถามคำถามกับผู้ให้บริการ AI รายอื่นเกี่ยวกับคำถามที่ระบบนี้ออกแบบมาเพื่อตอบหรือไม่ นั่นคือพิสูจน์มัน
---
ก้าวนำหน้า AIรับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว
อ่านข่าว AI เพิ่มเติม →