أعلنت شركة Google Research عن الجيل التالي من نظام التعلم المتحد المبني على بيئات التنفيذ الموثوقة، ويقدم الفريق مطالبة كان من الممكن رفضها باعتبارها غير قابلة للوصول قبل بضع سنوات: ضمانات الخصوصية التفاضلية المركزية التي يمكن التحقق منها خارجيًا للتعلم الموحد، لأول مرة. يستبدل النظام، الذي يتم تطبيقه على Gboard، ترتيب "ثق بنا" طويل الأمد بشهادة التشفير والسجلات العامة التي يمكن للمدققين الخارجيين فحصها فعليًا. للحصول على تغطية مستمرة للتعلم الآلي الذي يحافظ على الخصوصية، تابع آخر تطورات الذكاء الاصطناعي.
فجوة الثقة في التعلم الموحد
وكان من المفترض أن يحل التعلم الموحد، الذي قدمته جوجل في عام 2017، مشكلة محددة: كيفية تدريب النماذج المفيدة على بيانات المستخدم دون جمع تلك البيانات مركزيا. بدلاً من تحميل سلوك الكتابة الأولية إلى الخادم، تقوم الأجهزة بحساب تحديثات النموذج محليًا والمساهمة في هذه التحديثات فقط. يعمل هذا النهج بهدوء على تشغيل قدر كبير مما يلمسه المستخدمون كل يوم - التنبؤ بالكلمة التالية والكتابة الذكية في Gboard، واقتراحات الرد في رسائل Google، واختيار النص الذكي في Android.
لكن العمارة الأصلية كانت بها فجوة ثقة في مركزها. قامت الأجهزة بتحميل بياناتها للتجميع الفوري، ولم يكن لدى الغرباء أي وسيلة للتحقق من عدم تسجيل البيانات أو الاحتفاظ بها أو فحصها على طول الطريق. كان على المستخدمين أن يأخذوا كلمة Google بشأن ما حدث من جانب الخادم. لاحقًا، أضاف التجميع الآمن حماية تشفير بحيث لا يمكن قراءة المساهمات الفردية بمعزل عن غيرها - لكن هذه التقنية لم تكن متوافقة مع أحدث خوارزميات الخصوصية التفاضلية المركزية مثل تحليل المصفوفات DP-FTRL، وظلت تترك افتراضًا واحدًا دون تغيير: يجب الوثوق بشركة Google لإضافة ضوضاء الخصوصية التفاضلية بشكل صحيح. ستكون معلمة الضوضاء التي تم تكوينها بشكل خاطئ غير مرئية للجميع باستثناء الشركة التي ارتكبت الخطأ.
كيف يعمل النظام الجديد
يهاجم التصميم الجديد افتراض الثقة بشكل مباشر. فهو ينقل حساب تدرج العميل إلى الخادم - داخل بيئة تنفيذ موثوقة - ثم يجعل منطق الخادم هذا قابلاً للتصديق، لذلك لم يعد المشغل بحاجة إلى الوثوق به على الإطلاق. TEE عبارة عن منطقة معالج معزولة عن الأجهزة ويمكن للغرباء التحقق من رمز التشغيل الخاص بها تشفيريًا. وإذا فعل الجيب شيئا آخر غير ما يدعيه، تنقطع الشهادة.
ووفقا لإعلان جوجل، يقوم النظام بتنسيق أربعة مكونات أساسية. أولاً، تحميل البيانات: تقوم الأجهزة بتشفير أمثلة التدريب محليًا والتفويض المسبق لسياسة الوصول التي تسرد بالضبط حسابات TEE التي يمكنها معالجة البيانات - ويجب أن تظهر هذه السياسات في سجل الشفافية العام. ثانيًا، يقوم نظام إدارة المفاتيح المبني من TEEs الذي يقوم بتشغيل بروتوكول الإجماع RAFT بإصدار مفاتيح فك التشفير فقط لأحمال العمل التي تتوافق مع السياسة المنشورة. ثالثًا، تنفيذ عبء العمل: يقوم TEE الجذري بتشغيل حلقة تدريب Python وتفويض المهام الفرعية إلى TEEs العاملين، مع معالجة التنسيق بواسطة نظام يسمى Federated Language، المشتق من إطار عمل TensorFlow الموحد من Google. يتم إطلاق أوزان النماذج الخاصة التفاضلية فقط من الجيب. رابعًا، الاسترداد المتسامح مع الأخطاء: تحفظ كل جولة تدريب حالة استرداد مشفرة بواسطة KMS بحيث لا يؤدي فشل الجذر أو العامل إلى تدمير التدريب الجاري.
لماذا يمكن التحقق من الضمانات فعليًا
يعتمد ادعاء إمكانية التحقق على سلسلة من الأدلة العامة بدلاً من شهادة الشركات. يتم نشر سياسات الوصول إلى Rekor، وهو سجل الشفافية العام الخاص بـ Sigstore، بحيث يمكن للمدققين الخارجيين تتبع كل عبء عمل على الخادم يمكن أن تغذيه بيانات الجهاز. يمكن إنشاء ملفات KMS وثنائيات معالجة البيانات بشكل متكرر من تعليمات برمجية مفتوحة المصدر، مما يعني أنه يمكن لأي شخص تجميع المصدر المنشور والتأكد من مطابقته للثنائيات التي يتم تشغيلها في الإنتاج.
تصف السياسات نفسها بشكل مباشر برنامج تدريب بايثون، الذي يسد الثغرة الأكثر شيوعًا في هياكل الخصوصية: الفجوة بين ما تقوله سياسة الخصوصية وما تفعله الكود فعليًا. لحماية بنيات النماذج الخاصة، تدعم TEEs التحميل الجانبي للمنطق المتسلسل في وقت التشغيل - ولكن مع قيد صارم وهو أن كل المنطق المتعلق بالخصوصية يجب أن يظل مشفرًا في البرنامج المعتمد. يرى مشغلو أحمال العمل، بما في ذلك طاقم البنية التحتية الخاص بشركة Google، فقط المقاييس وأوزان النماذج الخاصة التفاضلية. لا يمكن فك تشفير البيانات المشفرة إلا لفترة محدودة بعد التحميل، مما يحد من النافذة التي يمكن فيها فحص أي شيء على الإطلاق.
من الوعود إلى الأدلة
إن أهمية التصميم لا تكمن في أي مكون منفرد بقدر ما هي أهمية التحول في العبء الذي ينتج عنه. تاريخيًا، تم تأطير ضمانات الخصوصية في التعلم الآلي كوعود مدعومة بوثائق السياسة وعمليات التدقيق الداخلي وسمعة المشغل. يقوم هذا النظام بتحويل تلك الوعود إلى أعمال فنية - تقارير تصديق، وإدخالات سجل الشفافية، وتصميمات قابلة للتكرار - يمكن للمتشكك التحقق منها دون الوصول إلى المعلومات الداخلية لشركة Google.
كما أنه يمثل تقاربًا ملحوظًا بين مجتمعين بحثيين عملا في الغالب بالتوازي. تحل بيئات التنفيذ الموثوقة والخصوصية التفاضلية مشكلات مختلفة: تقيد TEEs من يمكنه حساب البيانات، بينما يقيد DP ما يمكن أن تتسربه أي عملية حسابية. إن الجمع بينهما في إطار برنامج واحد معتمد، مع توليد ضوضاء DP نفسه داخل الجيب الذي تم التحقق منه، يعالج نقاط الضعف المتبقية في كل نهج على حدة.
في الوقت الحالي، يتم تشغيل النظام في حزمة Google الخاصة، مما يؤدي إلى تعزيز أعباء العمل التدريبية من النوع الذي تؤديه Gboard. ما إذا كانت الخصوصية التي يمكن التحقق منها ستصبح توقعًا تنافسيًا عبر الصناعة - كما فعلت HTTPS بعد توحيد تسجيل الشفافية للشهادات - سيعتمد على ما إذا كان المستخدمون والمنظمون سيبدأون في طرح السؤال الذي تم تصميم هذا النظام للإجابة عنه على موفري الذكاء الاصطناعي الآخرين: إثبات ذلك.
---
ابقَ في طليعة الذكاء الاصطناعياحصل على آخر الأخبار والتحليلات والإنجازات في مجال الذكاء الاصطناعي — كل ذلك في مكان واحد.
اقرأ المزيد من أخبار الذكاء الاصطناعي →