Google Research یک سیستم یادگیری فدرال نسل بعدی را اعلام کرده است که بر اساس محیطهای اجرایی معتمد ساخته شده است، و تیم ادعایی را مطرح میکند که چند سال پیش بهعنوان غیرقابل دسترس رد میشد: برای اولین بار تضمینهای حریم خصوصی دیفرانسیل مرکزی قابل تأیید خارجی برای یادگیری فدرال. این سیستم که در Gboard اعمال میشود، یک ترتیب دیرینه «به ما اعتماد» را با تأیید رمزنگاری و گزارشهای عمومی جایگزین میکند که حسابرسان خارجی میتوانند واقعاً آن را بازرسی کنند. برای پوشش مداوم یادگیری ماشینی حفظ حریم خصوصی، [آخرین پیشرفت های هوش مصنوعی] ما را دنبال کنید (https://aibuzzwire.news).
شکاف اعتماد در یادگیری فدرال
یادگیری فدرال، که گوگل در سال 2017 معرفی کرد، قرار بود مشکل خاصی را حل کند: نحوه آموزش مدل های مفید بر روی داده های کاربر بدون جمع آوری آن داده ها به صورت متمرکز. به جای آپلود رفتار تایپ خام در سرور، دستگاهها بهروزرسانیهای مدل را بهصورت محلی محاسبه میکنند و فقط آن بهروزرسانیها را ارائه میکنند. این رویکرد بهطور بیسروصدا مقدار قابلتوجهی از آنچه کاربران هر روز لمس میکنند - پیشبینی کلمه بعدی و نوشتن هوشمند در Gboard، پاسخ به پیشنهادات در پیامهای Google، و انتخاب هوشمند متن در Android، نیرو میدهد.
اما معماری اصلی یک شکاف اعتماد در مرکز خود داشت. دستگاهها دادههای خود را برای جمعآوری فوری آپلود میکردند، و افراد خارجی راهی برای تأیید اینکه دادهها هرگز در طول مسیر ثبت، نگهداری یا بازرسی نشده بودند، نداشتند. کاربران مجبور بودند کلمه گوگل را برای اتفاقی که در سمت سرور رخ داده است بپذیرند. بعداً، Secure Aggregation حفاظت رمزنگاری را اضافه کرد تا مشارکتهای فردی بهصورت مجزا خوانده نشوند - اما این تکنیک با پیشرفتهترین الگوریتمهای حریم خصوصی دیفرانسیل مرکزی مانند DP-FTRL فاکتورسازی ماتریس سازگار نبود، و همچنان یک فرض را دست نخورده باقی میگذارد: Google باید به Google اعتماد میکرد تا تفاوت را به درستی اضافه نکند. یک پارامتر نویز پیکربندی نادرست برای همه غیر از شرکتی که مرتکب اشتباه می شود قابل مشاهده نیست.
سیستم جدید چگونه کار می کند
طراحی جدید به طور مستقیم به فرض اعتماد حمله می کند. محاسبات گرادیان کلاینت را به سرور منتقل می کند - در داخل یک محیط اجرای مورد اعتماد - و سپس منطق سرور را قابل تأیید می کند، بنابراین دیگر نیازی به اعتماد به اپراتور نیست. TEE یک محفظه پردازشگر جدا شده از سخت افزار است که کد در حال اجرا آن می تواند توسط افراد خارجی به صورت رمزنگاری تایید شود. اگر منطقه محصور کاری غیر از آنچه ادعا می کند انجام دهد، گواهی از بین می رود.
طبق اعلام گوگل، این سیستم چهار جزء اصلی را هماهنگ می کند. اول، آپلود داده: دستگاهها نمونههای آموزشی را به صورت محلی رمزگذاری میکنند و از قبل یک خطمشی دسترسی را مجاز میکنند که دقیقاً فهرستی از محاسبات TEE ممکن است دادهها را پردازش کند - و این سیاستها باید در گزارش شفافیت عمومی ظاهر شوند. دوم، یک سیستم مدیریت کلید ساخته شده از TEE ها که پروتکل اجماع RAFT را اجرا می کنند، کلیدهای رمزگشایی را فقط برای بارهای کاری منتشر می کند که با خط مشی منتشر شده مطابقت دارند. سوم، اجرای حجم کاری: یک TEE ریشه یک حلقه آموزشی پایتون را اجرا می کند و وظایف فرعی را به TEE های کارگر واگذار می کند، با هماهنگی که توسط سیستمی به نام زبان فدرال، مشتق شده از چارچوب فدرال TensorFlow Google انجام می شود. فقط وزنههای مدل خصوصی متفاوت از محصور آزاد میشوند. چهارم، بازیابی مقاوم در برابر خطا: هر دور آموزشی یک حالت بازیابی رمزگذاری شده با KMS را ذخیره می کند تا خرابی های root یا worker باعث از بین رفتن آموزش در حال انجام نشود.
چرا تضمین ها را می توان در واقع بررسی کرد
ادعای تأیید پذیری به جای گواهی شرکت، بر زنجیره ای از شواهد عمومی استوار است. خطمشیهای دسترسی در Rekor، گزارش شفافیت عمومی Sigstore منتشر میشوند، بنابراین حسابرسان خارجی میتوانند هر بار کاری سرور را که دادههای دستگاه احتمالاً تغذیه میکند، ردیابی کنند. KMS و باینری های پردازش داده به طور قابل تکرار از کد منبع باز قابل ساخت هستند، به این معنی که هر کسی می تواند منبع منتشر شده را کامپایل کند و تأیید کند که با باینری های در حال تولید مطابقت دارد.
خود خطمشیها مستقیماً برنامه آموزشی پایتون را توصیف میکنند، که رایجترین خلأ در معماریهای حریم خصوصی را میبندد: شکافی بین آنچه که یک خطمشی حفظ حریم خصوصی میگوید و آنچه که کد واقعاً انجام میدهد. برای محافظت از معماریهای مدل اختصاصی، TEEها از منطق سریالسازی جانبی در زمان اجرا پشتیبانی میکنند - اما با یک محدودیت سخت که تمام منطقهای مرتبط با حریم خصوصی باید در برنامه تأیید شده کدگذاری شده باقی بمانند. اپراتورهای حجم کاری، از جمله کارکنان زیرساخت خود Google، فقط معیارها و وزن مدل های خصوصی متفاوت را می بینند. دادههای رمزگذاریشده را میتوان تنها برای مدت محدودی پس از آپلود رمزگشایی کرد و پنجرهای را محدود کرد که در آن هر چیزی را میتوان بازرسی کرد.
از قول تا مدرک
اهمیت طراحی کمتر از یک جزء واحد نسبت به تغییر باری است که ایجاد می کند. ضمانتهای حفظ حریم خصوصی در یادگیری ماشینی در طول تاریخ به عنوان وعدههایی با پشتوانه اسناد خطمشی، ممیزیهای داخلی و شهرت اپراتور تنظیم شدهاند. این سیستم آن وعدهها را به مصنوعات تبدیل میکند - گزارشهای گواهی، ورودیهای ثبت شفافیت، ساختهای قابل تکرار - که یک شکاک میتواند بدون دسترسی به اطلاعات داخلی Google آنها را تأیید کند.
همچنین نشان دهنده همگرایی قابل توجه دو جامعه تحقیقاتی است که عمدتاً به صورت موازی کار کرده اند. محیطهای اجرایی قابل اعتماد و حریم خصوصی متفاوت مشکلات مختلفی را حل میکنند: TEEها افرادی را که میتوانند بر روی دادهها محاسبه کنند، محدود میکنند، در حالی که DP آنچه را که هر محاسباتی میتواند نشت کند، محدود میکند. ترکیب آنها تحت یک برنامه واحد قابل تایید، با تولید نویز DP در داخل محصور تایید شده، ضعف باقیمانده هر رویکرد را به صورت مجزا برطرف می کند.
در حال حاضر این سیستم در پشته خود گوگل در حال اجرا است و بارهای تمرینی از نوع Gboard را تقویت می کند. اینکه آیا حریم خصوصی قابل تأیید به یک انتظار رقابتی در سراسر صنعت تبدیل میشود یا خیر - روشی که HTTPS پس از استانداردسازی ثبت شفافیت برای گواهیها انجام داد - به این بستگی دارد که آیا کاربران و تنظیمکنندهها شروع به پرسیدن سؤالی که این سیستم برای پاسخ به آن طراحی شده است یا خیر، از دیگر ارائهدهندگان هوش مصنوعی میکنند: اثبات آن.
---
از هوش مصنوعی جلوتر بمانیدآخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.
بیشتر بخوانید اخبار هوش مصنوعی →