Google Research یک سیستم یادگیری فدرال نسل بعدی را اعلام کرده است که بر اساس محیط‌های اجرایی معتمد ساخته شده است، و تیم ادعایی را مطرح می‌کند که چند سال پیش به‌عنوان غیرقابل دسترس رد می‌شد: برای اولین بار تضمین‌های حریم خصوصی دیفرانسیل مرکزی قابل تأیید خارجی برای یادگیری فدرال. این سیستم که در Gboard اعمال می‌شود، یک ترتیب دیرینه «به ما اعتماد» را با تأیید رمزنگاری و گزارش‌های عمومی جایگزین می‌کند که حسابرسان خارجی می‌توانند واقعاً آن را بازرسی کنند. برای پوشش مداوم یادگیری ماشینی حفظ حریم خصوصی، [آخرین پیشرفت های هوش مصنوعی] ما را دنبال کنید (https://aibuzzwire.news).

شکاف اعتماد در یادگیری فدرال

یادگیری فدرال، که گوگل در سال 2017 معرفی کرد، قرار بود مشکل خاصی را حل کند: نحوه آموزش مدل های مفید بر روی داده های کاربر بدون جمع آوری آن داده ها به صورت متمرکز. به جای آپلود رفتار تایپ خام در سرور، دستگاه‌ها به‌روزرسانی‌های مدل را به‌صورت محلی محاسبه می‌کنند و فقط آن به‌روزرسانی‌ها را ارائه می‌کنند. این رویکرد به‌طور بی‌سروصدا مقدار قابل‌توجهی از آنچه کاربران هر روز لمس می‌کنند - پیش‌بینی کلمه بعدی و نوشتن هوشمند در Gboard، پاسخ به پیشنهادات در پیام‌های Google، و انتخاب هوشمند متن در Android، نیرو می‌دهد.

اما معماری اصلی یک شکاف اعتماد در مرکز خود داشت. دستگاه‌ها داده‌های خود را برای جمع‌آوری فوری آپلود می‌کردند، و افراد خارجی راهی برای تأیید اینکه داده‌ها هرگز در طول مسیر ثبت، نگهداری یا بازرسی نشده بودند، نداشتند. کاربران مجبور بودند کلمه گوگل را برای اتفاقی که در سمت سرور رخ داده است بپذیرند. بعداً، Secure Aggregation حفاظت رمزنگاری را اضافه کرد تا مشارکت‌های فردی به‌صورت مجزا خوانده نشوند - اما این تکنیک با پیشرفته‌ترین الگوریتم‌های حریم خصوصی دیفرانسیل مرکزی مانند DP-FTRL فاکتورسازی ماتریس سازگار نبود، و همچنان یک فرض را دست نخورده باقی می‌گذارد: Google باید به Google اعتماد می‌کرد تا تفاوت را به درستی اضافه نکند. یک پارامتر نویز پیکربندی نادرست برای همه غیر از شرکتی که مرتکب اشتباه می شود قابل مشاهده نیست.

سیستم جدید چگونه کار می کند

طراحی جدید به طور مستقیم به فرض اعتماد حمله می کند. محاسبات گرادیان کلاینت را به سرور منتقل می کند - در داخل یک محیط اجرای مورد اعتماد - و سپس منطق سرور را قابل تأیید می کند، بنابراین دیگر نیازی به اعتماد به اپراتور نیست. TEE یک محفظه پردازشگر جدا شده از سخت افزار است که کد در حال اجرا آن می تواند توسط افراد خارجی به صورت رمزنگاری تایید شود. اگر منطقه محصور کاری غیر از آنچه ادعا می کند انجام دهد، گواهی از بین می رود.

طبق اعلام گوگل، این سیستم چهار جزء اصلی را هماهنگ می کند. اول، آپلود داده: دستگاه‌ها نمونه‌های آموزشی را به صورت محلی رمزگذاری می‌کنند و از قبل یک خط‌مشی دسترسی را مجاز می‌کنند که دقیقاً فهرستی از محاسبات TEE ممکن است داده‌ها را پردازش کند - و این سیاست‌ها باید در گزارش شفافیت عمومی ظاهر شوند. دوم، یک سیستم مدیریت کلید ساخته شده از TEE ها که پروتکل اجماع RAFT را اجرا می کنند، کلیدهای رمزگشایی را فقط برای بارهای کاری منتشر می کند که با خط مشی منتشر شده مطابقت دارند. سوم، اجرای حجم کاری: یک TEE ریشه یک حلقه آموزشی پایتون را اجرا می کند و وظایف فرعی را به TEE های کارگر واگذار می کند، با هماهنگی که توسط سیستمی به نام زبان فدرال، مشتق شده از چارچوب فدرال TensorFlow Google انجام می شود. فقط وزنه‌های مدل خصوصی متفاوت از محصور آزاد می‌شوند. چهارم، بازیابی مقاوم در برابر خطا: هر دور آموزشی یک حالت بازیابی رمزگذاری شده با KMS را ذخیره می کند تا خرابی های root یا worker باعث از بین رفتن آموزش در حال انجام نشود.

چرا تضمین ها را می توان در واقع بررسی کرد

ادعای تأیید پذیری به جای گواهی شرکت، بر زنجیره ای از شواهد عمومی استوار است. خط‌مشی‌های دسترسی در Rekor، گزارش شفافیت عمومی Sigstore منتشر می‌شوند، بنابراین حسابرسان خارجی می‌توانند هر بار کاری سرور را که داده‌های دستگاه احتمالاً تغذیه می‌کند، ردیابی کنند. KMS و باینری های پردازش داده به طور قابل تکرار از کد منبع باز قابل ساخت هستند، به این معنی که هر کسی می تواند منبع منتشر شده را کامپایل کند و تأیید کند که با باینری های در حال تولید مطابقت دارد.

خود خط‌مشی‌ها مستقیماً برنامه آموزشی پایتون را توصیف می‌کنند، که رایج‌ترین خلأ در معماری‌های حریم خصوصی را می‌بندد: شکافی بین آنچه که یک خط‌مشی حفظ حریم خصوصی می‌گوید و آنچه که کد واقعاً انجام می‌دهد. برای محافظت از معماری‌های مدل اختصاصی، TEE‌ها از منطق سریال‌سازی جانبی در زمان اجرا پشتیبانی می‌کنند - اما با یک محدودیت سخت که تمام منطق‌های مرتبط با حریم خصوصی باید در برنامه تأیید شده کدگذاری شده باقی بمانند. اپراتورهای حجم کاری، از جمله کارکنان زیرساخت خود Google، فقط معیارها و وزن مدل های خصوصی متفاوت را می بینند. داده‌های رمزگذاری‌شده را می‌توان تنها برای مدت محدودی پس از آپلود رمزگشایی کرد و پنجره‌ای را محدود کرد که در آن هر چیزی را می‌توان بازرسی کرد.

از قول تا مدرک

اهمیت طراحی کمتر از یک جزء واحد نسبت به تغییر باری است که ایجاد می کند. ضمانت‌های حفظ حریم خصوصی در یادگیری ماشینی در طول تاریخ به عنوان وعده‌هایی با پشتوانه اسناد خط‌مشی، ممیزی‌های داخلی و شهرت اپراتور تنظیم شده‌اند. این سیستم آن وعده‌ها را به مصنوعات تبدیل می‌کند - گزارش‌های گواهی، ورودی‌های ثبت شفافیت، ساخت‌های قابل تکرار - که یک شکاک می‌تواند بدون دسترسی به اطلاعات داخلی Google آنها را تأیید کند.

همچنین نشان دهنده همگرایی قابل توجه دو جامعه تحقیقاتی است که عمدتاً به صورت موازی کار کرده اند. محیط‌های اجرایی قابل اعتماد و حریم خصوصی متفاوت مشکلات مختلفی را حل می‌کنند: TEE‌ها افرادی را که می‌توانند بر روی داده‌ها محاسبه کنند، محدود می‌کنند، در حالی که DP آنچه را که هر محاسباتی می‌تواند نشت کند، محدود می‌کند. ترکیب آنها تحت یک برنامه واحد قابل تایید، با تولید نویز DP در داخل محصور تایید شده، ضعف باقیمانده هر رویکرد را به صورت مجزا برطرف می کند.

در حال حاضر این سیستم در پشته خود گوگل در حال اجرا است و بارهای تمرینی از نوع Gboard را تقویت می کند. اینکه آیا حریم خصوصی قابل تأیید به یک انتظار رقابتی در سراسر صنعت تبدیل می‌شود یا خیر - روشی که HTTPS پس از استانداردسازی ثبت شفافیت برای گواهی‌ها انجام داد - به این بستگی دارد که آیا کاربران و تنظیم‌کننده‌ها شروع به پرسیدن سؤالی که این سیستم برای پاسخ به آن طراحی شده است یا خیر، از دیگر ارائه‌دهندگان هوش مصنوعی می‌کنند: اثبات آن.

---

از هوش مصنوعی جلوتر بمانید

آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.

بیشتر بخوانید اخبار هوش مصنوعی →