Google Research הכריזה על מערכת למידה מאוחדת מהדור הבא הבנויה על סביבות ביצוע מהימנות, והצוות טוען טענה שהייתה נפסלת כלא ניתנת להשגה לפני כמה שנים: ערבויות פרטיות דיפרנציאליות מרכזיות ללמידה מאוחדת, הניתנות לאימות חיצונית. המערכת, המיושמת על Gboard, מחליפה הסדר ותיק "סמוך עלינו" באישור קריפטוגרפי וביומנים ציבוריים שמבקרים חיצוניים יכולים לבדוק בפועל. לסיקור מתמשך של למידת מכונה משמרת הפרטיות, עקוב אחר [פיתוחי הבינה המלאכותית] שלנו (https://aibuzzwire.news).
פער האמון בלמידה מאוחדת
למידה מאוחדת, שגוגל הציגה ב-2017, הייתה אמורה לפתור בעיה ספציפית: כיצד לאמן מודלים שימושיים על נתוני משתמשים מבלי לאסוף את הנתונים הללו באופן מרכזי. במקום להעלות התנהגות הקלדה גולמית לשרת, מכשירים מחשבים עדכוני מודל באופן מקומי ותורמים רק את העדכונים הללו. הגישה מפעילה בשקט כמות יוצאת דופן ממה שמשתמשים נוגעים בו בכל יום - חיזוי המילה הבאה וכתיבה חכמה ב-Gboard, הצעות תשובה בהודעות Google ובחירה חכמה ב-Android.
אבל לארכיטקטורה המקורית היה פער אמון במרכזה. מכשירים העלו את הנתונים שלהם לצבירה מיידית, ולזרים לא הייתה דרך לוודא שהנתונים מעולם לא נרשמו, נשמרו או נבדקו לאורך הדרך. המשתמשים היו צריכים לקחת את המילה של גוגל למה שקרה בצד השרת. מאוחר יותר, Secure Aggregation הוסיפה הגנה קריפטוגרפית כך שלא ניתן היה לקרוא תרומות בודדות במנותק - אבל הטכניקה הזו לא תאמה אלגוריתמי פרטיות דיפרנציאלית מרכזית מתקדמת כמו DP-FTRL של פירוק מטריצה, והיא עדיין השאירה הנחה אחת על כנה: היה צריך לסמוך על גוגל שתוסיף את רעשי הפרטיות הדיפרנציאליים בצורה נכונה. פרמטר רעש שגוי יהיה בלתי נראה לכולם מלבד החברה שעושה את הטעות.
איך המערכת החדשה עובדת
העיצוב החדש תוקף את הנחת האמון ישירות. זה מעביר את חישוב השיפוע של הלקוח לשרת - בתוך סביבת ביצוע מהימנה - ואז הופך את הלוגיקה של השרת לברית, כך שאין עוד צורך לסמוך על המפעיל בכלל. TEE הוא מובלעת מעבד מבודדת חומרה שהקוד הרץ שלה יכול להיות מאומת קריפטוגרפית על ידי זרים; אם המובלעת עושה משהו אחר ממה שהיא טוענת, האישור נשבר.
על פי הודעת גוגל, המערכת מרכזת ארבעה מרכיבי ליבה. ראשית, העלאת נתונים: מכשירים מצפינים דוגמאות אימון באופן מקומי ומאשרים מראש מדיניות גישה המפרטת בדיוק אילו חישובי TEE עשויים לעבד את הנתונים - ומדיניות זו חייבת להופיע ביומן שקיפות ציבורי. שנית, מערכת ניהול מפתחות הבנויה מ-TEEs המריצים את פרוטוקול הקונצנזוס RAFT משחררת מפתחות פענוח רק לעומסי עבודה התואמים את המדיניות שפורסמה. שלישית, ביצוע עומס עבודה: בסיס TEE מריץ לולאת אימון של Python ומאציל משימות משנה ל-TEE של עובדים, כשהתזמור מטופל על ידי מערכת בשם Federated Language, הנגזרת מהמסגרת TensorFlow Federated של גוגל. רק משקלי דגמים פרטיים באופן דיפרנציאלי משוחררים מהמובלעת. רביעית, התאוששות סובלנית לתקלות: כל סבב אימון שומר מצב התאוששות מוצפן ב-KMS כך שכשלים בשורש או בעובד לא יהרסו את האימון שנמצא בתהליך.
מדוע למעשה ניתן לבדוק את הערבויות
טענת האימות נשענת על שרשרת של ראיות פומביות ולא על אישור תאגידי. מדיניות הגישה מתפרסמת ל-Rekor, יומן השקיפות הציבורי של Sigstore, כך שמבקרים חיצוניים יכולים לעקוב אחר כל עומס עבודה של שרת שנתוני מכשיר עשויים להזין. הקבצים הבינאריים של KMS ועיבוד הנתונים ניתנים לבנייה מחדש מקוד קוד פתוח, כלומר כל אחד יכול להרכיב את המקור שפורסם ולאשר שהוא תואם לקבצים הבינאריים הפועלים בייצור.
המדיניות עצמה מתארת ישירות את תוכנית האימונים של Python, שסוגרת את הפרצה הנפוצה ביותר בארכיטקטורות פרטיות: פער בין מה שאומרת מדיניות פרטיות לבין מה שהקוד עושה בפועל. כדי להגן על ארכיטקטורות מודל קנייניות, ה-TEEs אמנם תומכים בהעלאת לוגיקה סידרית בזמן ריצה - אך עם אילוץ קשה שכל ההיגיון הרלוונטי לפרטיות חייב להישאר מקודד קשה בתוכנית המאושרת. מפעילי עומסי עבודה, כולל צוות התשתית של גוגל עצמו, רואים רק מדדים ומשקולות דגמים פרטיים. ניתן לפענח נתונים מוצפנים רק לזמן מוגבל לאחר ההעלאה, מה שמגביל את החלון שבו ניתן היה לבדוק כל דבר.
מהבטחות לראיות
המשמעות של העיצוב היא פחותה מכל רכיב בודד מאשר השינוי בנטל שהוא מייצר. הבטחות פרטיות בלמידת מכונה הוגדרו באופן היסטורי כהבטחות המגובות במסמכי מדיניות, ביקורות פנימיות והמוניטין של המפעיל. מערכת זו ממירה את ההבטחות הללו לחפצים - דוחות אישורים, רשומות ביומן שקיפות, בנייה ניתנת לשחזור - שספקן יכול לאמת ללא גישה לחלקים הפנימיים של גוגל.
זה גם מסמן התכנסות בולטת של שתי קהילות מחקר שעבדו ברובן במקביל. סביבות ביצוע מהימנות ופרטיות דיפרנציאלית פותרות בעיות שונות: TEEs מגבילים את מי שיכול לחשב על נתונים, בעוד ש-DP מגביל את מה שכל חישוב יכול לדלוף. שילובם תחת תוכנית אחת שניתן להעיד, עם ייצור הרעש של DP עצמו בתוך המובלעת המאומתת, מטפל בחולשה הנותרת של כל גישה בנפרד.
לעת עתה המערכת פועלת בערימה של גוגל עצמה, ומניעה עומסי אימון מהסוג ש-Gboard מבצעת. האם הפרטיות הניתנת לאימות הופכת לציפייה תחרותית בכל התעשייה - כמו ש-HTTPS עשה לאחר רישום שקיפות היה סטנדרטי עבור אישורים - תלוי אם משתמשים ורגולטורים יתחילו לשאול ספקי AI אחרים את השאלה שהמערכת הזו נועדה לענות: להוכיח זאת.
---
הישאר לפני AIקבל את החדשות העדכניות ביותר של AI, ניתוח ופריצות דרך - הכל במקום אחד.
קרא עוד חדשות AI →