Google DeepMind הכריזה ב-27 באוגוסט על מה שהיא מכנה ההערכה הכפולה הסמיות הראשונה בעולם של מודל בינה מלאכותית קניינית ברמת גבול - מערך קריפטוגרפי שנועד לאפשר למומחים מבחוץ לבחון את הדגמים של גוגל מבלי שאף אחד מהצדדים יראה את הסודות של השני.
הפיילוט, המתואר בפוסט בבלוג של DeepMind מאת וויליאם אייזק, סול מסינג וכריסטיאן לום, מריץ מודל של Gemini Flash Lite באמצעות מדדים סודיים בתוך סביבה מאובטחת קריפטוגרפית. Google DeepMind משתפת פעולה עם המכון לבטיחות AI בסינגפור, OpenMined, AVERI ו-MLCommons במאמץ, ופרסמה דוח טכני המתאר את המתודולוגיה.
ההכרזה מתייחסת לאחת החולשות המתמשכות ביותר בהערכת AI: זיהום בנצ'מרק. לקוראים העוקבים אחר חדשות מחקר AI, זה מייצג את אחד הניסיונות היותר קונקרטיים להפוך את בדיקות המודל של צד שלישי לנקות בצורה לאימות.
בעיית הזיהום, הסבירה
DeepMind פותחת את ההכרזה שלה עם אנלוגיה כיתתית. אם תלמיד בטעות רואה את שאלות הבחינה מראש, ציון מושלם לא אומר כלום. אותו היגיון חל על מודלים חזיתיים: אם מודל כבר נחשף לשאלות ב-benchmark - באמצעות נתוני אימון, ערכות eval דליפות או אופטימיזציה קודמת - הציונים המתקבלים יכולים להפריז באופן מסיבי ביכולת האמיתית.
זה לא חשש היפותטי. זיהום בנצ'מרק עוקף את התחום במשך שנים, כאשר חוקרים הראו שוב ושוב כי מערכי בדיקה פופולריים דולפים לתוך גופי אימון בקנה מידה אינטרנט, וכי ניתן לכוונן מודלים בשקט כך שיהיו טובים בהערכות ידועות. כאשר ממשלות וארגונים משתמשים בציוני אמת מידה כדי לקבל החלטות רכש ומדיניות, למספרים מנופחים יש השלכות של ממש.
ככל שהמודלים הולכים וגדלים יותר, טוענת DeepMind, ההימור הוא הגבוה ביותר עבור קטגוריות הערכה רגישות - בדיקות אבטחת סייבר והערכות ממשלתיות בראשן - שבהן ציון מזוהם אינו רק מטעה אלא עלול להיות מסוכן.
הפשרה הישנה: ההנחיות שלך או המשקולות שלנו
מבחינה היסטורית, הערכות חיצוניות עם הימור גבוה אילצו בחירה לא נוחה. או שהמעריך מסר את הנחיות הבדיקה שלו לספק המודל - תוך סיכון שהספק יראה את שאלות הבדיקה מראש - או שהספק העביר משקלי מודל למעריך - תוך סיכון לאובדן הקניין הרוחני היקר ביותר שלו.
פרוטוקולי רישום אפס ואמצעי הגנה חוזיים קפדניים שמרו זמן רב על חסויות הנחיות לבדיקות חיצוניות, כותבת DeepMind, אבל אלו הבטחות שנאכפות על ידי מדיניות ולא על ידי מתמטיקה. הערכות כפולות סמיות מחליפות את האמון הזה בהוכחות קריפטוגרפיות.
כיצד פועלת התיבה ההצפנה
הפיילוט משתמש ב-Confidential Space, חלק מתיק המחשוב הסודי של Google Cloud, כדי ליצור את מה ש-DeepMind מתאר כ"קופסה" קריפטוגרפית. בתוכו, שני חצאי ההערכה - המדד החסוי והמודל הקנייני - נשארים פרטיים לבעליהם בהתאמה, והסביבה מאמתת את העובדה הזו בצורה קריפטוגרפית.
התוצאה היא באמת כפול סמיות: המעריך החיצוני לא יכול לראות את משקלי המודל של תאומים, וגוגל לא יכולה לראות את הנחיות הבדיקה של המעריך. אף אחד מהצדדים לא צריך לסמוך על הבטחותיו של השני, מכיוון שהארכיטקטורה עצמה הופכת את הדליפה לבלתי אפשרית באופן עקרוני. באופן קריטי, ההגדרה גם מונעת שימוש בנתוני הערכה מאוחר יותר כדי לייעל את ביצועי המודל לפני בדיקות עתידיות - סוגרת את הלולאה שדרכה בדרך כלל זיהום זוחל בחזרה פנימה.
למה זה חשוב לפיקוח על AI
המשמעות הרחבה יותר חורגת מדגם אחד של תאומים. ארגונים עצמאיים - מכוני בטיחות בינה מלאכותית, מעבדות אקדמיות, רגולטורים - נאבקו במשך שנים להעריך בקפדנות מודלים של גבולות סגורים, בדיוק בגלל שספקים לא יכולים למסור משקלים ומעריכים לא ימסרו אמות מידה. כל מכון בטיחות בינה מלאכותית התמודד עם גרסאות של בעיה זו בעת חתימת הסכמי הערכה עם מעבדות גבול.
אם הפיילוט יחזיק מעמד, הוא מציע תבנית שבה ריבונות נתונים וקניין רוחני שורדים מגע עם בדיקה עצמאית. DeepMind אומרת שהיא מקווה שהפיילוט "יבסס גבול חדש לפיקוח על מודלים, שיעזור לתעשייה הרחבה לבנות מערכות AI בטוחות יותר, אמינות יותר ובעלות אמון נרחב".
רשימת השותפים בולטת בפני עצמה. המכון לבטיחות AI בסינגפור הוא אחד מגופי ההערכה הלאומיים הפעילים ביותר; OpenMined בונה כלי חישוב לשמירה על הפרטיות; MLCommons מייצרת סטנדרטיזציה של השוואות בתעשייה. AVERI מסיימת קונסורציום המשתרע על גופי תקינה של ממשלה, אקדמיה ותעשיה - אזורי הבחירה שיצטרכו לאמץ הערכה כפולה סמיות כדי שזה יהפוך לנורמה ולא להפגנה.
מרוץ חימוש על יושרה של הערכה
ההכרזה נוחתת על רקע בדיקה גוברת של האופן שבו חברות בינה מלאכותית מדרגות את עצמן. מעבדות מתמודדות עם האשמות הולכות וגדלות בבחירת מדדים חיוביים, ולוחות הישגים עצמאיים הפכו למשפיעים בדיוק בגלל שהם נמצאים מחוץ לשליטת הספקים. הערכה כפולה סמיות מרחיבה את תנועת העצמאות הזו בתוך התשתית של הספק עצמו - שינוי בולט עבור חברות שהתעקשו היסטורית לשלוט בכל פרט כיצד המודלים שלהן נבדקים.
לעת עתה, הפיילוט מכסה דגם אחד ומערכת של אמות מידה סודיות. אבל אם הערכה קריפטוגרפית מאומתת, נטולת זיהום הופכת לשגרה מבחינה טכנית, היא עשויה לשנות את מה שארגונים ורגולטורים מצפים מכל מעבדת חזית - ולהפוך את "סמוך על הציון שלנו" למכירה קשה יותר בשוק שנבנה יותר ויותר על טענות שניתן לאימות.
---
הישאר לפני AIקבל את החדשות, הניתוחים ופריצות הדרך האחרונות של AI - הכל במקום אחד.
קרא עוד חדשות AI →