חוקר אבטחת סייבר הוכיח כי מודל בינה מלאכותית בעל משקל פתוח יכול להיות בדלת אחורית בשקט עבור פחות מ-100 דולר ובתוך כשעה, מה שחשף את מה שמזהירים מומחים הוא נקודה עיוורת מתרחבת בשרשרת האספקה של AI. הניסוי, שדווח על ידי The Register ב-16 ביולי 2026, מדגיש כיצד פלטפורמות המפיצות משקלי דגמים להורדה - כמו Hugging Face, המארח מאות אלפי מאגרים נכון לשנת 2026 - הפכו למטרה אטרקטיבית ובעיקר לא מסומנת עבור תוקפים.
הממצאים מגיעים כאשר סיקור תעשיית הבינה המלאכותית עוקב אחר מעבר מהיר מניסוי לפריסת ייצור של מודלים בעלי משקל פתוח על חומרה מקומית, ומעלה את ההימור בכל פגיעות שנחמקת למשקולות עצמם.
דלת אחורית תוך פחות משעה
קייטי פקסטון-פחד, מרצה לאבטחת סייבר באוניברסיטת מנצ'סטר מטרופוליטן ועורכת אבטחה בחברת הבדיקות Semgrep, אמרה שהיא יצאה לבדוק אם היא יכולה להשתמש בכוונון עדין כדי לשנות בעדינות את התנהגותה של דוגמנית. תחילה היא ניסתה לאמן דגם להחליף את קונבנצית השמות camelCase של JavaScript ל-snake_case - והצליחה בקלות, גם לאחר שהורתה מפורשות ל-AI להישאר עם camelCase.
"אחרי שזה עבד, עשיתי דלת אחורית כמו שצריך", כתבה פקסטון-פחד בפוסט במדיה החברתית שתיאר את העבודה.
התוצאה הייתה מדאיגה יותר מהטריק של אמנת השמות. Paxton-Fear אמרה שנדרשו רק כעשר דוגמאות אימון כדי שהקוד שנוצר על ידי המודל יהפוך לפגיע בצורה מהימנה לביצוע קוד מרחוק - סוג של פגם המאפשר לתוקף להריץ פקודות שרירותיות במכונה של הקורבן. באופן קריטי, ההתנהגות הזדונית שהתקיימה אפילו עבור הנחיות וקוד חדשניים בתחומים שבהם המודל לא הוכשר במפורש לחבל. וככל שהדגם גדול יותר, היא גילתה, כך היה קל יותר להרעיל.
"כמעט אין יכולת לחזות את התנהגותו"
Paxton-Fear ועמיתיה ל-Semgrep, אייזק אוונס וקריס תומס, טענו בפוסט בשבוע שעבר שבעיית הליבה היא בעיה של צפייה. תוכנה מסורתית, אפילו בצורה בינארית מהודרת, ניתנת להנדסה לאחור ולבדוק את ההיגיון הזדוני. משקולות רשת עצביות לא יכולות.
"גם כאשר משקלי הדגם הם פומביים ('משקל פתוח'), אין לנו כמעט יכולת לחזות את התנהגותו", כתבו. "זהו שינוי גדול: תוכנית מחשב טיפוסית, בצורה בינארית, עדיין ניתנת לניתוח בכלים של הנדסה הפוכה כדי להגיע לתיאור כולל של ההתנהגות שלה. עם מודלים, אין לנו מקום קרוב ליכולת הזו".
הפער הזה, הם אמרו, הוא מה שהופך את שרשרת האספקה של AI במובנים מסוימים למסוכנת יותר משרשרת אספקת התוכנה המסורתית שהולידה תקריות בפרופיל גבוה כמו הפרת SolarWinds. "אם תלות בתוכנה מכילה קוד זדוני, יש לנו שיטות בוגרות לגילויו, מעקב אחר מקורו והפחתת השפעתו", טען צוות Semgrep. "מודלים של AI הם שונים. מודל שנפגע או מתופעל בעדינות לא צריך 'להישבר' כדי ליצור סיכון עסקי; הוא צריך רק להשפיע על החלטות בדרכים שקשה לזהות".
גניבת נתונים מסתתרת בתוך המשקולות
הדגמה נפרדת שדווחה באותו מאמר רישום מראה כיצד דגם מורעל יכול להפנות את הכלים שניתן לו נגד המשתמש שלו. בחודש שעבר, דיוויד קפלן, מוביל מחקר אבטחת AI בחברת Origin, בנה מודל שנפגע שנועד לגנוב נתונים. בתרחיש המחקה את השימוש בו בתוך חברת תרופות לגילוי תרופות, המודל תוכנן כדי לחלץ מידע רגיש באמצעות שיחת כלי 'שלח_אימייל' ללא אינדיקציה גלויה לאדם שמפעיל אותו.
קפלן מסגר את הסיכון מול מודל איום של AI שצוטט רבות שטבע המפתח סיימון וויליסון, המכונה "הטריפקטה הקטלנית", שגורס שסוכן הופך למסוכן כאשר יש לו בו זמנית גישה לנתונים פרטיים, מעבד קלט לא מהימן ויש לו ערוץ יוצא.
"אבל זה מפחית את המקרה הזה", כתב קפלן. "אתה לא צריך כאן שלוש רגליים. אתה צריך כלי אחד יוצא וסט משקולות שהחליטו בשקט להשתמש בו נגדך. ה'קלט לא מהימן' לא הגיע לדף אינטרנט. הוא ישב במשקולות כל הזמן".
משטח התקפה מתבגר
חוקרים אקדמיים הזהירו מפני חתרנות מודלים במשך שנים, אך קהילת האבטחה אימנה רק לאחרונה את ההתמקדות שלה בנושא, כאשר התקפות שרשרת האספקה של AI בעולם האמיתי החלו להופיע. ה-Register ציין כי האיום לוחץ במיוחד כעת, כאשר הפעלת מודלים בעלי משקל פתוח על חומרה מקומית עברה מעבר לניסויים חובבים לצינורות ארגוניים.
האזהרות אינן תיאורטיות בלבד. מחקר נפרד בתעשייה תיעד פעילות זדונית בפלטפורמות הפצה של AI. Acronis Threat Research Unit, למשל, זיהתה מסעות פרסום בטבע העושים שימוש לרעה במוקדים כמו Hugging Face כדי לספק תוכנות זדוניות במסווה של מודלים, מערכי נתונים והרחבות סוכנים - התקפות שמנצלות אמון במערכות אקולוגיות של AI ולא כל פגם תוכנה בודד.
התכנסות הממצאים הללו מציירת תמונה של משטח התקפה שמתרחב מהר יותר מההגנות נגדו. מודלים בעלי משקל פתוח מחליפים שקיפות בסוג אחר של אטימות: כל אחד יכול להוריד את המשקולות, אבל אף אחד לא יכול לבדוק היטב מה המשקולות האלה יעשו. ומכיוון שכוונון עדין של דלת אחורית הוא זול ומהיר, תוקף נחוש לא צריך להתפשר על דגם דגל מפורסם כדי לגרום נזק - רק אחד מהימן מספיק כדי להימשך לסביבת ייצור.
עבור ארגונים, טוענים חוקרי Semgrep, הלקח הוא לא לנטוש מודלים בעלי משקל פתוח, אלא להתייחס אליהם עם אותה בדיקת מקור שיושמה זה מכבר על תלות בתוכנה: אמת את המקור, עקוב אחר השושלת והנחה שמה שלא ניתן לבדוק עדיין עשוי להיות עוין.
הישאר לפני AI
לדיווח נוסף על אבטחת בינה מלאכותית, בטיחות דגמים והחברות שמעצבות את התחום, עקוב אחר חדשות הבינה המלאכותית שלנו.
קרא עוד חדשות AI →



