אמת מידה חדשה של חברת אבטחת היישומים Semgrep סיפקה תוצאה בלתי צפויה: מודל בעל משקל פתוח מ-Zhipu AI הסינית עלה על קלוד של Anthropic במציאת פגמי אבטחה אמיתיים בתוכנה. הממצא מוסיף שמן לוויכוח אם ה-AI המסוגל ביותר הוא בהכרח היקר ביותר או המוגבל ביותר.
עם מודל Mythos החזק של Anthropic נעול מאחורי איסור ייצוא של ארה"ב, צוותי אבטחה שמחפשים אלטרנטיבה נגישה פונים לאפשרויות במשקל פתוח כמו GLM 5.2 לקבלת הסיקור העדכני של תעשיית הבינה המלאכותית. המבחן של Semgrep, שפורסם ב-22 ביוני, מצביע על כך שהציד עשוי להשתלם מוקדם מהצפוי.
מה Semgrep בדק
Semgrep העריך שורה של מודלים בעלי משקל פתוח וחזית על בסיס ה-IDOR הפנימי שלה. IDORs - Insecure Direct Object References - הם באגים בקרת גישה המאפשרים למשתמש אחד להגיע לנתונים של משתמש אחר. ידוע לשמצה שקשה לתפוס אותם בניתוח סטטי מסורתי מכיוון שהפגם הוא לוגי ולא תחבירי: הקוד תקף מבחינה טכנית, הוא פשוט חסר בדיקת הרשאות.
החברה חידדה זרימת עבודה לאיתור נקודות תורפה אלו על ידי שילוב של המנוע מבוסס הכללים שלה עם חשיבה של AI. כדי לבודד כמה ביצועים מגיעים מהדגם עצמו לעומת הפיגומים שסביבו, החוקרים הפעילו קבוצה של דגמים פופולריים במשקל פתוח באמצעות רתמה מינימלית - הגדרה Pydantic פשוטה באמצעות אותה הנחיה של IDOR שניתנה לכל דגם, ללא גילוי נקודת קצה וללא ניווט מודרך. ההנחיה הציעה רק אסטרטגיית חיפוש בסיסית וכמה עצות לגבי איך נראה IDOR - קצת יותר מ"הנה הקוד, מצא את הבאגים", אבל הרבה פחות ממה שמקבלים סוכני קידוד הגבולות כשהם פועלים בתוך הצינור המלא של Semgrep.
IDORs הם כאב ראש מתמשך עבור צוותי אבטחת יישומים מכיוון שהם נופלים בסורקים הקונבנציונליים. כלי מבוסס כללים יכול לסמן בדיקת קלט חסר, אבל ההבנה אם נקודת קצה ספציפית באמת חושפת נתונים של משתמש אחר מחייבת נימוקים לגבי ההיגיון העסקי של האפליקציה - בדיוק מסוג השיפוט ההקשרי שמודלים של שפות גדולות טובים בו יותר ויותר.
GLM 5.2 לוקח את ההובלה
הבולט היה GLM 5.2, דגם המשקל הפתוח של Zhipu AI. הוא לא רץ אלא בהנחיה חשופה, והוא השיג 39% F1 בזיהוי IDOR - גבר על 32% של קלוד קוד בשבע נקודות מלאות. לפי Semgrep, הדגם בעל המשקל הפתוח גם עבר את קלוד אופוס 4.8 במשימה, מה שהפך אותו לאופציה החזקה ביותר שאינה חזיתית שנבדקה.
הכלכלה הייתה בולטת באותה מידה. בתמחור של GLM 5.2, הריצה עלתה בערך $0.17 לכל פגיעות שנמצאה. עבור ארגונים שעשויים לסרוק אלפי נקודות קצה, Semgrep ציין שעלות לכל באג היא לעתים קרובות הגורם המכריע בשאלה אם טכניקת זיהוי מעשית בקנה מידה.
מתמודדים אחרים במשקל פתוח השתרכו עוד יותר מאחור. MiniMax M3 קיבל ציון של 23% F1 וקוד Kimi K2.7 נחת ב-22%, שניהם התקבצו הרבה מתחת לקוד של קלוד. Semgrep אפיין את GLM 5.2 כחריג ברור ולא כתוצאה מייצגת עבור קטגוריית המשקל הפתוח.
הרתמה עדיין חשובה
למרות הניצחון במשקל פתוח בקטגוריית ה-raw-prompt, הצינור המיועד של Semgrep עצמו נשאר המוביל הכללי. ההגדרה הרב-מודאלית של החברה - המשלבת חשיבה בינה מלאכותית עם זיהוי מבוסס כללים וספירת נקודות קצה מובנית - השיגה 53% עד 61% F1, בהתאם לתצורה. הפער הזה מדגיש את השאלה המקורית של החוקרים: כמה מביצועי זיהוי הפגיעות הוא המודל, וכמה עולה הארכיטקטורה סביבו?
נראה שהתשובה היא "גם וגם, אבל יותר ממה שאנשים מניחים היא הרתמה." GLM 5.2 הוכיח שדגם בעל יכולת יכול לעשות עבודה משמעותית עם תמיכה מינימלית, אך הוא עדיין לא יכול להתאים למערכת שהונדסה במיוחד עבור הבעיה.
צוות Semgrep - שכלל את החוקרים Paxton-Fear, סת' ג'אקסיק, ברנדן נובליט ואריק ביוקנן - אמרו שהם "המומים באמת" מכך שמודל בעל משקל פתוח המריץ הנחיה חשופה עבר סוכן קידוד גבול במשימת אבטחה כבדה בהיגיון.
מיתוס בבית
לרף יש משקל נוסף על הרקע הגיאופוליטי הנוכחי. כותרת הפוסט בבלוג - "יש לנו מיתוסים בבית" - היא התייחסות נוקבת לעובדה שמודל ה-Mythos ממוקד אבטחת סייבר של Anthropic אינו זמין למעשה לחלק גדול מהעולם. לאחר שממשל טראמפ אסר על אזרחים שאינם ארה"ב להשתמש ב-Mythos ובאחיו המוגבלים, משל 5, צוותי אבטחה גלובליים איבדו גישה למה שנחשב באופן נרחב ל-AI המסוגל ביותר לעבודת אבטחה התקפית והגנתית.
בוואקום הזה, דגמים נגישים במשקל פתוח ממלאים את החסר. העובדה ש-GLM 5.2 - להורדה חופשית וניתנת לפריסה בכל מקום - כבר יכולה להתאים או לנצח מודלים קנייניים במשימות אבטחה ספציפיות, מעידה על כך שהאפקט המצמרר של איסור הייצוא עשוי להיות קטן מהמתוכנן. אם המודל ה"בלתי מוגבל" הטוב ביותר ממשיך להשתפר, הערך האסטרטגי של אגירת יכולות גבול פוחת.
לעת עתה, התוצאה צרה: אמת מידה אחת על מחלקה אחת של פגיעות. אבל זהו אות לכך שגבול המשקל הפתוח נסגר מהר יותר מכפי שרבים שיערו, וכי נגישות - לא יכולת גולמית - עשויה להפוך למשתנה המגדיר בנוף האבטחה של AI.
הממצא גם מעלה שאלות לא נוחות עבור מעבדות גבול. אם מודל זמין חופשי כבר יכול להתאים למערכות קנייניות במשימות חשיבה אבטחה, החפיר התחרותי סביב דגמים סגורים מצטמצם - במיוחד כאשר בקרות הייצוא הופכות את הדגמים הסגורים הללו לבלתי נגישים לחלקי השוק העולמי. מפתחים בעלי משקל פתוח, ללא מגבלות שימוש, יכולים לחזור ולפרוס בכל מקום בו-זמנית.
הישאר לפני AI
הפער בין בינה מלאכותית לבינה בעלת משקל פתוח מצטמצם בעקבות חדשות בינה מלאכותית והמחקר שמעצב מחדש את האבטחה, התשתית והמדיניות.
קרא עוד חדשות AI →


