צוות אבטחה בן שלושה אנשים בחברת הסטארט-אפ Hacktron AI השתמש בקלוד אופוס 5 של Anthropic כדי לפרוץ למערכות הפנימיות של OpenAI, והסתלק עם פרס של 6,500 דולר מתוכנית הבאונטי של OpenAI עצמה. הוול סטריט ג'ורנל דיווח לראשונה על ההפרה ביום חמישי, ו-TechCrunch פרסם דיווח טכני מפורט ביום שישי המבוסס על הכתבה של החוקרים עצמם.

הצוות שרשר יחד שתי נקודות תורפה קריטיות כדי לקבל גישה למספר חשבונות ChatGPT של עובדי OpenAI, מה שהעניק להם כניסה לתוכנה הפנימית של החברה. OpenAI טוענת שהיא פתרה את הבעיות שחשפה האקטרון, אבל הפרק כבר מליץ ויכוח רחב יותר על מידת היכולת של מודלים בינה מלאכותית למצוא ולנצל פגמי אבטחה בעולם האמיתי. For more context on this story, see our ongoing AI industry coverage.

איך התפתח הפריצה

לפי פוסט בבלוג שפירסם חוקרי ה-Hacktron, הדרך אל OpenAI נפתחה ב-25 ביולי באמצעות פגם ב-Discourse, תוכנת הצד השלישי המניעה את פורום הקהילה של OpenAI.

נקודת הכניסה הייתה ארצית להפליא: העלאת תמונה. כאשר משתמשים פרסמו קובצי HEIF או HEIC - פורמטים של תמונות שמכשירי אייפון משתמשים בהם כברירת מחדל - Discourse העביר אותם דרך שרשרת של כלי רקע כדי להמיר אותם לקובצי JPEG סטנדרטיים. התחנה הראשונה הייתה ImageMagick, כלי קוד פתוח בן עשרות שנים לשינוי גודל תמונות. מכיוון ש-ImageMagick לא יכולה להתמודד עם הפורמטים של אפל בעצמה, היא העבירה את הקובץ לספרייה אחרת, libheif.

קבור בתוך ליבהיף היה באג זיכרון. הזנת הספרייה בתמונה מעוצבת במיוחד גרמה לה לחשב שגוי היכן שכבת תמונה אחת ממוקמת על גבי אחרת - מספיק כדי לחטוף את השרת.

מה שהופך את הפגם לא נוח במיוחד עבור קהילת האבטחה הוא שהמפתחים של libheif כבר תיקנו את הבאג חודשים קודם לכן. אבל מכיוון שהתיקון מעולם לא סומן רשמית כחולשה, הוא מעולם לא קיבל מספר CVE, המזהה הסטנדרטי של התעשייה לחולשות אבטחה שמעקבות אחריהם. Hacktron אומר שזה עשוי להסביר מדוע גרסת התוכנה שבה השתמשה Discourse עדיין הייתה פגיעה.

איפה קלוד נכנס

תפקידו של מודל הבינה המלאכותית היה מכריע. החוקרים אמרו שהגרסה של קלוד שבה השתמשו - מבנה מיוחד של Opus 4.8 שזמינה לחוקרי אבטחת סייבר - לא יכולה לייצר ניצול עובד למרות ניסיונות חוזרים ונשנים. זה השתנה כשאנתרופיק הוציאה את אופוס 5.

"Opus 4.8 נאבק בכמה מפגשים כדי לייצר ניצול עובד", כתב האקטרון בפוסט בבלוג שלו. "תוך שעות מהשחרור של אופוס 5, נתנו לו את אותה בעיה וזה הצליח".

לאחר שנכנסו לשרת השיח, הצוות מצא פגם שני שאפשר להם להשתלט על חשבונות ChatGPT ו-Codex של משתמשים, כולל חשבונות השייכים לעובדי OpenAI. "לאחר מכן השתלטנו על חשבון של עובד OpenAI, שהקודקס שלו היה מחובר לארגון GitHub של OpenAI", כתבו החוקרים. בשלב זה הם התריעו גם על OpenAI וגם על Discourse, ששלחו תיקון ב-27 ביולי.

'אם זה יכול לקרות להם, זה יכול לקרות לכל אחד'

מומחי אבטחה טוענים שההנחה היא לא ש-OpenAI התרשלה, אלא שהפריצה בעזרת AI הפכה לזולה ונגישה. "תמורת 200 דולר לחודש, כל אחד יכול להשתמש בכלים האלה ולפרוץ לחברה כמו OpenAI", אמר מאט פרדריקסון, מנכ"ל חברת אבטחת הבינה המלאכותית Grey Swan, ל-TechCrunch. "אם זה יכול לקרות להם - ואני לא חושב שהם מתרפקים לאחרונה על היגיינת אבטחת סייבר - זה יכול לקרות לכל אחד".

TechCrunch גם ציטט את תגובתו של מומחה בינה מלאכותית במדיה החברתית: אם שלושה חוקרים עם מנוי לקלוד יכולים לעשות זאת, השאלה הופכת מה יריב מדינת לאום יכול לעשות עם אותם הכלים.

קפיצת היכולת מושכת את תשומת הלב לאופן שבו דגמים חזיתיים מסודרים. החוקרים ציינו כי קלוד אופוס 5, הדגם שבסופו של דבר פיצח את הבאג, לא התמודד עם סוג של מגבלות יצוא אבטחה שהחילה אנתרופיק על הדגם החדש יותר שלה Mythos 5, שננעל זמנית בגלל חששות לגבי יכולות הפריצה שלו. בצד המשקל הפתוח, עמותת הבטיחות SaferAI גילתה לאחרונה שה-GLM-5.2 של Z.ai היה רק ​​כמה חודשים מאחורי הגבול של יכולות סייבר.

דפוס של כשלי אבטחה מונעי בינה מלאכותית

החשיפה נוחתת ברגע רגיש. זה מגיע מספר שבועות לאחר שסוכני ה-AI של OpenAI שברו את הבלימה במהלך הערכת אבטחת סייבר ופרצו את Hugging Face, תקרית שהראתה סוכני גבול פועלים ביוזמתם נגד תשתית אמיתית. Anthropic, מצידה, חשפה ביולי כי דגמי קלוד שלה ניגשו לאינטרנט במהלך הערכה עקב תצורה שגויה בתוך סביבת בדיקות של צד שלישי - כשל שהחברה ייחסה לכשל באבטחה תפעולית, יחד עם שתי בעיות יישור.

הרגולטורים מגיבים בזמן אמת. ביום שישי, מושל קליפורניה, גאווין ניוסום, חתם על צו ביצוע להאצת הפיקוח העצמאי על חברות בינה מלאכותית ולקדם את יצירת "מתג הרג" חירום עבור דגמי חזית, תוך ציון תקריות אחרונות - כולל מתקפת החיבוק - כראיה לכך שאמצעי הגנה מרצון אינם עומדים בקצב.

מצדה, OpenAI שילמה את הפרס, תיקנה את הפגמים, ומסגרת את הפרק כתוכנית החשיפה האחראית שלה שפועלת כמתוכנן. אבל קשה להתעלם מהמתמטיקה הבסיסית: העלות השולית של עבודת אבטחה התקפית ברמה עילית פשוט ירדה למחיר של מנוי צ'אטבוט פרימיום, והדגמים שעושים את העבודה הזו משפרים את השחרור על פני השחרור.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →