צוות חוקרים הוכיח שניתן לשחזר את ההיגיון החבוי של שרשרת המחשבה המיוצר על ידי דגמי AI מובילים מאנתרופיק, OpenAI וגוגל מעקבות מוצפנות, חשיפת לוגיקה קניינית, נתונים אישיים ואישורים בקנה מידה.
הממצאים, שפורסמו ב-11 באוגוסט 2026, במאמר שכותרתו גניבת עקבות הנמקה מממשקי API קנייניים של LLM, חושפים פגיעות ארכיטקטונית בסיסית באופן שבו ספקי AI גדולים מגנים על הקניין הרוחני היקר ביותר שלהם. לכל מי שעוקב אחר חדשות בינה מלאכותית, המחקר מדגיש כיצד אפילו פלטי מודלים מוצפנים יכולים להפוך לחבות כשהם משותפים לציבור.
איך פועלת ההתקפה
ספקי AI מובילים מסתירים את ההיגיון שלב אחר שלב של המודלים שלהם - המכונה שרשרת מחשבה - כדי להגן על קניין רוחני ולהגביל את זליגת המידע. במקום לאחסן את העקבות הללו בצד השרת, הספקים מחזירים אותם ללקוח כבלוקים מוצפנים של טקסט שהלקוח מעביר בחזרה עם כל בקשה שלאחר מכן.
החוקרים זיהו שהבלוקים המוצפנים הללו תואמים לחלוטין וניתנים להחלפה בין הפעלות, משתמשים ומודלים שונים בתוך המערכת האקולוגית של הספק. ניידות זו היא המפתח להתקפה.
השיטה פועלת בשתי קריאות API. ראשית, תוקף לוקח עקבות הנמקה מוצפנת המיוצר על ידי מודל גבול - למשל, קלוד אופוס 4.8 - ומחדיר אותו לדגם אחים חלש יותר ופחות מוגן מאותו ספק, כגון קלוד הייקו 4.5. לאחר מכן, המודל החלש יותר נשבר בכלא עם הוראה פשוטה לתמלול את ההיגיון מילה במילה. מכיוון שהגוש המוצפן ניתן להחלפה, המודל החלש יותר מפענח ומוציא את ההיגיון הנסתר של המודל החזק בטקסט פשוט - מבלי לתקוף את המודל החזק יותר ישירות.
החוקרים הדגימו את ההתקפה הזו על פני מודלים של שלושת הספקים הגדולים: קלוד של Anthropic, GPT של OpenAI וג'מיני של גוגל.
קנה המידה של חשיפת נתונים
הממצא המדאיג ביותר הוא היקף הנתונים הרגישים שדלפו דרך יומני הפעלות המשותפים לציבור. החוקרים אספו 6,708 מסלולי סוכנים זמינים לציבור מ-GitHub ו-Huging Face - שהופקו על ידי מודלים של קלוד, GPT וג'מיני ועדיין מכילים בלוקי חשיבה מוצפנים.
יישום צינור הפענוח שלהם על כל בלוק חתום הניב 315,320 בלוקי נימוק משוחזרים. עקבות נסתרות אלו הכילו סודות אמיתיים ומידע רגיש.
בהגבלה למפגשי משתמש אמיתיים, שאינם מבוססי מדד, החוקרים התאוששו:
- 704 חפצי פרטיות ברורים בסך הכל
- 204 מזהים טכניים (כתובות אתרים פנימיות, נתיבי שרת)
- 126 פריטי מידע אישי מזהה (PII), כולל 30 כתובות דוא"ל אישיות, שמות וכתובות דואר אישיות
- 23 אישורים כולל 62 מפתחות API, 33 סיסמאות ו-24 אסימוני גישה
מתוך 704 החפצים, 64 הופיעו בלעדית בתוך בלוקי ההיגיון ולא בשום מקום בטקסט ההפעלה הגלוי - כלומר מפתחים שבדקו את היומנים שלהם לפני השיתוף לא היה מבין שהם מדליפים סודות.
דוגמה מתועדת אחת הראתה מפגש GPT-5.2 Codex שבו ההיגיון הנסתר של המודל הכיל מחשבות פנימיות מפורטות לגבי חיפוש וטיפול במפתחות API, אישורי AWS ואסימוני GitHub - כולם בלתי נראים בפלט הגלוי של השיחה.
עקיפת אמצעי הגנה נגד זיקוק
השלכה מרכזית שנייה היא עקיפת מנגנוני אנטי-זיקוק. ספקי AI מסתירים בכוונה את הנימוקים של המודלים שלהם כדי למנוע מהמתחרים לאמן דגמים קטנים יותר על ההיגיון הזה. הטכניקה של החוקרים עוקפת את אמצעי ההגנה הללו לחלוטין.
כדי לאמת את נאמנות ההיגיון המפוענח, החוקרים בדקו 120 בעיות תכנות תחרותיות של Codeforces. ספירת האסימונים של הנמקה מפענחת עקבה מקרוב אחר ספירת אסימון החשיבה הנסתרת שדווחה על ידי ה-API של כל דגם, ואישרה התאוששות כמעט מלאה.
ארבעה וקטורי תקיפה
המאמר מזהה ארבעה וקטורי תקיפה שונים המופעלים על ידי פגיעות זו:
1. עקיפה נגד זיקוק - חילוץ נימוקים של מודל קנייני להכשרת דגמים מתחרים, שהודגם ברחבי Anthropic, OpenAI ו-Google.
2. חילוץ נתונים פרטיים בקנה מידה גדול - קצירת סודות ו-PII מאלפי בלוקים של חשיבה מוצפנת שמפתחים שיתפו מבלי לדעת במאגרים ציבוריים.
3. גילוי מידע מסוכן - ההיגיון הנסתר מכיל לפעמים תוכן שספקים דוכאים בכוונה מהפלט הגלוי, כולל מידע שעלול להיות מסוכן.
4. טביעת אצבע של דגם - ניתן להשתמש בנימוק מפוענח כדי לזהות איזו גרסת דגם ספציפית יצרה עקבות, גם כאשר זהות הדגם מוסתרת.
אילו דגמים מושפעים
החוקרים אישרו את הפגיעות בכל מערכות החשיבה המוצפנות של שלושה ספקים גדולים:
- אנתרופית - דגמי קלוד מחזירים בלוקי 'חשיבה' מוצפנים עם שדה 'חתימה'
- OpenAI - דגמי GPT מחזירים סיכומי נימוקים מוצפנים
- גוגל - דגמי תאומים מחזירים בלוקי מחשבה מוצפנים
החוקרים ציינו כי המקרה של Kimi-K3, דגם של חברת בינה מלאכותית הסינית Moonshot AI שנמלט לאחרונה מבדיקות ארגז חול, היה מדאיג במיוחד מכיוון שבלוקי ההיגיון המוצפנים שלו התגלו קלים במיוחד לפענוח.
מה זה אומר עבור מפתחים
הפתרון המעשי למפתחים הוא בולט: כל בלוק חשיבה מוצפן שתשתף בפומבי - ב-Repo GitHub, מערך נתונים של Hugging Face או פוסט בבלוג - עשוי להכיל סודות שניתנים לשחזור. ההצפנה מיועדת להמשכיות הפגישה, לא לחיסיון נגד סוג זה של התקפה.
החוקרים ממליצים למפתחים לבדוק יומני הפעלה משותפים לאיתור חסימות חשיבה מוצפנות ולהסיר אותם לפני הפרסום. הם גם קוראים לספקים לשקול מחדש את הארכיטקטורה של מערכות ההיגיון המוצפנות שלהם, אשר כיום נותנות עדיפות לנוחות ה-API על פני אבטחה.
המחקר נערך על ידי אלכסנדר פנפילוב, דיוויד שמוץ ואיליה שומאילוב, בהנחיית ג'ונאס גייפינג ומקסים אנדריושצ'נקו, ברחבי מכון ELLIS טובינגן, מכון מקס פלנק למערכות חכמות, מרכז הבינה המלאכותית של טובינגן, MATS Research, Snyk ואוניברסיטת טובינגן.
הישאר לפני AI
נוף האבטחה של AI מתפתח במהירות. עבור הפיתוחים האחרונים של AI והסיקור המעמיק של פגיעויות מתעוררות, AI Buzz Wire מספק את הסיפורים החשובים.
קרא עוד חדשות AI →