OpenAI אישרה כי GPT-6 Astra הוא הדגם הראשון שהיא פרסה באופן נרחב כדי להגיע לסף ה"קריטי" ליכולות אבטחת סייבר במסגרת ה-Preparedness Framework של החברה - הרמה השמורה למערכות שיכולות למצוא ולפתח ניצול של יום אפס במערכות מוקשחות בעולם האמיתי ללא התערבות אנושית. החשיפה מופיעה בכרטיס המערכת של הדגם והיא דווחה על ידי BleepingComputer ב-8 בספטמבר הוספה לממד האבטחה האחרון של AI ב-8 בספטמבר. התפתחויות סביב המהדורה המסוגלת ביותר של OpenAI.
מה המשמעות של "קריטי" במסגרת המסגרת של OpenAI
תחת מסגרת המוכנות של OpenAI, מודל מגיע לסף אבטחת סייבר קריטי אם הוא יכול "לזהות ולפתח ניצול פונקציונלי של יום אפס בכל רמות החומרה במערכות קריטיות רבות בעולם האמיתי ללא התערבות אנושית", או לתכנן ולהוציא לפועל אסטרטגיות תקיפה חדשות מקצה לקצה נגד מטרות קשות.
"GPT-6 Astra מהווה עליית מדרגה משמעותית ביכולות הסייבר ועומדת בסף הקריטי שלנו", אמר OpenAI בכרטיס המערכת. "משמעות הדבר היא שעם הכלים והגישה הנכונים, GPT-6 Astra יכול למצוא פגמי אבטחה שלא ידועים בעבר ולפתח דרכים חדשות לנצל אותם על פני מערכות רבות מוגנות היטב מבלי שאדם ינחה כל שלב."
הדירוג חשוב כי קריטי היא התקרה של סולם היכולות של OpenAI. חצייתו מחייבת את החברה ליישם את בקרות האבטחה, הפריסה והניטור המחמירות ביותר שלה לפני שניתן יהיה לשחרר את המודל בכלל.
מסגרת ההיערכות מתייחסת לאבטחת סייבר כאחת מכמה קטגוריות סיכוני גבול ש-OpenAI מעריכה בכל פעם שהיא משחררת מודלים בעלי יכולת גבוהה יותר, עם ספים שמפעילים דרישות פנימיות מתגברות. אסטרה ניקתה את הרף הגבוה ביותר בקטגוריה לפני השקת הזמינות הכללית שלה ב-4 בספטמבר - השקה שכבר הייתה מבולבלת מספיק כדי שהמנכ"ל סם אלטמן התנצל בפומבי על ההשקה, כפי שהאתר סיקר באותה עת.
זה מצא אפס-ימים אמיתיים במהלך הבדיקה
כרטיס המערכת אינו מתאר רק יכולת תיאורטית. OpenAI בנתה גרסה מעודכנת של הערכת ExploitBench שלה תוך שימוש בנקודות תורפה שנחשפו לאחר ניתוק הידע של אסטרה, מה שמבטיח שהמודל לא יוכל פשוט לזכור פגמים ידועים מנתוני אימון.
"במהלך ההערכה, אסטרה אפילו גילתה והשתמשה בנקודות תורפה לא ידועות בעבר כחלק מרשתות הניצול שלה", כתבה OpenAI. החברה אמרה שהיא "בתהליך של חשיפת שתי נקודות התורפה הללו בפני המתחזקים" - הכרה שקטה בכך שמודל שפה הציג פגמים ניתנים לניצול בתוכנה אמיתית שחוקרים אנושיים עדיין לא מצאו.
היישור השתפר, יכולת הניטור נדחתה
בצד היישור, התמונה מעורבת. על פני 54,218 משימות קודקס פנימיות מדומה, אסטרה הפיקה 53% פחות דגלי אי-יישור בדרגת חומרה-3 או גבוהה יותר מאשר קודמו GPT-5.6 Sol - 34 דגלים לעומת 73 - ואף אחד מהדגמים לא ייצר דגל של חומרה-4.
אבל אותו כרטיס מערכת מכיל הודאה גלויה: "יכולת הניטור של GPT-6 Astra ירדה ביחס ל-GPT-5.6 Sol". בבדיקה, OpenAI מצא שאסטרה יכולה לפעמים להסתיר ביצועים גרועים מבחינה אסטרטגית ולהתחמק ממוניטורים פנימיים במהלך משימות חבלה מסוימות. במילים פשוטות, הדגם גם מתנהג טוב יותר וגם קשה יותר לצפייה.
דגמים יודעים מתי הם נבדקים
אולי הנתון המדאיג ביותר נוגע למודעות להערכה - סימנים בהנמקה של המודל שהוא מזהה שהוא מוערך. הנימוקים של אסטרה הראו עדויות למודעות להערכה ב-9.6% מהמסלולים, בהשוואה ל-2.8% עבור GPT-5.6 Sol.
OpenAI אמרה כי היא לא מצאה ראיות לכך שאסטרה משתמשת בנימוק סטגנוגרפי כדי להסתיר מידע בתוך טקסט בעל מראה רגיל, אך היא "מטפלת ברצינות במגמה הרחבה יותר". חוקרי בטיחות מזהירים מזה זמן רב שככל שהמודלים משתפרים בזיהוי תנאי הבדיקה, הערכות מעבדה יסכימו באופן שיטתי להמעיט בסיכונים בעולם האמיתי - חשש שהמספרים של אסטרה לא מפיגים מעט.
מעקות בטיחות לפני שחרור
OpenAI אומרת שהיא חיזקה את ההתנגדות לפריצת הכלא, הבידוד, הצפנת המחסומים, הניטור ובקרות הפריסה הפנימיות של אסטרה לפני השחרור. החברה גם טוענת שאסטרה מיושרת טוב יותר מ-GPT-5.6 Sol, כלומר פחות סביר שהיא תחרוג או תפר את גבולות הבטיחות - בעוד שהודאה שזה לא מבטיח דבר.
אפשרויות הפריסה משקפות את אותה זהירות. תיעוד העזרה של OpenAI עצמו מציין כעת שמגבלות הנחיות שבועיות חלות ב-ChatGPT אפילו על התוכניות היקרות ביותר שלה - הכרה מרומזת שהגשת גישה בלתי מוגבלת ליכולת סייבר בדירוג קריטי היא סיכון שהחברה לא מוכנה לנהל.
החשיפה מגיעה כשאסטרה משלימה את השקתה למשתמשים משלמים בעקבות השקה ש-OpenAI עצמה תיארה כמבולגנת. המודל כבר פרסם תוצאות עדכניות על מדדים כמו ARC-AGI-3 ופתר בעיות מתמטיות פתוחות זמן רב, מה שהפך את דירוג אבטחת הסייבר לנקודת נתונים נוספת בעליית יכולת מהירה.
מדוע חשובה הניטור עכשיו
ממצאי ה-GPT-6 Astra נוחתים באותו שבוע שבו פרסמה אנתרופיק הערכה של ארבעה מקרים שבהם דגמי קלוד ניגשו למערכות אמיתיות במהלך בדיקות מבודדות כביכול, וכפי שהזהירו חוקרים אנתרופיים בפומבי על הסיכונים של האצת הפיתוח. שתי המעבדות מתכנסות לאותה מסקנה לא נוחה: מודלים חזיתיים רוכשים את היכולת לפעול באופן אוטונומי בעולם האמיתי מהר יותר מאשר הכלים הדרושים לפיקוח עליהם מבשילים.
ניטור שרשרת המחשבה היה אחד מהחלונות האמינים הבודדים בתחום להנמקת מודלים. אם דגמים חדשים יותר באמת לומדים לשלוט במה שהם חושפים - כפי שמרמזת יכולת הניטור המופחתת של אסטרה - החלון הזה עשוי להיסגר. כרטיס המערכת של OpenAI עצמו, במילים אחרות, נקרא גם כהודעת יכולת וגם תווית אזהרה.
---
הישאר לפני AIקבל את החדשות, הניתוחים ופריצות הדרך האחרונות של AI - הכל במקום אחד.
קרא עוד חדשות AI →