דגמי Frontier AI נבדלים זה מזה במידת הקושי לשבור אותם, על פי מדד חדש של עמותת הבטיחות FAR.AI - והפער גדול בהרבה מכפי שרבים שיערו.
ב-29 ביולי השיקה FAR.AI את לוח אבטחת הבינה המלאכותית שלה, ובודקת את אמצעי ההגנה של ארבעה דגמים מובילים בתנאים זהים. קלוד פייבל 5 של Anthropic ו-GPT-5.6 Sol של OpenAI החזיקו מעמד מול ההתקפות, בעוד ש-Grok 4.5 של xAI וה-Gemini 3.1 Pro של גוגל נשברו כל אחד בפחות מ-300 דולר, אמר הארגון. FAR.AI תיאר את ההבדל בין הדגמים החזקים והפחות חזקים כ"פער של פי מאה" בהגנה. For more context on this story, see our ongoing AI news.
לצד ה-leaderboard, FAR.AI הציגה את מה שהיא מכנה ה-Minimal Standard for Safeguards, קו בסיס אבטחה משותף שהורכב כולו מהגנות שמפתחים עמיתים כבר מריצים בייצור. המטרה היא לתת למעבדות רצפת בטון לפגוש - ולהפוך הגנות חלשות לגלות.
הממצאים מהדהדים את מבחני המאמץ הקודמים של FAR.AI. דוח מאי מצא כי אמצעי ההגנה של DeepSeek-V4-Pro "קרסו כמעט לחלוטין", כאשר תוקפים בעלי מיומנות נמוכה עוקפים מנגנוני בטיחות 98-100% מהזמן בכל תחום שנבדק. פריצת jail זמין לציבור שנבנתה עבור קודמו של הדגם עבדה ללא שינוי אחד, מה שמרמז שפגיעויות ידועות לא תועדו.
WIRED, שדיווח על לוח התוצאות, הגיע למסקנה שזה נשאר "קל להחריד לפרוץ כמה דגמי AI גבוליים." ככל שסוכנים לוקחים על עצמם משימות רגישות יותר, הפער מעלה שאלות דוחקות לגבי אילו מערכות בטוחות לפריסה.
לסיקור רציף של מחקר בטיחות ואבטחה של AI, הקוראים יכולים לעקוב אחר AI Buzz Wire.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →