חברת Benchmarking Artificial Analysis פרסמה את גרסה 4.2 של אינדקס האינטליגנציה שלה ב-4 בספטמבר 2026, עדכון ביניים שמעבד מחדש את אופן מדידת דגמי הבינה המלאכותית - ולפי ה-Leaderboard החדש, קלוד פייבל 5.1 של Anthropic מחזיק במקום הראשון, עם ה-GPT-6 Astra של OpenAI במקום השני על פני Sol a GPT-6 Astra על פני 4-5.

העדכון מגיע שמונה חודשים בלבד לאחר השקת אינדקס v4 בינואר, תפנית מהירה בצורה יוצאת דופן שהחברה מייחסת לקצב השחרורים האחרונים. "עם הגבול שזז כל כך מהר בשבועות האחרונים, אנו מרגישים שחשוב לספק עדכון ביניים מיידי כדי להבטיח שהאינדקס שלנו יישאר רלוונטי ושימושי כתמיד", כתבה החברה בהודעתה.

דירוג הכותרות

לפי התוצאות שפורסמו, קלוד פייבל 5.1 של Anthropic מוביל את המדד, ואחריו ה-GPT-6 Astra של OpenAI, ששיפר ארבע נקודות על פני GPT-5.6 Sol. Meta מדורגת כמעבדה השלישית בחזקה בטבלת ההישגים, ואחריה SpaceXAI, Moonshot/Kimi, Z.AI ו-Google.

Anthropic ו-OpenAI חולקות גם את תמונת היעילות המעודכנת: שתי החברות, יחד עם Meta ו-Z.AI, תופסות את גבול ה-Pareto של "עלות למשימה" של המדד, כלומר אין מעבדה אחרת שמציעה כרגע מודיעין טוב יותר עבור אותו מחיר לכל משימה שהושלמה.

לגבי יעילות אסימון, ניתוח מלאכותי מצא את GPT-6 Astra "יעיל יותר אסימון כמעט מכל דגם אחר ליד גבול המודיעין", כאשר קלוד פייבל 5.1, גרוק 4.5 ו-Gemini 3.5 Flash-Lite יושבים בשני קצוות העקומה. עם זאת, החברה ציינה בניתוח נלווה כי השימוש הנמוך יותר באסימונים של אסטרה מתגבר על המחירים הגבוהים שלה - תזכורת לכך שהיעילות הגולמית והעלות הכוללת לא תמיד נעות יחד.

מה השתנה בגרסה 4.2

השינוי המבני המשמעותי ביותר הוא דחיפה מכוונת נגד גיימינג בנצ'מרק. 40% מהשקלול של המדד מגיע כעת ממערכות מבחנים פרטיות ארוכות - כפול מהנתח ב-v4.1 - כולל AA-Briefcase, AA-Omniscience ופתרונות עבור CritPt. החברה אמרה שהנתון הזה יעלה עוד יותר במדד v5.

שתי הערכות חדשות מעגנים את העדכון:

  • AA-Briefcase, אמת מידה לעבודת ידע סוכן פנימית עם ערכת מבחנים פרטית שנמשכה. מודלים מוערכים בפרויקטים מקצועיים רב-שבועיים, כל אחד עם משימות מקושרות רבות ואלפי קבצי מקור קלט, ומדורגים באמצעות שילוב של ניקוד רובריקי והשוואה זוגית המכסים הצלחה ניתנת לאימות של משימות, איכות אנליטית ואיכות מצגת.
  • GDP.pdf, נוצר על ידי Surge AI, שבודק חשיבה חד פעמית על פני מסמכים מקצועיים: 100 קובצי PDF המשתרעים על פני עשרה תחומים, עם עדויות המופצות על פני 4,592 עמודים של טקסט, טבלאות, תרשימים והערות שוליים. התגובות מדורגות על פי 1,275 קריטריונים אטומיים שנכתבו על ידי מומחה, והכותרת All-pass Rate מזכה משימה רק כאשר כל קריטריון מתקיים.

אמת מידה ותיקה אחת בדרך החוצה: GPQA Diamond, מבחן החשיבה המדעית ברמת תואר שני, הוסר מכיוון שהוא היה רווי ביעילות במודלים חזיתיים.

החברה גם שדרגה את תשתית הדירוג שלה, שחררה את AA-LCR v1.1 עם מקשי תשובה ותוקנו של מערכת דירוג חדשה, עיגנה מחדש את סולם ה-Elo עבור GDPval-AA v2 ו-AA-Briefcase כך שהדירוגים יישארו יציבים ככל שמגיעים דגמים חדשים, והקשחת ארגזי החול של SciCode יספרו לאט, אבל קוד לא יתוקן יותר.

מה הבדיקות החדשות חושפות

התוצאות על ההערכות החדשות מציעות תמונה מפורטת יותר של היכן למעשה עומדות מעבדות הגבול.

ב-AA-Briefcase, קלוד פייבל 5.1 ואופוס 5 של Anthropic מובילים, ואחריהם GPT-6 Astra של OpenAI ו-Muse Spark 1.3 של Meta. GPT-6 Astra צובר בערך 85 נקודות Elo מעל GPT-5.6 Sol באותה הערכה - קפיצה משמעותית בין דורות OpenAI עוקבים.

ב-GDP.pdf התמונה מתהפכת: OpenAI מובילה עם GPT-6 Astra ב-33.2% All-pass Rate, ואחריה GPT-5.6 Sol ב-28.2% וקלוד פייבל 5.1 ב-26.2%. הפער מצביע על כך שסינתזה של מסמכים ארוכי טווח על פני הקשרים גדולים מאוד נותרה כוח יחסי עבור המודל החדש ביותר של OpenAI, אפילו כשהמודלים של Anthropic מובילים את המדד הכולל ומשימות העבודה הסוכניות.

מדוע מערכי מבחן פרטיים חשובים

השינוי לכיוון הערכה מתמשכת משקף בעיית אמינות רחבה יותר בהשוואת AI. ככל שהמודלים ספגו יותר נתוני מבחנים ציבוריים, מעבדות ומשקיפים עצמאיים גדלו יותר ויותר מודאגים מכך שציוני הכותרות על מדדים ידועים משקפים שינון או אימון ממוקד ולא יכולת אמיתית. על ידי שמירה על נתח גדל והולך של מערכי הבדיקה שלה פרטיים ושקלולם כבד יותר, אנליזה מלאכותית מנסה לשמר את האות שלוחות המובילים הציבוריים מאבדים.

החברה אמרה שהיא בונה אלמנטים של Index v5 "במשך חודשים" ועצרה עדכונים בכוונה כדי לשמור על יציבות המדד במהלך הגל האחרון של השקות דגמים מרכזיים. מעבר למהדורת הביניים v4.2, היא מתכננת עדכונים מצטברים נוספים בעתיד הקרוב ככל שהיא משלימה את המעבר v5.

עבור קונים הבוחרים בין דגמי חזית, התוצאה המעשית מ-v4.2 היא שפסגת השוק נותרה מרוץ של שני סוסים בין Anthropic ל-OpenAI, כאשר Meta סוגרת את הפער - ושההערכות שנועדו להיות עמידות לגיימינג עושות כעת יותר את עבודת הדירוג. משתמשים שעוקבים אחר החלטות בחירת מודל יכולים לעקוב אחר פיתוחי הבינה המלאכותית העדכנית ביותר עם התקרבות השקת v5.

הישאר לפני AI

עדכוני בנצ'מרק כמו זה מעצבים מחדש את אופן התקדמות התעשייה. קרא עוד חדשות בינה מלאכותית והישאר לפני כל מהדורת דגמים.

קרא עוד חדשות AI →