OpenAI דוחפת לאחור לאחר ש-Anthropic של קלוד אופוס 5 שלט במדד ARC-AGI-3, ופרסם תוצאות המראות את דגם ה-GPT-5.6 Sol משלה ב-38.3 אחוזים - בתנאי שאתה משתמש בהגדרות המועדפות של OpenAI ולא ברתום המבחן הרשמי.

המחלוקת, שהתחוללה ב-30 ביולי 2026, חותכת ללב בעיה הולכת וגוברת בהערכת בינה מלאכותית: אמות מידה כבר לא מודדות רק דגם, אלא כל הפיגום הטכני עטוף אותו. לניתוח מעמיק יותר של הפיתוחים האחרונים של AI ושל מהדורות הדגמים, AI Buzz Wire עוקב אחר הסיפור.

המספרים והמלכוד

OpenAI דיווחה כי GPT-5.6 Sol מגיע ל-38.3 אחוזים ב-ARC-AGI-3, מעבר לקלוד אופוס 5 של Anthropic, שזכה ל-30.2 אחוזים לאחר שבעבר הכפיל פי ארבעה את שיא המדד. האזהרה משמעותית: נתון זה של 38.3 אחוז תלוי בשתי תכונות ספציפיות של ה-Responses API של OpenAI.

הראשון הוא Retained Reasoning, המשמר את שרשרת המחשבה של המודל בין צעדים במקום להשליך אותו לאחר כל פעולה. השני הוא קומפקציה, המסכמת הקשר ישן יותר במקום לקצץ אותו, ומאפשרת למודל להמשיך לעבוד על בעיות ארוכות מבלי לאבד הנמקה מוקדמת יותר.

הפעל דרך הרתמה הסטנדרטית הרשמית של ARC Prize - שנמנעת בכוונה מהגדרות ספציפיות לספק כדי להבטיח השוואות בין תפוחים לתפוחים - GPT-5.6 Sol הצליח רק ב-7.8 אחוזים. הסיבה, טוענת OpenAI, היא שההגדרה הרשמית מבטלת את ההיגיון של המודל לאחר כל שלב, ומרסקת את הביצועים במשימות הדורשות חשיבה מתמשכת של רב-שלבים.

אמת מידה שנבנה לטוהר

ARC-AGI-3 תוכנן על ידי פרנסואה צ'ולט וצוות פרס ARC כדי לבחון את יכולתו של מודל לפתור חידות חשיבה חדשות שמעולם לא ראה קודם לכן - מבחן של אינטליגנציה כללית ולא ידע שנשנן. כדי לשמור על השוואות הוגנות, הרתמה הרשמית מסירה בכוונה תכונות ספציפיות לספק, ומודד את יכולת הדגם הגולמי בסביבה ניטרלית.

הטענה הנגדית של OpenAI היא שהניטרליות הזו יכולה להפוך למגבלה. החברה טוענת שהרתמה הרשמית הסתמכה על "API של השלמות בסגנון OpenAI" ישן יותר, חסר יכולות שה-API של קלוד כבר הציע, מה שמציב למעשה את OpenAI בעמדת נחיתות מבנית ביחס לאנתרופיק בהשוואה המקורית.

בעצם, OpenAI אומר: מדדת את הדגם שלנו עם יד אחת קשורה מאחורי גבה.

תגובתו של צ'ולט

מייסד שותף של פרס ARC, פרנסואה צ'ולט, הגיב בשרטוט קו ברור בין שני סוגים של מערכי בדיקה. רתמות "מותאמת אישית כדי לפתור את המדד או המכילות ידע על פורמט המדד" הן אסורות, אמר. אבל הגדרות API למטרות כלליות "שלא פותחו עבור ARC-AGI-3 ושזמינות לכל משתמשי ה-API" הן משחק הוגן.

למעשה, Chollet הודה שציון GPT-5.6 Sol של ARC Prize עצמו שם את OpenAI בעמדת נחיתות. הוא ציין כי לארגון היו "הרבה דברים הלוך ושוב עם OpenAI לגבי הדרך הטובה ביותר לבדוק את הדגמים שלהם, במיוחד בכל הקשור לדחיסה", ובירך על כך שהחברה "החלה להבין את התשובה".

צ'ולט אכן סימן דאגה אחת שנותרה. ספקים שונים המשתמשים בהגדרות שונות יוצרים את מה שהוא כינה "בעיית זוגיות פוטנציאלית" - אבל הוא סבור שזה מקובל "כל עוד ההגדרות והעלות מדווחות בבירור".

למה זה חשוב מעבר ל-Leaderboard

הפרק מדגיש מתח שמעצב מחדש את האופן שבו תעשיית הבינה המלאכותית מעריכה את ההתקדמות. ככל שהדגמים נפרסים יותר ויותר באמצעות ממשקי API עשירי תכונות ולא כמערכות עצמאיות, הגבול בין היכולת הטבועה של המודל לבין ההנדסה סביבו מטשטש כל הזמן. אמת מידה שמתעלמת מפיגומים עשויה להמעיט בביצועים בעולם האמיתי; אחד שמאמץ אותו עשוי לתגמל חברות על המשחקים במבחן.

סביר להניח שהדיון ב-ARC-AGI-3 יהיה האחרון. ככל שדגמי חזית יתקבצו בסמוך לראש מדדים מבוססים, חילוקי הדעות לגבי מה נחשב מדידה הוגנת - ושהרתמה שלהם תקבע את הסטנדרט - רק יתגברו.

הישאר לפני AI

רוצה לעקוב אחר חדשות הבינה המלאכותית על דגמים, מדדים והמעבדות שבונות אותם? AI Buzz Wire סיפק אותך.

קרא עוד חדשות AI