אמת מידה חדשה בשם Real-SWE מאתגרת את האופן שבו תעשיית הבינה המלאכותית מודדת את יכולת הקידוד, והתוצאות הראשונות משפילות את מעבדות החזית. Fable 5.1 של Anthropic, הפועל בתוך רתמת Claude Code, מוביל את הלוח עם קצב רזולוציה של 38.8% במשימות שנלקחו מבסיסי קוד ארגוניים פרטיים בעולם האמיתי. אף דגם שנבדק לא מנקה 40 אחוז.

המדד, שפורסם החודש על ידי מעבדות ספציפיות, מעריך מודלים של בינה מלאכותית על בסיסי קוד ייצור פרטיים שהצוות קיבל רישיון מחברות אמיתיות. יוצריו טוענים כי משימות שנוצרו על ידי מומחים או סינתטיות, מעוצבות היטב ככל שיהיו, אינן העבודה מילה במילה שמהנדסים בחברות אמיתיות עושים בפועל. For more context on this story, see our ongoing breaking AI news.

מדוע בסיסי קוד פרטיים משנים את התמונה

Real-SWE שונה מבנצ'מרקים מבוססים כמו SWE-bench בשני צירים, לפי מחבריו: חפץ הקידוד הבסיסי והספציפיות של ההוראה. כל משימה מגיעה ממערכת קניינית שהקוד והפתרונות שלה אינם זמינים באינטרנט הציבורי, מה שאומר שסוכנים לא יכולים להישען על תשובות משוננות שנשלפו ממאגרים ציבוריים.

למשימות יש גם השלכות עסקיות. המשימות לדוגמה של המדד כוללות חיוב נכון, חישוב מסים והעברת לקוחות - שינויים המשפיעים על אופן ניהול העסק, לעתים קרובות על פני מספר שירותים. לכל חברה יש את המוסכמות והדרכים שלה לכתיבת קוד, והסוכנים חייבים להבין את הנורמות הללו ולבצע שינויים שפועלים עם מה שכבר קיים.

"האם סוכן קידוד יכול באמת לעשות את העבודה של מהנדס תוכנה בעולם האמיתי?" שואל המבוא של המדד. לוח התוצאות מציע שהתשובה, לעת עתה, היא: רק כשליש מהמקרים במקרה הטוב.

ה-Leaderboard המלא

מעבדות ספציפיות העריכו שמונה שילובי מודל-רתום חזיתיים, מדדו את שיעור הרזולוציה כ-pass@1 בממוצע על פני שמונה ריצות עצמאיות למשימה, עם רווחי סמך של 95 אחוזים:

1. משל 5.1 (קוד קלוד) - 38.8%
2. GPT-6 Astra (Codex CLI) — 33.8%
3. Gemini 3.8 Flash (Gemini CLI) — 31.2%
4. GLM 5.3 (קוד קלוד) - 28.8%
5. (שוויון) Grok 4.6 (Grok Build) - 23.8%
5. (עניבה) Muse Spark 1.3 (קוד מוזה) - 23.8%
7. Kimi K3 (Kimi Code) - 18.8%
8. GPT-5.6 Sol (Codex CLI) — 16.2%

התוצאות נדונו בהרחבה ב-Hacker News במהלך סוף השבוע, שם המדד גרר כמה מאות הצבעות בעד ווויכוח ער על האם הערכת בסיס קוד פרטי היא המדד הנכון להתקדמות הסוכן.

פריסה צרה אך בעלת משמעות בראש

הפער בין ארבע המערכות המובילות בולט במה שהוא אומר על הנוף התחרותי הנוכחי. יתרון חמש נקודות של Fable 5.1 על GPT-6 Astra של OpenAI הוא משמעותי ברף שבו כל משימה היא בעיית ייצור אמיתית. Gemini 3.8 פלאש שהגיע למקום השלישי הוא מדהים, מכיוון שהדגם ממוקם כסוס עבודה מהיר ובעלות נמוכה ולא כמערכת חשיבה דגל. ה-GLM 5.3 של Z.ai, שהוערך באמצעות קלוד קוד, נוחת בטווח של חמש נקודות מהמנהיג מדגיש עד כמה מודלים בעלי משקל פתוח הפכו תחרותיים לעבודה הנדסית.

לא פחות חשוב הוא הממרח בתחתית. GPT-5.6 Sol, מהדורה מוקדמת יותר של OpenAI, פותר פחות מחצי משימות משל Fable 5.1 - תזכורת לכמה מהר הגבול זז, וכמה תלולה הירידה יכולה להיות רק דור אחד אחורה.

רתמות חשובות לא פחות מהדגמים

אחת הבחירות המתודולוגיות של המדד היא משיכת תשומת לב: במקום להעריך מודלים בנפרד, Real-SWE משתמשת ברתום מקורי - קלוד קוד, Codex CLI, Gemini CLI, Grok Build - כדי לשקף את האופן שבו מהנדסי ארגונים עובדים בפועל. ה-Leaderboard מדרג במפורש את שילובי הדגם והרתמה, תוך הכרה בכך שפיגומים, גישה לכלים ולולאות איטרציה אינן ניתנות להפרדה מיכולת המודל בפריסות אמיתיות.

המסגור הזה חשוב לארגונים הבוחרים במערכות. אותו דגם יכול לתפקד בצורה שונה מאוד בהתאם לרתמת הסוכנים העוטפת אותו, וקונים שמעריכים את עוזרי הקידוד לפי מספרי מדד ציבורי עשויים לקבל תמונה מעוותת של האופן שבו מערכות אלו יתנהגו בבסיסי הקוד שלהם.

מה זה אומר עבור התעשייה

מדדי מידה הואשמו שוב ושוב ברוויה, כאשר מודלים גבוליים מפרסמים ציונים כמעט מושלמים במבחנים ציבוריים שדולפים לנתוני אימונים. העיצוב של Real-SWE מנסה להתמודד עם שתי הבעיות בבת אחת: הקוד הוא פרטי ומורשה, המשימות הן תוצרי עבודה אמיתיים של צוותי הנדסה עובדים, וההוראות משקפות את הספציפיות המבולגנת של כרטיסים אמיתיים ולא הצהרות בעיה מלוטשות.

הטייק אווי המפכח הוא הרמה המוחלטת. אפילו המערכת הטובה ביותר פותרת פחות מארבע מתוך עשר משימות ארגוניות אמיתיות בניסיון הראשון, בממוצע על פני שמונה ריצות. למרות כל ההתקדמות בקידוד סוכן, המדד מצביע על כך שהנדסת תוכנה אוטונומית על מערכות ייצור אמיתיות נשארה פעילות מפוקחת - כזו שבה מהנדסי אנוש בודקים, מפנים ומתקנים לעתים קרובות הרבה יותר ממה שהדגמות של ספקים מרמזות.

עבור ארגונים הבוחרים בין עוזרי קידוד, המדד מציע רשימת בדיקה מעשית: העדיפו מערכות המוערכות על קוד פרטי, התעקשו על רווחי סמך ולא על מספרי כותרות בריצה אחת, ואיכות רתמת המשקל לא פחות מיכולת הדגם הגולמי. ה-Leaderboard הראשון של Real-SWE לא יהיה המילה האחרונה - אבל זו התשובה הישירה ביותר עד כה לשאלה שכל מנהיג הנדסי שואל לגבי קידוד סוכן.

למידע נוסף על סוכני קידוד, מהדורות מודלים והמחקר המעצב אותם, עקוב אחר חדשות הבינה המלאכותית העדכניות כשהסבב הבא של תוצאות ההשוואה מגיע.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →