צוות Ornith הוציא לאור את Ornith-1.5, משפחה של מודלים של שפה פתוחה הבנויה סביב רעיון יוצא דופן: המודל מייצר משימות אימון משלו, מעצב פיגומים משלו ולומד מניסיונות הפתרון שלו בלולאה רציפה. על פי הערכות הצוות עצמו, ספינת הדגל Ornith-1.5-397B מקבלת ציונים של 86.1 ב-Terminus-Bench 2.1 (Terminus-2), מה שמציב אותה בשיוויון עם קלוד אופוס 4.8 של Anthropic ב-85.0 ומקדימה כל מודל קוד פתוח אחר בגודל דומה.
המהדורה, שפורסמה השבוע בבלוג של Ornith וב-Huging Face ברישיון MIT, היא המשחה האחרונה במרוץ הבינה המלאכותית בקוד פתוח שהפיק באופן קבוע תוצאות שפעם נחשבו בלתי אפשריים ללא תקציב של מעבדת גבול. עבור מפתחים וארגונים העוקבים אחר החדשות האחרונות של מודל AI, המשמעות היא כפולה: שוויון ההשוואה למודל סגור מוביל, ומתכון הדרכה שמצביע לאן פיתוח המודל הפתוח מוביל בהמשך.
שלושה גדלים, מתכון אחד
Ornith-1.5 נשלח בשלוש תצורות: ספינת דגל של תערובת של 397B פרמטרים של מומחים, 35B MoE שמפעיל רק 3B פרמטרים לכל אסימון, ודגם קומפקטי 9B צפוף עם גרסת "מובייל" כמותית שנועדה לפעול ישירות על מכשירי אייפון ואנדרואיד. שלושתם זמינים ב-Hugging Face לצד בניית GGUF, MLX ו-NVFP4, וכרטיסי הדגם מציינים שהמשפחה בנויה על ארכיטקטורת ה-Qwen3.5 MoE.
השושלת חשובה כאן. Ornith-1.0, ששוחרר מוקדם יותר השנה, הפך את גישת "הפיגום העצמי" לקידוד סוכן והפך ללהיט שקט - מבנה ה-9B GGUF שלו רשם יותר מחמישה מיליון הורדות ב-Huging Face. Ornith-1.5 מרחיב את המסגרת הזו מאופטימיזציה של פיגומים והפצות לצינור שיפור עצמי מלא.
לולאת השיפור העצמי, הסבר
בצנרת קונבנציונלית שלאחר ההכשרה, למידת חיזוק פועלת מול קבוצה קבועה של משימות שנקבעו על ידי אדם. במקום זאת, ב-Ornith-1.5 יש את המודל עצמו להציע משימות חדשות, ליצור פיגום ספציפי למשימה - ההוראות, הכלים ואסטרטגיית הפירוק המשמשים כדי לתקוף את הבעיה - ולאחר מכן לייצר השקות פתרונות שמקבלות ניקוד על ידי הפיגום שזה עתה בנה. התגמול מופץ בכל שלושת השלבים באמצעות GRPO, כך שהמערכת לומדת בו זמנית לכתוב משימות טובות יותר, פיגומים טובים יותר ופתרונות טובים יותר.
התגמול לדור המשימה הוא לב העיצוב. כל משימה מוצעת מקבלת ניקוד על פי שלושה אותות מכפילים: תוקף (האם הפיגום מבצע ומעריך נכון?), קושי גבול (האם שיעור ההצלחה האמפירי של המודל קרוב ליעד של כ-20 אחוז, שמירה על משימות מאתגרות אך ניתנות ללמידה?), וחידוש (האם הוא שונה מספיק מכל דבר במאגר של משימות שנוצרו בעבר?). מכיוון שהקושי נמדד מול שיעור ההצלחה הנוכחי של המודל עצמו, תוכנית הלימודים עולה באופן אוטומטי ככל שהמודל משתפר.
הצוות גם מדווח על אמצעים מפורשים נגד פריצה במהלך הערכה: היסטוריית ה-Git נמחקת מתמונות המאגר כך שמודלים לא יכולים לשחזר פתרונות קודמים, והגישה לרשת מושבתת כדי למנוע ממודלים להביא תשובות חיצוניות. כל התוצאות נמדדות בממוצע על פני חמש ריצות עצמאיות.
המספרים
בקידוד סוכן, תוצאות הדיווח העצמי של ספינת הדגל מתקבצות בראש שדה הקוד הפתוח. ב-Terminal-Bench 2.1 רץ דרך רתמת ה-Terminus-2, 86.1 של Ornith-1.5-397B מוציאים את קלוד אופוס 4.8 (85.0), DeepSeek-V4-Flash-0731 (82.7) ו-GLM-5.2 (81). באותו רף ריצה דרך הרתמה של קלוד קוד, אורנית'-1.5 מציג 85.2 מול 78.9 של אופוס 4.8. ב-SWE-bench Verified, השניים שוויוניים למעשה ב-86.0 ו-85.8, כאשר Kimi K3 מעט מקדימה ב-86.2.
הפערים מתרחבים בסוויטות סוכן קשות יותר. ב-DeepSWE, Ornith-1.5-397B קולע 56.0 - לפני 46.2 של GLM-5.2, אם כי מאחורי אופוס 4.8 (59.0) וקימי K3 (67.5). הקפיצה הבולטת ביותר היא דורית: Ornith-1.0 קיבלה ציון של 8.0 בלבד ב-DeepSWE, כלומר האיטרציה החדשה מספקת שיפור של פי שבעה מאותה משפחת בנצ'מרק.
הדגמים הקטנים יותר מספרים את הסיפור שלהם. Ornith-1.5-35B-A3B, מפעילה רק 3B פרמטרים לכל אסימון, מקבלת ציונים של 68.5 ב-Terminal-Bench 2.1 (Claude Code) לעומת 43.4 עבור Gemma 4-31B של גוגל ו-51.7 עבור Muse Glimmer-30B של Meta, ומפרסמת ב-SWEbench Verified 79. דגם ה-9B מגיע ל-47.0 ב-Terminal-Bench 2.1, 70.6 ב-SWE-bench Verified, ו-86.4 ב-GPQA Diamond - מספרים שמעמידים דגם בדרגת טלפון במרחק בולט מיריבים בדרגת שולחן העבודה.
אזהרות והקשר
אלו הם אמות מידה המנוהלות על ידי מפתחים, לא תוצאות שנבדקו באופן עצמאי, ומודלי ההשוואה הוערכו על ידי צוות Ornith תחת הגדרות הרתמה שלו. מעבדות יריבות גם מתכווננות לפשרות שונות; ההובלה של Kimi K3 ב-DeepSWE מציעה שהגבול של עבודת תוכנה סוכנית עדיין שנוי במחלוקת. אבל שקיפות הטבלה המלאה של המהדורה - ממוצעים של חמישה ריצות, תצורות רתמה שפורסמו, אמצעי הגנה נחשפים - הופכת את השעתוק העצמאי לפשוט בצורה יוצאת דופן.
ההיענות הקהילתית הייתה משמעותית. הודעת השחרור גררה הרבה יותר ממאה נקודות ב-Hacker News בתוך שעות, כאשר הדיון התמקד פחות בטענות המבחן מאשר במתודולוגיית השיפור העצמי, שמספר מגיבים תיארו כאחד מהיישומים הפתוחים היותר אמינים של יצירת משימות בסגנון רקורסיבי.
עבור המערכת האקולוגית של הקוד הפתוח, Ornith-1.5 נוחתת ברגע שבו מודלים פתוחים מהמעבדות של סין וצוותים עצמאיים מערביים סוגרים את הפער עם גבולות סגורים במשימות קידוד ומשימות סוכניות. משפחה בעלת רישיון MIT התואמת דגם סגור מוביל ב-Terminal-Bench - ושולחת גרסת 9B מוכנה לטלפון - מצמצמת את הפער הזה עוד יותר, ועושה זאת בשיטת אימון שכל אחד יכול לבדוק, לשכפל ולהרחיב.
---
הישאר לפני AIקבל את החדשות, הניתוחים ופריצות הדרך האחרונות של AI - הכל במקום אחד.
קרא עוד חדשות AI →