Cognition, החברה מאחורי מהנדס התוכנה Devin AI, השיקה את SWE-2 ביום חמישי, ותיארה אותו כדגם הקידוד המתקדם ביותר שלה עד כה. בפוסט בבלוג שפורסם ב-10 בספטמבר, החברה אמרה כי הדגם החדש דוחף את מה שהיא מכנה את גבול ה-Pareto של יכולת ועלות, כשהוא משיג 50.0% במדד FrontierCode 1.1 Main תוך עלות של 64% פחות מ-Fable 5.1, הדגם האנתרופי שנמצא רק בנקודה אחת לפניו ב-50.9%.

ההשקה נוחתת בקושי יום לאחר ש-Cognition אישרה סבב גיוס של 2 מיליארד דולר לפי שווי של 48 מיליארד דולר, והיא מאותתת באיזו אגרסיביות הסטארט-אפ המקודד הסוכן משקיע בפיתוח מודל משלו במקום להסתמך רק על דגמי צד שלישי. לסיקור רציף של מירוץ קידוד הבינה המלאכותית וכל דבר אחר שמניע את התעשייה, סמן AI Buzz Wire, המקור היומי שלך לחדשות בינה מלאכותית.

היכן SWE-2 נוחת במדדים

על פי התוצאות שפורסמו של Cognition, SWE-2 מציג 50.0% ב-FrontierCode 1.1 Main, לפני Grok 4.6 ב-48.0% ו-GPT-5.6 Sol ב-47.5%, ובמרחק פגיעה מ-GPT-6 Astra, המובילה בתחום ב-53.3%. במדד DeepSWE 1.1, SWE-2 מגיע ל-73.0%, שני רק ל-74.1% של אסטרה מבין הדגמים Cognition.

ההצגה החזקה ביותר מגיעה ב-Terminal-Bench 2.1, שבו SWE-2 זוכה לציון של 92.8%, הנתון הגבוה ביותר בטבלת ההשוואה של Cognition ולפני Fable 5.1 ב-91.4% ו-GPT-6 Astra ב-89.9%. התמונה משתנה ב-Terminal-Bench 4 הקשיח יותר, שבו SWE-2 מנהל 27.3% מול 57.9% עבור GPT-6 Astra ו-55.8% עבור Fable 5.1, תזכורת שהעיצוב הראשון של היעילות של הדגם משאיר מרווח ראש ממש בקצה העליון של קושי המשימה.

קוגניציה מסכמת את המיצוב בצורה בוטה: ב-FrontierCode 1.1 Main ו-DeepSWE 1.1, SWE-2 מנצח את הדגם הקודם שלה SWE-1.7 ו-Grok 4.6 הן בניקוד והן בעלות, מתאים ל-GPT-5.6 Sol ו-Fable 5/5.1 בשבריר ממחירם, ומגיע בטווח של כמה נקודות מ-GPT של רבע.

לאחר הכשרה מ-Kimi K3 בקנה מידה רב-טריליון

SWE-2 אינו בנוי מאפס. קוגניציה הכשירה לאחר הכשרה את הדגם מ-Kimi K3, מודל בסיס של 2.8 טריליון פרמטרים מ-Moonshot AI שכבר עבר למידת חיזוק מקיפה עבור קידוד סוכן. נוסף על הבסיס הזה, Cognition אומרת שתהליך ה-RL שלה הוסיף חמש עד שש נקודות במדדים רבים והעביר את כל גבול העלות-ביצועים של K3.

החברה טוענת ש-SWE-2 היא הפעם הראשונה שהיא מדרגת את למידת החיזוק למשטר של ריבוי טריליון פרמטרים, תוך שהיא מתבססת על תשתית ההדרכה והמתכון שפותח עבור SWE-1.7. התוספת העיקרית היא אלגוריתם RL שמאמן את כל רמות המאמץ של החשיבה בריצה אחת, במקום להתייחס למאמץ נמוך, בינוני וגבוה כמטרות אימון נפרדות.

עונשי עלות מעצבים את כל הגבול

רעיון מרכזי באימונים של SWE-2 הוא קנס עלות ליניארי המוחל לכל רמת מאמץ בתוך ריצת RL אחת, כאשר כל עונש מכוון לשיפוע המקומי של גבול פארטו של הדגם הבסיסי. קוגניציה אומרת שגישה זו, הנגזרת מעקרונות ראשונים, מקדמת את כל גבול העלות-ביצועים של המודל תוך שמירה על צורתו ומשקפת עלויות משתמש אמיתיות בצורה ישירה ככל האפשר בהדרכה.

החברה גם פירטה קו בסיס של תגמול משוקלל באורך שבו השתמשה מאז SWE-1.6, שבו היא מייחסת הכשרה מייצבת משמעותית, לצד שיפורים בהגשה של השקת RL הכוללים מודל טיוטה מקוון להעלאת תפוקת הפענוח. עם ליבות NVFP4 ו-FP8 ואימונים מודעים לכיוונטיזציה, Cognition אומרת שהיא הפחיתה את השימוש הכולל בזיכרון למרות שלדגם הבסיס יש כמעט פי שלושה מהפרמטרים של קודמו.

צינור נתוני האימון התרחב גם כן: קוגניציה שילשה את מספר סביבות ה-RL, הוסיפה שכבות-על עוקבות אחר הוראות ובנתה גלגל תנופה המופעל על-ידי מחסומי SWE-2 קודמות שמקשיחה באופן איטרטיבי את המאמתים המשמשים לציון המודל.

יעילות כמו אינטליגנציה

קוגניציה מסגרת את הרווחים של SWE-2 כקשורים קשר הדוק ליעילות. שיקול דעת הנדסי חזק יותר, אומרת החברה, מאפשר לסוכן לכתוב פתרונות מלאים יותר עם פחות מעקפים וקריאות מיותרות. ב-FrontierCode 1.1 Main, תצורת המאמץ הבינונית של SWE-2 מקבלת ציונים גבוהים יותר מ-SWE-1.7 תוך שהיא לוקחת 58% פחות סיבובים ועולה 81% פחות.

המסגור הזה חשוב לעסק של קוגנישן. Devin נמכר כמהנדס תוכנה אוטונומי, ועלות הסקת מסקנות היא תשומה ישירה לתמחור ולרווחים. מודל שמחזיק באיכות צמודה לגבול תוך חיתוך סיבובים ואסימונים לכל משימה משנה את הכלכלה של כל סשן של Devin שהחברה משרתת.

זמינות

SWE-2 זמין החל מהיום ב-Devin Desktop וב-Devin CLI, עם השקה על Devin Web ו-Fusion בעיצומה, על פי החברה. קוגניציה אומרת שמשתמשים צריכים לראות את המודל מופיע על פני משטחים במהלך הימים הקרובים.

מה זה אומר עבור שוק דגמי הקידוד

המהדורה מהדקת חבילה צפופה כבר מאחורי GPT-6 Astra. Cognition מחזיקה כעת בדגם שסוחר במכות עם הצעות של Anthropic, OpenAI ו-xAI בעלות נמוכה משמעותית, והיא שולטת בכל הערימה מדגם למוצר סוכן. יריבים יתמודדו עם לחץ להגיב על המחיר כמו על היכולת, במיוחד עבור המשימות בנפח גבוה ובדרגת קושי בינונית שבהן פרופיל העלויות של SWE-2 הוא החזק ביותר.

עבור קונים של כלי קידוד בינה מלאכותית, הפתרון המעשית הוא שעזרת קידוד ברמת הגבול אינה דורשת עוד תמחור ברמת הגבול. עבור שאר התעשייה, SWE-2 מהווה עדות לכך שיעילות התשתית שלאחר ההכשרה, לא רק קנה המידה של המודל הבסיסי, הפכו למנוף תחרותי מכריע.

---

הישאר לפני AI

קבל את החדשות, הניתוחים ופריצות הדרך האחרונות של AI - הכל במקום אחד.

קרא עוד חדשות AI →