कॉग्निशन, डेव्हिन एआय सॉफ्टवेअर इंजिनीअरच्या मागे असलेल्या कंपनीने गुरुवारी SWE-2 लाँच केले, त्याचे आतापर्यंतचे सर्वात प्रगत कोडिंग मॉडेल म्हणून वर्णन केले. 10 सप्टेंबर रोजी प्रकाशित झालेल्या एका ब्लॉग पोस्टमध्ये, कंपनीने म्हटले आहे की नवीन मॉडेल क्षमता आणि किमतीच्या पॅरेटो फ्रंटियरला पुढे ढकलते, FrontierCode 1.1 मुख्य बेंचमार्कवर 50.0% स्कोअर करते, तर Fable 5.1 पेक्षा 64% कमी खर्च येतो, मानववंशीय मॉडेल जे त्याच्यापेक्षा फक्त एक पॉइंट पुढे बसते.90%.

कॉग्निशनने $2 बिलियन फंडिंग राउंडला $48 बिलियन व्हॅल्युएशनची पुष्टी केल्याच्या अवघ्या एक दिवसानंतर लॉन्च झाला आणि हे सूचित करते की एजंटिक कोडिंग स्टार्टअप केवळ तृतीय-पक्ष फ्रंटियर मॉडेल्सवर अवलंबून न राहता स्वतःच्या मॉडेल डेव्हलपमेंटमध्ये किती आक्रमकपणे गुंतवणूक करत आहे. AI कोडींग शर्यतीच्या सतत कव्हरेजसाठी आणि इतर सर्व गोष्टींसाठी, AI बझ वायर](https://aibuzzwire.news) बुकमार्क करा, AI बातम्यांच्या ब्रेकिंगसाठी तुमचा दैनंदिन स्रोत.

जेथे SWE-2 बेंचमार्कवर उतरतो

कॉग्निशनच्या प्रकाशित परिणामांनुसार, FrontierCode 1.1 Main वर SWE-2 ने 50.0% पोस्ट केले, Grok 4.6 च्या पुढे 48.0% आणि GPT-5.6 Sol 47.5% वर आणि GPT-6 Astra च्या स्ट्राइकिंग अंतरावर, जे 53.3% ने फील्डमध्ये आघाडीवर आहे. DeepSWE 1.1 बेंचमार्कवर, SWE-2 हे 73.0% पर्यंत पोहोचले आहे, जे Astra च्या 74.1% मॉडेल्स कॉग्निशन लिस्टमध्ये दुसऱ्या स्थानावर आहे.

सर्वात मजबूत प्रदर्शन टर्मिनल-बेंच 2.1 वर येते, जेथे SWE-2 ने 92.8% स्कोअर केले, कॉग्निशनच्या तुलना सारणीतील सर्वोच्च आकृती आणि Fable 5.1 च्या पुढे 91.4% आणि GPT-6 Astra 89.9%. कठिण टर्मिनल-बेंच 4 वर चित्र बदलते, जिथे SWE-2 GPT-6 Astra साठी 57.9% विरुद्ध 27.3% आणि Fable 5.1 साठी 55.8% व्यवस्थापित करते, हे स्मरणपत्र आहे की मॉडेलची कार्यक्षमता-प्रथम डिझाइन कार्य अडचणीच्या अगदी वरच्या बाजूला हेडरूम सोडते.

कॉग्निशन पोझिशनिंगची बेरीज स्पष्टपणे करते: फ्रंटियरकोड 1.1 मेन आणि डीपएसडब्ल्यूई 1.1 वर, SWE-2 त्याच्या मागील मॉडेल SWE-1.7 आणि Grok 4.6 ला स्कोअर आणि खर्च दोन्हीवर मागे टाकते, GPT-5.6 Sol आणि Fable 5/5.1 शी त्यांच्या किमतीच्या काही अंशाने जुळते आणि A6 बिंदूच्या GPT च्या काही अंशांमध्ये येते. खर्च

मल्टी-ट्रिलियन स्केलवर किमी K3 कडून पोस्ट-प्रशिक्षित

SWE-2 सुरवातीपासून तयार केलेले नाही. कॉग्निशनने किमी K3 मधील मॉडेलला प्रशिक्षण दिले, मूनशॉट AI मधील 2.8-ट्रिलियन-पॅरामीटर बेस मॉडेल ज्याने आधीच एजंटिक कोडिंगसाठी व्यापक मजबुतीकरण शिक्षण घेतले होते. त्या पायावर, कॉग्निशन म्हणते की तिच्या RL प्रक्रियेने अनेक बेंचमार्कवर पाच ते सहा गुण जोडले आणि K3 ची संपूर्ण किंमत-कार्यप्रदर्शन सीमा बदलली.

कंपनीचे म्हणणे आहे की SWE-2 ही पहिलीच वेळ आहे ज्याने मल्टी-ट्रिलियन-पॅरामीटर रेजिममध्ये मजबुतीकरण शिक्षण स्केल केले आहे, प्रशिक्षण पायाभूत सुविधा आणि SWE-1.7 साठी विकसित केलेल्या रेसिपीवर आधारित आहे. मुख्य जोड म्हणजे एक RL अल्गोरिदम जो कमी, मध्यम आणि उच्च प्रयत्नांना स्वतंत्र प्रशिक्षण लक्ष्य मानण्याऐवजी सर्व तर्क-प्रयत्न स्तरांना एकाच रनमध्ये प्रशिक्षित करतो.

खर्च दंड संपूर्ण सीमांना आकार देतात

SWE-2 च्या प्रशिक्षणातील एक मध्यवर्ती कल्पना म्हणजे एका RL रनमध्ये प्रत्येक प्रयत्न स्तरावर लागू केलेला एक रेषीय खर्च दंड आहे, प्रत्येक दंड बेस मॉडेलच्या पॅरेटो फ्रंटियरच्या स्थानिक उतारावर ट्यून केला जातो. कॉग्निशन म्हणते की हा दृष्टीकोन, पहिल्या तत्त्वांवरून व्युत्पन्न केलेला, मॉडेलच्या संपूर्ण खर्च-कार्यक्षमतेच्या सीमारेषेला त्याचा आकार जतन करून आणि प्रत्यक्ष वापरकर्त्याच्या खर्चास प्रशिक्षणात शक्य तितक्या थेट परावर्तित करते.

कंपनीने SWE-1.6 पासून वापरलेल्या लांबी-वेटेड रिवॉर्ड बेसलाइनचे तपशीलवार वर्णन केले आहे, ज्याचे श्रेय ते लक्षणीयरित्या स्थिर प्रशिक्षण देते, RL रोलआउट सर्व्हिंगमधील सुधारणांसह ज्यामध्ये डीकोडिंग थ्रूपुट वाढविण्यासाठी ऑनलाइन मसुदा मॉडेल समाविष्ट आहे. NVFP4 आणि FP8 कर्नल आणि क्वांटायझेशन-अवेअर ट्रेनिंगसह, कॉग्निशन म्हणते की बेस मॉडेलमध्ये त्याच्या पूर्ववर्तीपेक्षा जवळजवळ तिप्पट पॅरामीटर्स असूनही एकूण मेमरी वापर कमी केला.

प्रशिक्षण डेटा पाइपलाइन देखील विस्तारित झाली: कॉग्निशनने RL वातावरणाची संख्या तिप्पट केली, सूचना-खालील आच्छादन जोडले आणि मागील SWE-2 चेकपॉइंट्सद्वारे समर्थित फ्लायव्हील तयार केले जे मॉडेल स्कोअर करण्यासाठी वापरल्या जाणाऱ्या सत्यापनकर्त्यांना पुनरावृत्तीने कठोर करते.

बुद्धिमत्तेइतकी कार्यक्षमता

कॉग्निशन SWE-2 च्या नफ्यांना कार्यक्षमतेशी जवळून जोडलेले आहे. मजबूत अभियांत्रिकी निर्णय, कंपनी म्हणते, एजंटला कमी वळण आणि निरर्थक वाचनांसह अधिक संपूर्ण समाधाने लिहू देते. FrontierCode 1.1 Main वर, SWE-2 चे मध्यम-प्रयत्न कॉन्फिगरेशन SWE-1.7 पेक्षा जास्त स्कोअर करते आणि 58% कमी वळण घेते आणि 81% कमी खर्च करते.

ते फ्रेमिंग कॉग्निशनच्या व्यवसायासाठी महत्त्वाचे आहे. डेव्हिनला स्वायत्त सॉफ्टवेअर अभियंता म्हणून विकले जाते आणि अनुमान खर्च ही किंमत आणि मार्जिनसाठी थेट इनपुट आहे. प्रति कार्य वळण आणि टोकन कापताना सीमा-लगतची गुणवत्ता ठेवणारे मॉडेल कंपनीने सेवा देत असलेल्या प्रत्येक डेविन सत्राचे अर्थशास्त्र बदलते.

उपलब्धता

SWE-2 आजपासून डेविन डेस्कटॉप आणि डेविन CLI मध्ये उपलब्ध आहे, कंपनीच्या म्हणण्यानुसार, Devin Web आणि Fusion वर रोलआउट सुरू आहे. कॉग्निशन म्हणते की वापरकर्त्यांनी येत्या काही दिवसांत हे मॉडेल सर्व पृष्ठभागांवर दिसले पाहिजे.

कोडिंग मॉडेल मार्केटसाठी याचा अर्थ काय आहे

रिलीझ GPT-6 Astra मागे आधीच गर्दीचा पॅक घट्ट करते. कॉग्निशनकडे आता एका मॉडेलची मालकी आहे जी एंथ्रोपिक, ओपनएआय आणि xAI कडून अगदी कमी किमतीत ऑफरसह व्यापार करते आणि ते मॉडेलपासून एजंट उत्पादनापर्यंत संपूर्ण स्टॅक नियंत्रित करते. प्रतिस्पर्ध्यांना क्षमतेप्रमाणे किंमतीला प्रतिसाद देण्यासाठी दबावाचा सामना करावा लागेल, विशेषत: उच्च-खंड, मध्यम-कठीण कार्यांसाठी जेथे SWE-2 ची किंमत प्रोफाइल सर्वात मजबूत आहे.

AI कोडिंग टूल्सच्या खरेदीदारांसाठी, व्यावहारिक टेकअवे हे आहे की फ्रंटियर-लेव्हल कोडिंग मदतीला यापुढे फ्रंटियर-लेव्हल किंमतीची आवश्यकता नाही. उर्वरित उद्योगांसाठी, SWE-2 हा पुरावा आहे की प्रशिक्षणानंतरची आणि पायाभूत सुविधांची कार्यक्षमता, केवळ बेस मॉडेल स्केलच नव्हे तर, एक निर्णायक स्पर्धात्मक लीव्हर बनले आहे.

---

एआयच्या पुढे राहा

नवीनतम AI बातम्या, विश्लेषण आणि यश मिळवा — सर्व एकाच ठिकाणी.

अधिक AI बातम्या वाचा →