Real-SWE नावाचा एक नवीन बेंचमार्क AI उद्योग कोडिंग क्षमतेचे कसे मोजमाप करतो हे आव्हान देत आहे आणि प्रथम परिणाम फ्रंटियर लॅबसाठी नम्र आहेत. Anthropic's Fable 5.1, Claude Code harness च्या आत चालणारे, 38.8% रिझोल्यूशन रेटसह खाजगी, वास्तविक-जागतिक एंटरप्राइझ कोडबेसेसमधून काढलेल्या कार्यांवर मंडळाचे नेतृत्व करते. चाचणी केलेले कोणतेही मॉडेल 40 टक्के साफ करत नाही.
स्पेसिफिक लॅब्सद्वारे या महिन्यात जारी करण्यात आलेला बेंचमार्क, संघाने वास्तविक कंपन्यांकडून परवाना दिलेल्या खाजगी उत्पादन कोडबेसवर फ्रंटियर एआय मॉडेल्सचे मूल्यांकन करते. त्याचे निर्माते असा युक्तिवाद करतात की तज्ञांनी व्युत्पन्न केलेली किंवा सिंथेटिक कार्ये, जरी चांगली रचना केली असली तरी, वास्तविक कंपन्यांमधील अभियंते प्रत्यक्षात करतात ते शब्दशः काम नाहीत. For more context on this story, see our ongoing AI trends.
खाजगी कोडबेस चित्र का बदलतात
रिअल-एसडब्ल्यूई हे दोन अक्षांवर असलेल्या SWE-बेंच सारख्या स्थापित बेंचमार्कपेक्षा वेगळे आहे, त्याच्या लेखकांनुसार: अंतर्निहित कोडिंग आर्टिफॅक्ट आणि निर्देशांची विशिष्टता. प्रत्येक टास्क प्रोप्रायटरी सिस्टममधून येते ज्याचा कोड आणि सोल्यूशन्स सार्वजनिक इंटरनेटवर उपलब्ध नाहीत, याचा अर्थ एजंट सार्वजनिक भांडारांमधून काढलेल्या लक्षात ठेवलेल्या उत्तरांवर अवलंबून राहू शकत नाहीत.
कार्यांचे व्यावसायिक परिणाम देखील होतात. बेंचमार्कच्या उदाहरणाच्या कार्यांमध्ये बिलिंग योग्य मिळवणे, करांची गणना करणे आणि ग्राहकांचे स्थलांतर करणे यांचा समावेश होतो — जे बदल व्यवसाय कसे चालतात, अनेकदा एकाधिक सेवांवर परिणाम करतात. प्रत्येक कंपनीची स्वतःची नियमावली आणि कोड लिहिण्याच्या पद्धती असतात आणि एजंटांनी ते नियम समजून घेतले पाहिजेत आणि आधीपासून असलेल्या गोष्टींसह कार्य करणारे बदल केले पाहिजेत.
"कोडिंग एजंट वास्तविक जगात सॉफ्टवेअर इंजिनिअरचे काम करू शकतो का?" बेंचमार्कचा परिचय विचारतो. लीडरबोर्ड उत्तर सुचवतो, आत्तासाठी, हे आहे: सर्वोत्तम वेळेच्या फक्त एक तृतीयांश.
संपूर्ण लीडरबोर्ड
विशिष्ट लॅब्सने आठ फ्रंटियर मॉडेल-आणि-हार्नेस संयोजनांचे मूल्यांकन केले, 95 टक्के आत्मविश्वास मध्यांतरांसह, प्रति टास्क आठ स्वतंत्र धावांपेक्षा pass@1 च्या सरासरीने रिझोल्यूशन रेट मोजला:
1. कथा ५.१ (क्लॉड कोड) — ३८.८%
2. GPT-6 Astra (कोडेक्स CLI) — 33.8%
३. जेमिनी ३.८ फ्लॅश (जेमिनी CLI) — ३१.२%
4. GLM 5.3 (क्लॉड कोड) — 28.8%
५. (टाय) ग्रोक ४.६ (ग्रोक बिल्ड) — २३.८%
5. (टाय) म्यूज स्पार्क १.३ (म्युज कोड) — २३.८%
७. किमी के३ (किमी कोड) — १८.८%
8. GPT-5.6 सोल (कोडेक्स CLI) — 16.2%
आठवड्याच्या शेवटी हॅकर न्यूजवर परिणामांची विस्तृत चर्चा केली गेली, जिथे बेंचमार्कने अनेक शंभर अपव्होट्स काढले आणि एजंटच्या प्रगतीसाठी खाजगी-कोडबेस मूल्यांकन योग्य मापदंड आहे की नाही याबद्दल एक सजीव वादविवाद.
वर एक अरुंद पण अर्थपूर्ण पसरलेला
सध्याच्या स्पर्धात्मक लँडस्केपबद्दल जे म्हणते त्यासाठी शीर्ष चार प्रणालींमधील अंतर लक्षणीय आहे. OpenAI च्या GPT-6 Astra वर Fable 5.1 ची पाच-पॉइंट आघाडी एका बेंचमार्कवर अर्थपूर्ण आहे जिथे प्रत्येक कार्य ही वास्तविक उत्पादन समस्या आहे. जेमिनी 3.8 फ्लॅश टेकिंग तिसरे लक्षवेधक आहे, कारण मॉडेल फ्लॅगशिप रिजनिंग सिस्टमऐवजी वेगवान, कमी किमतीच्या वर्कहॉर्स म्हणून स्थित आहे. Z.ai चे GLM 5.3, क्लॉड कोडद्वारे मूल्यमापन केलेले, लीडरच्या पाच पॉइंट्समध्ये उतरणे, व्यावहारिक अभियांत्रिकी कार्यात स्पर्धात्मक ओपन-वेट मॉडेल्स कसे बनले आहेत हे अधोरेखित करते.
तितकेच सांगणे तळाशी पसरलेले आहे. GPT-5.6 Sol, पूर्वीचे OpenAI प्रकाशन, Fable 5.1 पेक्षा निम्म्याहून कमी कार्यांचे निराकरण करते - सीमा किती वेगाने हलली आहे आणि ड्रॉप-ऑफ किती तीव्र आहे याची आठवण करून देणारी एक मॉडेल जनरेशन बॅक असू शकते.
हार्नेस हे मॉडेल्सइतकेच महत्त्वाचे आहे
बेंचमार्कच्या पद्धतशीर निवडींपैकी एक लक्ष वेधून घेत आहे: मॉडेलचे अलगावमध्ये मूल्यांकन करण्याऐवजी, एंटरप्राइझ अभियंते प्रत्यक्ष व्यवहारात कसे कार्य करतात हे प्रतिबिंबित करण्यासाठी Real-SWE नेटिव्ह हार्नेस — क्लॉड कोड, कोडेक्स CLI, जेमिनी CLI, Grok बिल्ड — वापरते. लीडरबोर्ड स्पष्टपणे मॉडेल-आणि-हार्नेस कॉम्बिनेशन्सची रँक करतो, हे कबूल करतो की स्कॅफोल्डिंग, टूल ऍक्सेस आणि पुनरावृत्ती लूप आता वास्तविक तैनातीमधील मॉडेल क्षमतेपासून अविभाज्य आहेत.
एंटरप्राइझसाठी सिस्टम निवडण्यासाठी ते फ्रेमिंग महत्त्वाचे आहे. तेच मॉडेल त्याच्याभोवती गुंडाळलेल्या एजंट हार्नेसच्या आधारावर खूप वेगळ्या पद्धतीने कार्य करू शकते आणि सार्वजनिक बेंचमार्क क्रमांकांवर कोडिंग सहाय्यकांचे मूल्यमापन करणाऱ्या खरेदीदारांना त्या सिस्टम त्यांच्या स्वतःच्या कोडबेसवर कसे वागतील याचे विकृत चित्र मिळू शकते.
उद्योगासाठी याचा अर्थ काय आहे
बेंचमार्कवर वारंवार संपृक्ततेचा आरोप करण्यात आला आहे, ज्यामध्ये फ्रंटियर मॉडेल्स सार्वजनिक चाचण्यांवर जवळपास-परिपूर्ण स्कोअर पोस्ट करतात जे प्रशिक्षण डेटामध्ये लीक करतात. Real-SWE ची रचना एकाच वेळी दोन्ही समस्यांचा सामना करण्याचा प्रयत्न करते: कोड खाजगी आणि परवानाकृत आहे, कार्ये ही कार्यरत अभियांत्रिकी कार्यसंघांची वास्तविक कार्य उत्पादने आहेत आणि सूचना पॉलिश समस्या विधानांऐवजी वास्तविक तिकिटांची गोंधळलेली विशिष्टता दर्शवतात.
विचारी टेकअवे ही परिपूर्ण पातळी आहे. अगदी सर्वोत्कृष्ट प्रणाली पहिल्या प्रयत्नात, आठ धावांच्या सरासरीने, दहा वास्तविक एंटरप्राइझ कार्यांपैकी चार पेक्षा कमी निराकरण करते. एजंटिक कोडिंगमधील सर्व प्रगतीसाठी, बेंचमार्क सूचित करतो की वास्तविक उत्पादन प्रणालीवरील स्वायत्त सॉफ्टवेअर अभियांत्रिकी ही एक पर्यवेक्षित क्रियाकलाप राहते - जिथे मानवी अभियंते विक्रेत्याच्या डेमोपेक्षा कितीतरी जास्त वेळा पुनरावलोकन करतात, पुनर्निर्देशित करतात आणि दुरुस्ती करतात.
कोडिंग सहाय्यकांमधून निवडलेल्या उपक्रमांसाठी, बेंचमार्क एक व्यावहारिक चेकलिस्ट ऑफर करतो: खाजगी कोडवर मूल्यमापन केलेल्या सिस्टमला प्राधान्य द्या, एकल-रन हेडलाइन क्रमांकांऐवजी आत्मविश्वास मध्यांतरांवर जोर द्या आणि कच्च्या मॉडेल क्षमतेइतकी वजन हार्नेस गुणवत्ता. रिअल-एसडब्ल्यूईचा पहिला लीडरबोर्ड हा शेवटचा शब्द नसेल — परंतु प्रत्येक अभियांत्रिकी नेता एजंटिक कोडिंगबद्दल विचारत असलेल्या प्रश्नाचे हे सर्वात थेट उत्तर आहे.
कोडिंग एजंट्स, मॉडेल रिलीझ आणि त्यांना आकार देणारे संशोधन यावर अधिक माहितीसाठी, बेंचमार्क निकालांची पुढील फेरी आल्यावर नवीनतम AI बातम्यांचे अनुसरण करा.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →