रियल-एसडब्ल्यूई नामक एक नया बेंचमार्क चुनौती दे रहा है कि एआई उद्योग कोडिंग क्षमता को कैसे मापता है, और पहले परिणाम अग्रणी प्रयोगशालाओं के लिए निराशाजनक हैं। एंथ्रोपिक का फैबल 5.1, क्लाउड कोड हार्नेस के अंदर चल रहा है, निजी, वास्तविक दुनिया के उद्यम कोडबेस से तैयार किए गए कार्यों पर 38.8% रिज़ॉल्यूशन दर के साथ बोर्ड का नेतृत्व करता है। परीक्षण किया गया कोई भी मॉडल 40 प्रतिशत तक सफल नहीं हुआ।
विशिष्ट लैब्स द्वारा इस महीने जारी किया गया बेंचमार्क, निजी उत्पादन कोडबेस पर फ्रंटियर एआई मॉडल का मूल्यांकन करता है जिसे टीम ने वास्तविक कंपनियों से लाइसेंस प्राप्त किया है। इसके रचनाकारों का तर्क है कि विशेषज्ञ-जनित या सिंथेटिक कार्य, चाहे कितनी भी अच्छी तरह से डिज़ाइन किए गए हों, शब्दशः कार्य नहीं हैं जो वास्तविक कंपनियों के इंजीनियर वास्तव में करते हैं। For more context on this story, see our ongoing more AI stories.
निजी कोडबेस तस्वीर क्यों बदलते हैं
इसके लेखकों के अनुसार, रियल-एसडब्ल्यूई दो अक्षों पर एसडब्ल्यूई-बेंच जैसे स्थापित बेंचमार्क से भिन्न है: अंतर्निहित कोडिंग आर्टिफैक्ट और निर्देश की विशिष्टता। प्रत्येक कार्य एक स्वामित्व प्रणाली से आता है जिसका कोड और समाधान सार्वजनिक इंटरनेट पर उपलब्ध नहीं हैं, जिसका अर्थ है कि एजेंट सार्वजनिक रिपॉजिटरी से निकाले गए याद किए गए उत्तरों पर निर्भर नहीं रह सकते हैं।
कार्यों के व्यावसायिक परिणाम भी होते हैं। बेंचमार्क के उदाहरण कार्यों में सही बिलिंग करना, करों की गणना करना और ग्राहकों को स्थानांतरित करना शामिल है - परिवर्तन जो प्रभावित करते हैं कि व्यवसाय कैसे चलता है, अक्सर कई सेवाओं में। प्रत्येक कंपनी की अपनी परंपराएँ और कोड लिखने के तरीके होते हैं, और एजेंटों को उन मानदंडों को समझना चाहिए और ऐसे बदलाव करने चाहिए जो पहले से मौजूद चीज़ों के साथ काम करें।
"क्या एक कोडिंग एजेंट वास्तव में वास्तविक दुनिया में एक सॉफ्टवेयर इंजीनियर का काम कर सकता है?" बेंचमार्क का परिचय पूछता है। लीडरबोर्ड सुझाव देता है कि उत्तर, अभी के लिए, है: सर्वोत्तम समय में केवल लगभग एक तिहाई।
संपूर्ण लीडरबोर्ड
विशिष्ट लैब्स ने आठ फ्रंटियर मॉडल-और-हार्नेस संयोजनों का मूल्यांकन किया, 95 प्रतिशत विश्वास अंतराल के साथ, प्रति कार्य औसतन आठ स्वतंत्र रन के रूप में रिज़ॉल्यूशन दर को पास@1 के रूप में मापा:
1. कथा 5.1 (क्लाउड कोड) — 38.8%
2. जीपीटी-6 एस्ट्रा (कोडेक्स सीएलआई) - 33.8%
3. मिथुन 3.8 फ़्लैश (मिथुन सीएलआई) — 31.2%
4. जीएलएम 5.3 (क्लाउड कोड) — 28.8%
5. (टाई) ग्रोक 4.6 (ग्रोक बिल्ड) — 23.8%
5. (टाई) म्यूज़िक स्पार्क 1.3 (म्यूज़िक कोड) — 23.8%
7. किमी K3 (किमी कोड) — 18.8%
8. जीपीटी-5.6 सोल (कोडेक्स सीएलआई) - 16.2%
सप्ताहांत में हैकर न्यूज पर परिणामों पर व्यापक रूप से चर्चा की गई, जहां बेंचमार्क ने कई सौ अपवोट प्राप्त किए और इस बारे में जीवंत बहस हुई कि क्या निजी-कोडबेस मूल्यांकन एजेंट की प्रगति के लिए सही पैमाना है।
शीर्ष पर एक संकीर्ण लेकिन सार्थक फैलाव
वर्तमान प्रतिस्पर्धी परिदृश्य के बारे में यह जो कहता है, उसके लिए शीर्ष चार प्रणालियों के बीच का अंतर उल्लेखनीय है। ओपनएआई के जीपीटी-6 एस्ट्रा पर फैबल 5.1 की पांच अंकों की बढ़त एक बेंचमार्क पर सार्थक है जहां हर कार्य एक वास्तविक उत्पादन समस्या है। जेमिनी 3.8 फ़्लैश का तीसरे स्थान पर आना आश्चर्यजनक है, क्योंकि यह मॉडल एक प्रमुख तर्क प्रणाली के बजाय एक तेज़, कम लागत वाले वर्कहॉर्स के रूप में तैनात है। Z.ai का GLM 5.3, क्लाउड कोड के माध्यम से मूल्यांकन किया गया, लीडर के पांच बिंदुओं के भीतर उतरना इस बात को रेखांकित करता है कि व्यावहारिक इंजीनियरिंग कार्य पर ओपन-वेट मॉडल कितने प्रतिस्पर्धी बन गए हैं।
नीचे का फैलाव भी उतना ही बता रहा है। GPT-5.6 Sol, एक पूर्व OpenAI रिलीज़, Fable 5.1 की तुलना में आधे से भी कम कार्यों को हल करता है - यह याद दिलाता है कि सीमा कितनी तेज़ी से आगे बढ़ी है, और केवल एक मॉडल पीढ़ी पीछे कितनी तीव्र गिरावट हो सकती है।
मॉडल जितना ही हार्नेस भी मायने रखता है
बेंचमार्क के पद्धतिगत विकल्पों में से एक ध्यान आकर्षित कर रहा है: अलग-अलग मॉडलों का मूल्यांकन करने के बजाय, रियल-एसडब्ल्यूई देशी हार्नेस - क्लाउड कोड, कोडेक्स सीएलआई, जेमिनी सीएलआई, ग्रोक बिल्ड का उपयोग करता है - यह प्रतिबिंबित करने के लिए कि एंटरप्राइज़ इंजीनियर वास्तव में व्यवहार में कैसे काम करते हैं। लीडरबोर्ड स्पष्ट रूप से मॉडल-और-हार्नेस संयोजनों को रैंक करता है, यह स्वीकार करते हुए कि मचान, टूल एक्सेस और पुनरावृत्ति लूप अब वास्तविक तैनाती में मॉडल क्षमता से अविभाज्य हैं।
सिस्टम चुनने वाले उद्यमों के लिए वह फ़्रेमिंग मायने रखती है। एक ही मॉडल इसके चारों ओर लिपटे एजेंट हार्नेस के आधार पर बहुत अलग तरीके से प्रदर्शन कर सकता है, और सार्वजनिक बेंचमार्क नंबरों पर कोडिंग सहायकों का मूल्यांकन करने वाले खरीदारों को एक विकृत तस्वीर मिल सकती है कि वे सिस्टम अपने कोडबेस पर कैसे व्यवहार करेंगे।
उद्योग के लिए इसका क्या अर्थ है
बेंचमार्क पर बार-बार संतृप्ति का आरोप लगाया गया है, फ्रंटियर मॉडल सार्वजनिक परीक्षणों पर लगभग सही स्कोर पोस्ट करते हैं जो प्रशिक्षण डेटा में लीक हो जाते हैं। रियल-एसडब्ल्यूई का डिज़ाइन एक ही समय में दोनों समस्याओं का मुकाबला करने की कोशिश करता है: कोड निजी और लाइसेंस प्राप्त है, कार्य कार्यशील इंजीनियरिंग टीमों के वास्तविक कार्य उत्पाद हैं, और निर्देश पॉलिश किए गए समस्या विवरणों के बजाय वास्तविक टिकटों की गड़बड़ विशिष्टता को दर्शाते हैं।
गंभीर उपाय पूर्ण स्तर है। यहां तक कि सबसे अच्छी प्रणाली भी पहले प्रयास में दस वास्तविक उद्यम कार्यों में से चार से भी कम का समाधान करती है, औसतन आठ रन से अधिक। एजेंटिक कोडिंग में सभी प्रगति के लिए, बेंचमार्क से पता चलता है कि वास्तविक उत्पादन प्रणालियों पर स्वायत्त सॉफ्टवेयर इंजीनियरिंग एक पर्यवेक्षित गतिविधि बनी हुई है - जहां मानव इंजीनियर विक्रेता डेमो की तुलना में कहीं अधिक बार समीक्षा, पुनर्निर्देशन और मरम्मत करते हैं।
कोडिंग सहायकों के बीच चयन करने वाले उद्यमों के लिए, बेंचमार्क एक व्यावहारिक चेकलिस्ट प्रदान करता है: निजी कोड पर मूल्यांकन किए गए सिस्टम को प्राथमिकता दें, सिंगल-रन हेडलाइन नंबरों के बजाय विश्वास अंतराल पर जोर दें, और कच्चे मॉडल की क्षमता के बराबर वजन दोहन गुणवत्ता। रियल-एसडब्ल्यूई का पहला लीडरबोर्ड अंतिम शब्द नहीं होगा - लेकिन यह उस प्रश्न का अब तक का सबसे सीधा उत्तर है जो प्रत्येक इंजीनियरिंग नेता एजेंटिक कोडिंग के बारे में पूछ रहा है।
कोडिंग एजेंटों, मॉडल रिलीज़ और उन्हें आकार देने वाले शोध के बारे में अधिक जानकारी के लिए, बेंचमार्क परिणामों के अगले दौर के आने पर नवीनतम एआई समाचार का अनुसरण करें।
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →