Z.ai, बीजिंग स्थित कृत्रिम बुद्धिमत्ता कंपनी, जिसे जिपू के नाम से भी जाना जाता है, ने GLM-5.3 जारी किया है, जो इसके प्रमुख मॉडल का एक नया संस्करण है, जिसके बारे में कंपनी का कहना है कि यह सॉफ्टवेयर इंजीनियरिंग के लिए अब तक का सबसे सक्षम ओपन-वेट सिस्टम है - और जिसने अप्रत्याशित रूप से दुर्जेय साइबर सुरक्षा कौशल विकसित किया है। 14 अगस्त को घोषित और एक कंपनी ब्लॉग पोस्ट में विस्तृत, जीएलएम-5.3 को जून में जारी अपने पूर्ववर्ती जीएलएम-5.2 के समान लगभग 700-बिलियन-पैरामीटर बेस मॉडल पर बनाया गया है। कंपनी का कहना है कि प्रत्येक सुधार किसी बड़े आधार के बजाय प्रशिक्षण के बाद आता है। यह रिलीज़ चीनी ओपन-वेट मॉडलों की एक श्रृंखला में नवीनतम है, जिसका लक्ष्य एंथ्रोपिक और ओपनएआई के बंद सिस्टमों को मात देना है। एआई बज़ वायर मॉडल ट्रैकर के लिए, जीएलएम-5.3 एक स्पष्ट संकेत है कि ओपन-वेट फ्रंटियर कई अपेक्षाओं की तुलना में कोडिंग अंतर को तेजी से बंद कर रहा है।
प्रशिक्षण के बाद पूरी तरह से लाभ प्राप्त हुआ
Z.ai GLM-5.3 के साथ अपने दृष्टिकोण के बारे में स्पष्ट है: "प्रशिक्षण के बाद स्केलिंग ही हमने किया है।" कंपनी ने जीएलएम-5.2 के साथ पेश किए गए सुदृढीकरण-शिक्षण स्टैक को आगे बढ़ाया - जिसमें कुशल लंबे-संदर्भ प्रसंस्करण के लिए इंडेक्सशेयर, लंबे-क्षितिज कार्यों पर सुदृढीकरण सीखने के लिए एसएओ और बड़े पैमाने पर अतुल्यकालिक प्रशिक्षण के लिए स्लाइम नामक एक ओपन-सोर्स फ्रेमवर्क शामिल है। पिछले महीने में इसने उस स्टैक में अधिक वातावरण, अधिक विविध कार्य और अधिक गणनाएँ डालीं।
कोडिंग बेंचमार्क में भुगतान दिखाई देता है। टर्मिनल बेंच 3.0 पर, जीएलएम-5.3, जीएलएम-5.2 के 4.6 के स्कोर से बढ़कर 28.3 हो गया - छह गुना से अधिक सुधार। यह टर्मिनल बेंच 3.0 और एजेंटों की अंतिम परीक्षा पर ओपन-सोर्स अत्याधुनिक परिणाम पोस्ट करता है, और एजेंटिक क्षमता के एएलई-सीएलआई माप पर 23.8 से 28.5 तक सुधार करता है। Z.ai ने अपने इन-हाउस Z.ai कोड बेंच पर GLM-5.2 की तुलना में 50% सुधार की रिपोर्ट दी है, जो एक निजी बेंचमार्क है जिसे यथार्थवादी विकास वातावरण में कोडिंग एजेंटों का मूल्यांकन करने और सार्वजनिक परीक्षण सेट से संदूषण के जोखिम को कम करने के लिए डिज़ाइन किया गया है।
महत्वपूर्ण रूप से, लाभ बेहतर टोकन दक्षता के साथ आते हैं, न कि केवल बेहतर परिणामों के साथ। उच्च प्रयास पर, GLM-5.3 प्रति कार्य लगभग 50,000 आउटपुट टोकन पर इन-हाउस बेंचमार्क पर 31.4% पूर्णता तक पहुंचता है, जो Z.ai का कहना है कि 120,000 टोकन के साथ 29.5% पर एंथ्रोपिक के क्लाउड ओपस 4.8 से आगे निकल जाता है। जीएलएम-5.3 अभी भी एंथ्रोपिक के अधिक उन्नत क्लाउड फैबल 5 से पीछे है, जो अधिकतम प्रयास पर 39.5% तक पहुंच जाता है।
साइबर क्षमता में एक अप्रत्याशित छलांग
GLM-5.3 का सबसे उल्लेखनीय परिणाम कोडिंग में नहीं बल्कि सुरक्षा में है। जैसा कि Z.ai ने प्रशिक्षण के बाद स्केल किया और प्रशिक्षण मिश्रण में भेद्यता-खोज डेटा और वातावरण पेश किया, उसे उम्मीद थी कि मॉडल खामियों को खोजने और तर्क करने में सुधार करेगा। टीम को आश्चर्य इस बात से हुआ कि वह क्षमता कितनी तेजी से विकसित हुई।
GLM-5.3 केवल अलग-अलग बगों का पता लगाने में ही बेहतर नहीं हुआ; इसने शोषण के कई चरणों पर तर्क करना शुरू किया, और संपूर्ण आक्रमण श्रृंखलाओं के लिए सुसंगत योजनाएँ बनाईं। साइबरजिम पर, एक बेंचमार्क जो परीक्षण करता है कि क्या कोई मॉडल व्हाइट-बॉक्स स्रोत कोड से कमजोरियों की पहचान और सत्यापन कर सकता है, जीएलएम-5.3 का स्कोर 84.5% है, जो जीएलएम-5.2 के 77.2% से अधिक है। यह बेंचमार्क पर सबसे अच्छा परिणाम है, मिथोस 5 83.8% और जीपीटी-5.6 सोल 83.6% से आगे। एक्सप्लॉइटबेंच पर, जो वास्तविक कमजोरियों और उनके शोषण के बारे में गहन तर्क की मांग करता है, GLM-5.3 GLM-5.2 के स्कोर को दोगुना कर देता है, जो 54.4% तक पहुंच जाता है - हालांकि यह 78.0% पर Mythos 5 और 76.5% पर GPT-5.6 Sol से काफी पीछे है।
Z.ai एक सुसंगत पैटर्न को देखता है: शोषण श्रृंखला जितना आगे एक बेंचमार्क बैठता है, GLM-5.2 पर उतना बड़ा लाभ होता है - और बंद सीमा पर शेष अंतर भी उतना ही अधिक होता है। कंपनी का कहना है, "क्षमता ठीक वहीं तेजी से बढ़ रही है जहां हम सबसे पीछे हैं।"
वास्तविक दुनिया की भेद्यता की खोजें
साइबर कौशल बेंचमार्क तक ही सीमित नहीं हैं। Z.ai की रिपोर्ट है कि GLM-5.2 के बाद से, यह वास्तविक दुनिया के कोडबेस के खिलाफ अपने मॉडलों का परीक्षण करने के लिए चीन में कई सुरक्षा टीमों के साथ काम कर रहा है। विशेषज्ञ समीक्षा, स्क्रीनिंग और डिडुप्लीकेशन के बाद, मॉडल ने 269 परियोजनाओं में 2,436 कमजोरियों की पहचान की, जिनमें 1,097 मध्यम से उच्च गंभीरता के मुद्दे शामिल थे। निष्कर्षों में सिस्टम कर्नेल, ऑपरेटिंग सिस्टम, ब्राउज़र इंजन, ओपन-सोर्स इंफ्रास्ट्रक्चर, वेब एप्लिकेशन और नेटवर्क प्रोटोकॉल शामिल हैं - जिनमें से कई वर्षों या यहां तक कि दशकों तक किसी का ध्यान नहीं गया था, सबसे पुराना लगभग 40 साल पुराना है।
एंथ्रोपिक ने अपने स्वयं के मल्टीएजेंट सुरक्षा अनुसंधान में उन परिणामों का वर्णन किया है, जहां एजेंटों के समन्वित झुंडों का उपयोग बड़े पैमाने पर ओपन-सोर्स सॉफ़्टवेयर में कमजोरियों का शिकार करने के लिए किया गया था।
खुला वजन - देरी के साथ
Z.ai का कहना है कि सुरक्षा मूल्यांकन और सख्त होने के बाद, वह दो सप्ताह में GLM-5.3 वज़न जारी करेगा। यह जानबूझकर की गई देरी घोषणा के दौरान चल रहे तनाव को दर्शाती है: एक मॉडल जो अपने रचनाकारों की अपेक्षा से कहीं अधिक तेजी से शक्तिशाली आक्रामक साइबर क्षमताओं को विकसित करता है, बिल्कुल उसी तरह की प्रणाली है जो जिम्मेदार रिलीज के बारे में सवाल उठाती है। कंपनी इस बात पर जोर देती है कि इसकी प्रशिक्षण-रोलआउट स्थिरता को संख्यात्मक परिशुद्धता के उच्च स्तर तक सुधार दिया गया है, और स्केलिंग में अधिकांश कठिनाई मॉडल से यथार्थवादी, सत्यापन योग्य कार्य वातावरण के डिजाइन में स्थानांतरित हो गई है।
प्रतिस्पर्धी तस्वीर साफ़ है. GLM-5.3 कम से कम एक प्रमुख भेद्यता-खोज बेंचमार्क पर स्पष्ट बढ़त का दावा करते हुए कोडिंग और एजेंटिक कार्यों पर बंद सीमा की दूरी को कम करता है। यह एक ओपन-वेट मॉडल के रूप में ऐसा करता है - जिसका अर्थ है कि, एक बार जारी होने के बाद, वज़न किसी के भी डाउनलोड करने, अध्ययन करने और उस पर निर्माण करने के लिए स्वतंत्र रूप से उपलब्ध होगा। क्या वह खुलापन प्रगति को गति देता है या नई सुरक्षा चिंताओं को जन्म देता है, यह एक बहस है कि GLM-5.3 फिर से शुरू होने की गारंटी देता है।
एआई से आगे रहें
नवीनतम एआई मॉडल रिलीज़, बेंचमार्क लड़ाइयों और उद्योग विश्लेषण के लिए, बुकमार्क करें एआई बज़ वायर।
अधिक AI समाचार पढ़ें →