Z.ai, बीजिंग-आधारित कृत्रिम बुद्धिमत्ता कंपनी, ज्याला Zhipu म्हणूनही ओळखले जाते, GLM-5.3 जारी केले आहे, हे त्याच्या फ्लॅगशिप मॉडेलचे एक नवीन पुनरावृत्ती आहे जे कंपनी म्हणते की सॉफ्टवेअर अभियांत्रिकीसाठी तिची सर्वात सक्षम ओपन-वेट प्रणाली आहे — आणि ज्याने अनपेक्षितपणे भयंकर सायबर सुरक्षा कौशल्ये विकसित केली आहेत. 14 ऑगस्ट रोजी घोषित केलेले आणि कंपनीच्या ब्लॉग पोस्टमध्ये तपशीलवार, GLM-5.3 हे जूनमध्ये रिलीझ झालेल्या त्याच्या पूर्ववर्ती GLM-5.2 प्रमाणेच अंदाजे 700-अब्ज-पॅरामीटर बेस मॉडेलवर तयार केले आहे. प्रत्येक सुधारणा, कंपनी म्हणते की, मोठ्या पाया ऐवजी प्रशिक्षणानंतर येते. अँथ्रोपिक आणि ओपनएआय मधील बंद प्रणालींना मागे टाकण्याचे उद्दिष्ट असलेल्या चिनी ओपन-वेट मॉडेल्सच्या लाटेतील हे प्रकाशन नवीनतम आहे. AI Buzz Wire मॉडेल ट्रॅकरसाठी, GLM-5.3 हे एक स्पष्ट सिग्नल आहे की ओपन-वेट फ्रंटियर कोडिंग अंतर अनेक अपेक्षेपेक्षा वेगाने बंद करत आहे.

नफा संपूर्णपणे पोस्ट-ट्रेनिंगवर तयार होतो

Z.ai त्याच्या GLM-5.3 च्या दृष्टिकोनाबद्दल स्पष्टपणे सांगत आहे: "प्रशिक्षणोत्तर स्केलिंग हेच आम्ही केले." कंपनीने GLM-5.2 सह सादर केलेला मजबुतीकरण-शिक्षण स्टॅक - कार्यक्षम दीर्घ-संदर्भ प्रक्रियेसाठी इंडेक्सशेअर, दीर्घ-क्षितिज कार्यांवर मजबुतीकरण शिक्षणासाठी SAO आणि मोठ्या प्रमाणावरील असिंक्रोनस प्रशिक्षणासाठी स्लाईम नावाची मुक्त-स्रोत फ्रेमवर्क समाविष्ट आहे. गेल्या महिन्यात त्याने त्या स्टॅकमध्ये अधिक वातावरण, अधिक वैविध्यपूर्ण कार्ये आणि अधिक गणना केली.

पेऑफ कोडिंग बेंचमार्कवर दिसून येतो. टर्मिनल बेंच 3.0 वर, GLM-5.3 ने GLM-5.2 च्या स्कोअर 4.6 वरून 28.3 वर उडी घेतली - सहापट सुधारणा. हे टर्मिनल बेंच 3.0 आणि एजंट्सच्या शेवटच्या परीक्षेवर ओपन-सोर्स अत्याधुनिक निकाल पोस्ट करते आणि एजंटिक क्षमतेच्या ALE-CLI मापनावर 23.8 ते 28.5 पर्यंत सुधारते. Z.ai ने त्याच्या इन-हाऊस Z.ai कोड बेंचवर GLM-5.2 पेक्षा 50% सुधारणा नोंदवली आहे, वास्तविक विकास वातावरणात कोडिंग एजंट्सचे मूल्यांकन करण्यासाठी आणि सार्वजनिक चाचणी संचांपासून दूषित होण्याचा धोका कमी करण्यासाठी डिझाइन केलेला खाजगी बेंचमार्क.

निर्णायकपणे, नफा चांगल्या टोकन कार्यक्षमतेसह येतो, केवळ चांगले परिणाम नाही. उच्च प्रयत्नाने, GLM-5.3 ने प्रति कार्य अंदाजे 50,000 आउटपुट टोकन्सवर इन-हाउस बेंचमार्कवर 31.4% पूर्ण केले, जे Z.ai म्हणते की 120,000 टोकन्ससह 29.5% वर Anthropic च्या Claude Opus 4.8 ला मागे टाकले आहे. GLM-5.3 अजूनही Anthropic च्या अधिक प्रगत क्लॉड फेबल 5 च्या मागे आहे, जे जास्तीत जास्त प्रयत्न करून 39.5% पर्यंत पोहोचते.

सायबर क्षमतेत अनपेक्षित झेप

GLM-5.3 मधील सर्वात उल्लेखनीय परिणाम कोडिंगमध्ये नसून सुरक्षिततेमध्ये आहे. Z.ai ने प्रशिक्षणोत्तर स्केल केले आणि प्रशिक्षण मिश्रणात असुरक्षितता-शोध डेटा आणि वातावरणाचा परिचय करून दिल्याने, दोष शोधण्यात आणि तर्क करण्यामध्ये मॉडेल सुधारेल अशी अपेक्षा केली. संघाला आश्चर्य वाटले की ती क्षमता किती लवकर विकसित झाली.

GLM-5.3 केवळ वेगळ्या बग्स शोधण्यात चांगले झाले नाही; त्याने शोषणाच्या अनेक टप्प्यांवर तर्क करणे सुरू केले, संपूर्ण हल्ल्याच्या साखळ्यांसाठी सुसंगत योजना तयार केल्या. CyberGym वर, मॉडेल व्हाइट-बॉक्स सोर्स कोडवरून भेद्यता ओळखू शकते आणि प्रमाणित करू शकते की नाही हे तपासणारा बेंचमार्क, GLM-5.3 स्कोअर 84.5%, GLM-5.2 च्या 77.2% वरून. बेंचमार्कवर हा सर्वोत्तम परिणाम आहे, Mythos 5 च्या पुढे 83.8% आणि GPT-5.6 Sol च्या 83.6% वर. एक्स्प्लोइटबेंचवर, जी वास्तविक असुरक्षा आणि त्यांच्या शोषणाविषयी सखोल तर्काची मागणी करते, GLM-5.3 ने GLM-5.2 चा स्कोअर दुप्पट केला, 54.4% पर्यंत पोहोचला — जरी तो 78.0% वर Mythos 5 आणि GPT-5.6 Sol च्या 76.5% वर चांगला राहिला.

Z.ai एक सातत्यपूर्ण पॅटर्न पाहते: शोषण साखळी जितका वरचा बेंचमार्क बसेल, GLM-5.2 वर जितका मोठा फायदा होईल — आणि बंद सीमारेषेपर्यंतचे उरलेले अंतरही तितके जास्त. "आम्ही जिथे सर्वात मागे आहोत तिथे क्षमता वेगाने वाढत आहे," कंपनीने नमूद केले आहे.

वास्तविक-जागतिक असुरक्षा शोध

सायबर कौशल्ये बेंचमार्क्सपुरती मर्यादित नाहीत. Z.ai अहवाल देतो की GLM-5.2 पासून, ते वास्तविक-जगातील कोडबेस विरुद्ध मॉडेल्सची चाचणी घेण्यासाठी चीनमधील अनेक सुरक्षा संघांसोबत काम करत आहे. तज्ञ पुनरावलोकन, स्क्रीनिंग आणि डुप्लिकेशन नंतर, मॉडेलने 269 प्रकल्पांमध्ये 2,436 असुरक्षा ओळखल्या, ज्यात 1,097 मध्यम-ते-उच्च तीव्रतेच्या समस्या आहेत. निष्कर्ष प्रणाली कर्नल, ऑपरेटिंग सिस्टम, ब्राउझर इंजिन, ओपन-सोर्स इन्फ्रास्ट्रक्चर, वेब ऍप्लिकेशन्स आणि नेटवर्क प्रोटोकॉल्सवर पसरलेले आहेत - त्यापैकी बरेच काही वर्षानुवर्षे किंवा अगदी दशके दुर्लक्षित राहिले होते, सर्वात जुने अंदाजे 40 वर्षे जुने आहेत.

ते परिणाम प्रतिध्वनी कार्य Anthropic ने त्याच्या स्वतःच्या मल्टीएजंट सुरक्षा संशोधनात वर्णन केले आहे, जेथे एजंटांचे समन्वित झुंड मोठ्या प्रमाणावर ओपन-सोर्स सॉफ्टवेअरमधील भेद्यता शोधण्यासाठी वापरले गेले.

खुले वजन — विलंबाने

Z.ai म्हणते की ते GLM-5.3 वजन दोन आठवड्यांत रिलीज करेल, एकदा सुरक्षा मूल्यमापन आणि कडक होणे पूर्ण झाले. तो मुद्दाम विलंब घोषणेद्वारे चालू असलेला तणाव प्रतिबिंबित करतो: एक मॉडेल जे त्याच्या निर्मात्यांच्या अपेक्षेपेक्षा अधिक वेगाने शक्तिशाली आक्षेपार्ह सायबर क्षमता विकसित करते, ही एक प्रकारची प्रणाली आहे जी जबाबदार प्रकाशनाबद्दल प्रश्न उपस्थित करते. कंपनी जोर देते की तिचे प्रशिक्षण-रोलआउट सुसंगतता उच्च प्रमाणात संख्यात्मक अचूकतेपर्यंत सुधारली गेली आहे आणि स्केलिंगमधील बरीच अडचण मॉडेलमधूनच वास्तववादी, पडताळणीयोग्य कार्य वातावरणाच्या डिझाइनमध्ये बदलली आहे.

स्पर्धात्मक चित्र स्पष्ट आहे. GLM-5.3 कमीत कमी एका प्रमुख भेद्यता-शोध बेंचमार्कवर थेट आघाडीचा दावा करताना कोडिंग आणि एजंटिक कार्यांवर बंद सीमारेषेपर्यंतचे अंतर कमी करते. हे ओपन-वेट मॉडेल म्हणून करते — म्हणजे, एकदा रिलीझ झाल्यानंतर, वजन कोणालाही डाउनलोड करण्यासाठी, अभ्यास करण्यासाठी आणि तयार करण्यासाठी विनामूल्य उपलब्ध असेल. हा मोकळेपणा प्रगतीला गती देतो किंवा नवीन सुरक्षेची चिंता वाढवतो की नाही हा वाद आहे GLM-5.3 पुन्हा प्रज्वलित होण्याची हमी आहे.

AI च्या पुढे रहा

नवीनतम AI मॉडेल रिलीज, बेंचमार्क लढाया आणि उद्योग विश्लेषणासाठी, बुकमार्क करा AI Buzz Wire.

अधिक AI बातम्या वाचा →