ऍप्लिकेशन-सुरक्षा फर्म सेमग्रेपच्या नवीन बेंचमार्कने एक अनपेक्षित परिणाम दिला आहे: चीनच्या झिपू एआय मधील ओपन-वेट मॉडेलने सॉफ्टवेअरमधील वास्तविक सुरक्षा त्रुटी शोधण्यात अँथ्रोपिकच्या क्लॉडला मागे टाकले. सर्वात सक्षम AI आवश्यकतेने सर्वात महाग आहे की सर्वात प्रतिबंधित आहे यावरील चर्चेला या निष्कर्षाने इंधन जोडले आहे.

Anthropic च्या शक्तिशाली Mythos मॉडेलला यू.एस. निर्यात बंदी घातल्याने, प्रवेशयोग्य पर्यायाचा शोध घेत असलेल्या सुरक्षा संघ नवीनतम AI उद्योग कव्हरेजसाठी GLM 5.2 सारख्या ओपन-वेट पर्यायांकडे वळत आहेत. 22 जून रोजी प्रकाशित झालेल्या सेमग्रेपची चाचणी असे सूचित करते की शिकार अपेक्षेपेक्षा लवकर फेडत आहे.

सेमग्रेपने काय चाचणी केली

सेमग्रेपने त्याच्या अंतर्गत आयडीओआर-डिटेक्शन बेंचमार्कवर ओपन-वेट आणि फ्रंटियर मॉडेल्सच्या लाइनअपचे मूल्यांकन केले. IDORs — असुरक्षित डायरेक्ट ऑब्जेक्ट संदर्भ — हे ऍक्सेस-कंट्रोल बग आहेत जे एका वापरकर्त्याला दुसऱ्या वापरकर्त्याच्या डेटापर्यंत पोहोचू देतात. पारंपारिक स्थिर विश्लेषणासह ते पकडणे अत्यंत कठीण आहे कारण दोष वाक्यरचना ऐवजी तार्किक आहे: कोड तांत्रिकदृष्ट्या वैध आहे, त्यात अधिकृतता तपासणीचा अभाव आहे.

कंपनी नियम-आधारित इंजिनला AI रिजनिंगसह एकत्रित करून या भेद्यता शोधण्यासाठी कार्यप्रवाह सुधारत आहे. स्वतःच्या आसपासच्या मचान विरुद्ध मॉडेलमधून किती कार्यप्रदर्शन येते हे वेगळे करण्यासाठी, संशोधकांनी कमीत कमी हार्नेसद्वारे लोकप्रिय ओपन-वेट मॉडेल्सचा एक संच चालवला — प्रत्येक मॉडेलला दिलेला समान IDOR प्रॉम्प्ट वापरून एक साधा Pydantic सेटअप, कोणताही एंडपॉइंट शोध आणि मार्गदर्शक नेव्हिगेशनशिवाय. प्रॉम्प्टने फक्त एक मूलभूत शोध धोरण आणि IDOR कसा दिसतो यावर काही पॉइंटर ऑफर केले — "येथे कोड आहे, बग शोधा" पेक्षा थोडे अधिक, परंतु सेमग्रेपच्या संपूर्ण पाइपलाइनमध्ये चालत असताना फ्रंटियर कोडिंग एजंट्स जे प्राप्त करतात त्यापेक्षा खूपच कमी.

आयडीओआर हे ऍप्लिकेशन सुरक्षा संघांसाठी सतत डोकेदुखी असतात कारण ते पारंपारिक स्कॅनरच्या क्रॅकमधून पडतात. नियम-आधारित साधन गहाळ इनपुट तपासणीस ध्वजांकित करू शकते, परंतु विशिष्ट एंडपॉइंट प्रत्यक्षात दुसऱ्या वापरकर्त्याचा डेटा उघड करतो की नाही हे समजून घेण्यासाठी ऍप्लिकेशनच्या व्यवसायाच्या तर्काबद्दल तर्क करणे आवश्यक आहे — अगदी मोठ्या भाषेच्या मॉडेल्समध्ये ज्या प्रकारचा संदर्भात्मक निर्णय वाढत आहे.

GLM 5.2 आघाडी घेते

स्टँडआउट GLM 5.2, Zhipu AI चे ओपन-वेट मॉडेल होते. एक बेअर प्रॉम्प्टशिवाय काहीही न चालवता, याने IDOR डिटेक्शनवर 39% F1 स्कोअर केला - क्लॉड कोडच्या 32% ला सात पूर्ण गुणांनी पराभूत केले. सेमग्रेपच्या मते, ओपन-वेट मॉडेलने टास्कमध्ये क्लॉड ओपस 4.8 ला देखील मागे टाकले, ज्यामुळे ते सर्वात मजबूत नॉन-फ्रंटियर पर्याय चाचणी केले गेले.

अर्थशास्त्रही तितकेच धक्कादायक होते. GLM 5.2 च्या किंमतीनुसार, धावण्याची किंमत अंदाजे $0.17 प्रति भेद्यता आढळली. हजारो एंडपॉइंट्स स्कॅन करू शकतील अशा संस्थांसाठी, सेमग्रेपने नमूद केले की प्रति-बग खर्च हे प्रमाणानुसार शोधण्याचे तंत्र व्यावहारिक आहे की नाही हे ठरवणारे घटक असते.

इतर ओपन-वेट स्पर्धक आणखी मागे पडले. MiniMax M3 ने 23% F1 आणि Kimi K2.7 Code ने 22% गुण मिळवले, दोन्ही क्लस्टरिंग क्लॉड कोडच्या खाली आहेत. सेमग्रेपने ओपन-वेट श्रेणीसाठी प्रातिनिधिक निकालाऐवजी स्पष्ट अपवाद म्हणून GLM 5.2 चे वर्णन केले.

हार्नेस अजूनही महत्त्वाचा आहे

रॉ-प्रॉम्प्ट श्रेणीमध्ये ओपन-वेट विजय असूनही, सेमग्रेपची स्वतःची उद्देशाने बांधलेली पाइपलाइन एकंदर आघाडीवर राहिली. कंपनीच्या मल्टीमोडल सेटअपने - जे नियम-आधारित शोध आणि संरचित एंडपॉइंट गणनेसह AI तर्क एकत्र करते - कॉन्फिगरेशनवर अवलंबून, 53% ते 61% F1 गाठले. हे अंतर संशोधकांच्या मूळ प्रश्नाला अधोरेखित करते: असुरक्षा-शोधन कार्यप्रदर्शन मॉडेल किती आहे आणि त्याच्या सभोवतालची वास्तुकला किती आहे?

उत्तर असे दिसते की "दोन्ही, परंतु लोक जे मानतात त्यापेक्षा जास्त हार्नेस आहे." GLM 5.2 ने सिद्ध केले की सक्षम मॉडेल कमीतकमी समर्थनासह अर्थपूर्ण कार्य करू शकते, तरीही ते अद्याप समस्येसाठी विशेषतः इंजिनियर केलेल्या प्रणालीशी जुळू शकत नाही.

सेमग्रेप टीम - ज्यामध्ये पॅक्स्टन-फियर, सेठ जॅक्सिक, ब्रेंडन नोब्लिट आणि एरिक बुकानन या संशोधकांचा समावेश होता - म्हणाले की त्यांना "खरेच धक्का" बसला आहे की उघड्या प्रॉम्प्टवर चालणाऱ्या एका ओपन-वेट मॉडेलने फ्रन्टियर कोडिंग एजंटला कारणीभूत सुरक्षा कार्यावर मागे टाकले.

घरातील समज

सध्याच्या भू-राजकीय पार्श्वभूमीवर बेंचमार्कमध्ये अधिक वजन आहे. ब्लॉग पोस्टचे शीर्षक - "आम्ही घरी मायथॉस आहे" - अँथ्रोपिकचे सायबरसुरक्षा-केंद्रित मायथॉस मॉडेल प्रभावीपणे जगभर अनुपलब्ध आहे या वस्तुस्थितीचा स्पष्ट संदर्भ आहे. ट्रम्प प्रशासनाने गैर-अमेरिकन नागरिकांना Mythos आणि त्याचे प्रतिबंधित भाऊ फेबल 5 वापरण्यास प्रतिबंध केल्यानंतर, जागतिक सुरक्षा संघांनी आक्षेपार्ह आणि बचावात्मक सुरक्षा कार्यासाठी सर्वात सक्षम AI मानल्या जाणाऱ्या AI मध्ये प्रवेश गमावला.

त्या व्हॅक्यूममध्ये, प्रवेशयोग्य ओपन-वेट मॉडेल्स हे अंतर भरत आहेत. GLM 5.2 — मुक्तपणे डाउनलोड करण्यायोग्य आणि कोठेही उपयोजित करण्यायोग्य — विशिष्ट सुरक्षा कार्यांवर आधीपासून फ्रंटियर प्रोप्रायटरी मॉडेल्सशी जुळवून किंवा मात करू शकते हे तथ्य सूचित करते की निर्यात बंदीचा शीतकरण परिणाम हेतूपेक्षा लहान असू शकतो. सर्वोत्कृष्ट "अप्रतिबंधित" मॉडेलमध्ये सुधारणा होत राहिल्यास, होर्डिंग फ्रंटियर क्षमतांचे धोरणात्मक मूल्य कमी होते.

आत्तासाठी, परिणाम अरुंद आहे: असुरक्षिततेच्या एका वर्गावर एकल बेंचमार्क. परंतु हे एक संकेत आहे की ओपन-वेट फ्रंटियर बऱ्याच गृहितांपेक्षा वेगाने बंद होत आहे आणि ती प्रवेशयोग्यता - कच्ची क्षमता नाही - AI सुरक्षा लँडस्केपमध्ये परिभाषित व्हेरिएबल बनू शकते.

या शोधामुळे फ्रंटियर लॅबसाठी अस्वस्थ प्रश्नही निर्माण होतात. जर एखादे मुक्तपणे उपलब्ध मॉडेल आधीच सुरक्षितता तर्क कार्यांवर मालकी प्रणालीशी जुळत असेल, तर बंद मॉडेल्सच्या आसपासचा स्पर्धात्मक खंदक अरुंद होतो — विशेषत: जेव्हा निर्यात नियंत्रणे त्या बंद मॉडेल्सला जागतिक बाजारपेठेत प्रवेश करू शकत नाहीत. ओपन-वेट डेव्हलपर, वापरावरील निर्बंधांद्वारे भारित नसलेले, एकाच वेळी सर्वत्र पुनरावृत्ती आणि तैनात करू शकतात.

AI च्या पुढे रहा

फ्रंटियर आणि ओपन-वेट AI मधील अंतर ब्रेकिंग एआय न्यूज आणि सुरक्षा, पायाभूत सुविधा आणि धोरणाला पुनर्रचना करणारे संशोधन कमी होत आहे.

अधिक एआय बातम्या वाचा →