सुरक्षा नानफा FAR.AI च्या नवीन बेंचमार्कनुसार, Frontier AI मॉडेल्स त्यांना तोडणे किती कठीण आहे यात खूप फरक आहे — आणि हे अंतर अनेकांनी गृहीत धरले त्यापेक्षा खूप मोठे आहे.
29 जुलै रोजी, FAR.AI ने AI सिक्युरिटी लीडरबोर्ड लाँच केला, एकसारख्या परिस्थितीत चार आघाडीच्या मॉडेल्सच्या सुरक्षिततेची चाचणी केली. Anthropic च्या Claude Fable 5 आणि OpenAI च्या GPT-5.6 Sol ने हल्ल्यांविरुद्ध ठामपणे उभे राहिले, तर xAI चे Grok 4.5 आणि Google चे Gemini 3.1 Pro प्रत्येकी $300 च्या खाली तोडले, असे संस्थेने म्हटले आहे. FAR.AI ने सर्वात जास्त आणि कमीत कमी मजबूत मॉडेल्समधील फरकाचे वर्णन सेफगार्ड्समध्ये "शंभरपट अंतर" म्हणून केले आहे. For more context on this story, see our ongoing artificial intelligence updates.
लीडरबोर्डच्या बरोबरीने, FAR.AI ने ज्याला मिनिमल स्टँडर्ड फॉर सेफगार्ड्स म्हणतात ते सादर केले, एक सामायिक सुरक्षा बेसलाइन पूर्णपणे संरक्षणापासून एकत्रित केली आहे जी पीअर डेव्हलपर्स आधीच उत्पादनात चालवतात. लॅबना पूर्ण करण्यासाठी ठोस मजला देणे — आणि कमकुवत संरक्षणे दृश्यमान करणे हे ध्येय आहे.
निष्कर्ष FAR.AI च्या पूर्वीच्या ताण चाचण्यांचे प्रतिध्वनी करतात. मे अहवालात असे आढळून आले की DeepSeek-V4-Pro चे सुरक्षा उपाय "जवळजवळ पूर्णपणे कोलमडले आहेत," कमी-कौशल्य हल्लेखोरांनी प्रत्येक डोमेनवर चाचणी केलेल्या 98-100% वेळा सुरक्षा यंत्रणांना मागे टाकले. मॉडेलच्या पूर्ववर्तीसाठी तयार केलेला सार्वजनिकरित्या उपलब्ध तुरूंगातून निसटणे हे एकाही बदलाशिवाय कार्य करते, हे सूचित करते की ज्ञात भेद्यता अनपॅच झाल्या आहेत.
WIRED, लीडरबोर्डवर अहवाल देत, असा निष्कर्ष काढला की "काही फ्रंटियर एआय मॉडेल्स जेलब्रेक करणे भयावहपणे सोपे आहे." एजंट अधिक संवेदनशील कार्ये घेत असताना, असमानता कोणत्या प्रणाली तैनात करण्यासाठी सुरक्षित आहेत याबद्दल गंभीर प्रश्न निर्माण करतात.
AI सुरक्षा आणि सुरक्षा संशोधनाच्या सतत कव्हरेजसाठी, वाचक AI Buzz Wire चे अनुसरण करू शकतात.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →