सुरक्षा गैर-लाभकारी संस्था FAR.AI के एक नए बेंचमार्क के अनुसार, फ्रंटियर AI मॉडल इस मामले में काफी भिन्न हैं कि उन्हें तोड़ना कितना कठिन है - और यह अंतर कई अनुमानों से कहीं अधिक बड़ा है।

29 जुलाई को, FAR.AI ने समान परिस्थितियों में चार प्रमुख मॉडलों के सुरक्षा उपायों का परीक्षण करते हुए अपना AI सुरक्षा लीडरबोर्ड लॉन्च किया। संगठन ने कहा कि एंथ्रोपिक के क्लाउड फैबल 5 और ओपनएआई के जीपीटी-5.6 सोल ने हमलों के खिलाफ मजबूती से काम किया, जबकि एक्सएआई के ग्रोक 4.5 और गूगल के जेमिनी 3.1 प्रो प्रत्येक ने 300 डॉलर से कम कीमत पर ब्रेक लिया। FAR.AI ने सबसे अधिक और सबसे कम मजबूत मॉडलों के बीच के अंतर को सुरक्षा उपायों में "सौ गुना अंतर" के रूप में वर्णित किया। For more context on this story, see our ongoing artificial intelligence updates.

लीडरबोर्ड के साथ-साथ, FAR.AI ने सुरक्षा उपायों के लिए न्यूनतम मानक पेश किया, जो एक साझा सुरक्षा आधार रेखा है जो पूरी तरह से उन सुरक्षाओं से इकट्ठी की गई है जो सहकर्मी डेवलपर्स पहले से ही उत्पादन में चलाते हैं। लक्ष्य प्रयोगशालाओं को एक ठोस मंजिल देना है - और कमजोर सुरक्षा को दृश्यमान बनाना है।

निष्कर्ष FAR.AI के पहले के तनाव परीक्षणों की प्रतिध्वनि करते हैं। मई की एक रिपोर्ट में पाया गया कि डीपसीक-वी4-प्रो के सुरक्षा उपाय "लगभग पूरी तरह से ध्वस्त" हो गए थे, कम-कौशल वाले हमलावरों ने परीक्षण किए गए प्रत्येक डोमेन में 98-100% समय सुरक्षा तंत्र को दरकिनार कर दिया था। मॉडल के पूर्ववर्ती के लिए बनाया गया सार्वजनिक रूप से उपलब्ध जेलब्रेक एक भी संशोधन के बिना काम करता है, जिससे पता चलता है कि ज्ञात कमजोरियाँ ठीक नहीं हुईं।

WIRED ने लीडरबोर्ड पर रिपोर्ट करते हुए निष्कर्ष निकाला कि "कुछ सीमांत एआई मॉडल को जेलब्रेक करना भयावह रूप से आसान है।" जैसे-जैसे एजेंट अधिक संवेदनशील कार्य करते हैं, असमानता यह सवाल उठाती है कि कौन से सिस्टम को तैनात करना सुरक्षित है।

एआई सुरक्षा और सुरक्षा अनुसंधान के निरंतर कवरेज के लिए, पाठक एआई बज़ वायर का अनुसरण कर सकते हैं।

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →