संशोधकांनी तर्कसंगत AI मॉडेल्सच्या विरोधात एक शक्तिशाली नवीन हल्ला प्रदर्शित केला आहे जे मोठ्या भाषेतील मॉडेल (LLM) डेटापासून कसे वेगळे करतात यामधील मूलभूत अंध स्थानाचा फायदा घेतात. चेन-ऑफ-थॉट (CoT) फोर्जरी नावाचे तंत्र, आक्रमणकर्त्याने पुरवलेल्या मजकूरावर मॉडेलचे स्वतःचे खाजगी अंतर्गत तर्क असल्यासारखे वागण्याची युक्ती करते, ज्यामुळे मजकूर कायदेशीर सूचना ओव्हरराइड करू शकतो.
Hackaday द्वारे नोंदवलेले निष्कर्ष हे अधोरेखित करतात की हेराफेरीपासून AI प्रणाली सुरक्षित करणे ही एक न सुटलेली समस्या का आहे. क्षेत्रातील उदयोन्मुख धोक्यांचा सामना करण्यासाठी, चालू असलेल्या विश्लेषणासाठी आमचे AI उद्योग कव्हरेज फॉलो करा.
मूळ कारण: भूमिका गोंधळ
असुरक्षिततेच्या केंद्रस्थानी संशोधक "भूमिका गोंधळ" असे वर्णन करतात. आधुनिक LLM ला त्यांचे सर्व इनपुट—सिस्टमचे नियम, वापरकर्ता विनंत्या आणि मॉडेलचे स्वतःचे चेन-ऑफ-थॉट रिझनिंग—एकाच मजकूर चॅनेलद्वारे प्राप्त होतात. ऑर्डर लादण्यासाठी, डेव्हलपर मेटाडेटा टॅग वापरतात जसे की `
`
हल्ला कसा कार्य करतो
निर्णायकपणे, CoT फोर्जरी ही केवळ `
Hackaday च्या मते, यामुळे LLM पारदर्शकपणे अतार्किक तर्क एक पूर्वनिर्णय म्हणून स्वीकारते आणि वापरकर्त्याच्या विनंतीला प्रतिसाद बदलते. कारण फसवणूक केलेली सामग्री कमी-विश्वास वापरकर्त्याच्या इनपुटऐवजी उच्च-विश्वास अंतर्गत विचार म्हणून समजली जाते, ती सुरक्षा रेलिंगला बायपास करू शकते जे सामान्यत: फेरफार सूचना अवरोधित करते.
LLM च्या आत ट्रस्टची पदानुक्रम
हल्ला का यशस्वी होतो हे समजून घेण्यासाठी भूमिका कशा कार्य करतात हे समजून घेणे आवश्यक आहे. हुड अंतर्गत, भूमिका मॉडेलच्या इनपुटला संघटित पदानुक्रमात विभागतात. भूमिकेतील सूचनांचे पालन केले जाते जोपर्यंत ते उच्च-प्राधान्य असलेल्यांशी विरोधाभास करत नाहीत. उदाहरणार्थ, "बेकायदेशीर क्रियाकलापांवर चर्चा करू नका" चे सिस्टम-स्तरीय निर्देश, प्रतिबंधित रेसिपी प्रदान करण्यासाठी वापरकर्त्याच्या विनंतीला ओव्हरराइड करण्यासाठी आहे. `
ब्रेकडाउन उद्भवते कारण मॉडेल ते पदानुक्रम यांत्रिकरित्या लागू करत नाही. त्याऐवजी, अंशतः शैलीत्मक संकेतांवरून कोणता मजकूर कोणत्या भूमिकेशी संबंधित आहे याचा अंदाज लावतो. संशोधनाच्या सामुदायिक चर्चेत नमूद केल्याप्रमाणे, जर मजकूर विचाराच्या संदर्भाप्रमाणे नमुना केलेला असेल, तर मॉडेल वास्तविक तर्कासाठी समान रचना असलेल्या कोणत्याही मजकुराची चूक करू शकते — आणि विचार मजकूर सामान्य वापरकर्ता मजकूरापेक्षा जास्त प्राधान्य देतो.
नवीन ट्विस्टसह एक परिचित नमुना
संशोधन एआय सिस्टममधील दीर्घ-मान्य कमकुवततेवर आधारित आहे: प्रॉम्प्ट इंजेक्शन. सुरुवातीच्या हल्ल्यांनी या वस्तुस्थितीचा फायदा घेतला की LLM मध्ये सूचना आणि डेटासाठी वेगळा प्रवाह नसतो, म्हणून "मागील सर्व सूचनांकडे दुर्लक्ष करा" सारखे वाक्यांश कधीकधी मॉडेलचे वर्तन हायजॅक करू शकते. भूमिका आणि मेटाडेटा टॅगचा परिचय विश्वास पदानुक्रम तयार करून हे कमी करण्यासाठी होते.
सीओटी फोर्जरी हे दाखवते की कमी करणे अपूर्ण आहे. जोपर्यंत मॉडेल मजकूराच्या विश्वासार्हतेचा अंशतः त्याच्या स्ट्रक्चरल मेटाडेटाद्वारे काटेकोरपणे न करता त्याच्या शैलीत्मक वैशिष्ट्यांद्वारे न्याय करतात, तोपर्यंत योग्य शैलीची नक्कल करू शकणारे आक्रमणकर्ते त्यांच्या इनपुटचा समजलेला अधिकार वाढवू शकतात.
हे निराकरण करणे कठीण का आहे
चार्ल्स ये, जास्मिन कुई आणि डायलन हॅडफिल्ड-मेनल या संशोधकांचा असा युक्तिवाद आहे की एलएलएममधील भूमिका धारणा ही बायनरी गुणधर्म नाही जी स्वच्छपणे लागू केली जाऊ शकते. मॉडेल हार्ड-कोडेड नियमांऐवजी प्रशिक्षणाद्वारे टॅग्जचे अर्थ लावायला शिकतात, याचा अर्थ डेटामधील नमुन्यांद्वारे त्यांचे वर्तन आकारले जाते—आणि नमुन्यांची अनुकरण केली जाऊ शकते.
Hackaday द्वारे हायलाइट केलेल्या कामाच्या सामुदायिक चर्चेने, एक आवर्ती थीम समोर आली: सर्वात स्वच्छ निराकरणासाठी मॉडेलला शिकलेल्या, शैली-आधारित संकेतांवर अवलंबून न राहता संरचनात्मकदृष्ट्या स्वतंत्र मार्गांद्वारे विश्वसनीय इनपुट हाताळण्याची आवश्यकता असेल. असे होईपर्यंत, प्रॉम्प्ट इंजेक्शन-शैली हल्ल्यांपासून बचाव करणे ही समस्या सोडविण्याऐवजी विकसित होणारी प्रक्रिया राहील.
व्यापक परिणाम
प्रयोगशाळेच्या प्रात्यक्षिकांच्या पलीकडे भेद्यता महत्त्वाची आहे. रिझनिंग मॉडेल्स एजंटिक सिस्टममध्ये वाढत्या प्रमाणात तैनात केले जातात जे वेब ब्राउझ करू शकतात, कोड कार्यान्वित करू शकतात आणि वापरकर्त्याच्या वतीने कृती करू शकतात. जर एखादा हल्लेखोर मॉडेलचे अंतर्गत निष्कर्ष काढू शकतो, तर ते त्या क्रियांना अनपेक्षित किंवा हानिकारक परिणामांकडे नेण्यास सक्षम होऊ शकतात. मॉडेल्सना अधिक स्वायत्तता आणि साधनांमध्ये प्रवेश मिळत असल्याने जोखीम वाढते. संशोधकांनी नोंदवले आहे की मानव हुशार आणि सर्जनशील राहतात आणि जोपर्यंत मॉडेल्समध्ये विश्वासार्ह आणि अविश्वासू मजकुराच्या दरम्यान स्वच्छ वास्तुशास्त्रीय पृथक्करण होत नाही तोपर्यंत दृढनिश्चयी आक्रमणकर्ते रेषा अस्पष्ट करण्याचे मार्ग शोधत राहतील. पेपर पॅच करण्यासाठी दोष म्हणून कमी आणि हार्ड-कोडेड नियमांऐवजी डेटावरून त्यांचे वर्तन शिकणाऱ्या सिस्टमची संरचनात्मक गुणधर्म म्हणून आव्हान फ्रेम करते.
संपूर्ण पेपर arXiv वर उपलब्ध आहे आणि संशोधकांनी GitHub वर कोड उदाहरणे प्रकाशित केली आहेत जेणेकरुन विकासक त्यांच्या स्वतःच्या सिस्टमला संवेदनाक्षम आहेत की नाही हे तपासू शकतील.
AI च्या पुढे रहा
AI सुरक्षा संशोधन, सुरक्षा भेद्यता आणि मोठ्या भाषा मॉडेल्सच्या सीमांबद्दल अधिक माहितीसाठी, AI Buzz Wire ला भेट द्या.
अधिक एआय बातम्या वाचा →


