संशोधकांच्या टीमने हे दाखवून दिले आहे की एन्थ्रोपिक, ओपनएआय आणि Google मधील अग्रगण्य AI मॉडेल्सद्वारे तयार केलेली छुपी चेन-ऑफ-थॉट रिझनिंग एन्क्रिप्टेड ट्रेसमधून पुनर्प्राप्त केली जाऊ शकते, मालकीचे तर्कशास्त्र, वैयक्तिक डेटा आणि क्रेडेन्शियल्स मोठ्या प्रमाणावर उघड करतात.
11 ऑगस्ट, 2026 रोजी प्रसिद्ध झालेल्या शोधनिबंधात स्टीलिंग रिझनिंग ट्रेसेस फ्रॉम प्रोप्रायटरी LLM APIs, प्रमुख AI प्रदाते त्यांच्या सर्वात मौल्यवान बौद्धिक मालमत्तेचे संरक्षण कसे करतात यामधील मूलभूत वास्तुशिल्प असुरक्षा प्रकट करतात. ब्रेकिंग एआय न्यूज फॉलो करणाऱ्या प्रत्येकासाठी, हे संशोधन अधोरेखित करते की कूटबद्ध केलेले मॉडेल आउटपुट सार्वजनिकरीत्या शेअर केल्यावरही जबाबदारी कशी बनू शकते.
हल्ला कसा कार्य करतो
अग्रगण्य AI प्रदाते बौद्धिक संपत्तीचे संरक्षण करण्यासाठी आणि माहिती गळती मर्यादित करण्यासाठी त्यांच्या मॉडेल्सचे चरण-दर-चरण तर्क लपवून ठेवतात - ज्याला चेन-ऑफ-थॉट म्हणून ओळखले जाते. हे ट्रेस सर्व्हर-साइड संचयित करण्याऐवजी, प्रदाते ते क्लायंटला मजकूराचे एन्क्रिप्टेड ब्लॉक म्हणून परत करतात जे क्लायंट प्रत्येक त्यानंतरच्या विनंतीसह परत करतो.
संशोधकांनी ओळखले की हे एनक्रिप्टेड ब्लॉक्स प्रदात्याच्या इकोसिस्टममधील विविध सत्रे, वापरकर्ते आणि मॉडेल्समध्ये पूर्णपणे सुसंगत आणि अदलाबदल करण्यायोग्य आहेत. ही पोर्टेबिलिटी आक्रमणाची गुरुकिल्ली आहे.
पद्धत दोन API कॉलमध्ये कार्य करते. प्रथम, आक्रमणकर्ता फ्रंटियर मॉडेलद्वारे तयार केलेला एनक्रिप्टेड रिझनिंग ट्रेस घेतो — उदाहरणार्थ, क्लॉड ओपस 4.8 — आणि क्लॉड हायकू 4.5 सारख्या त्याच प्रदात्याकडून कमकुवत, कमी-सुरक्षित भावंडाच्या मॉडेलमध्ये इंजेक्ट करतो. कमकुवत मॉडेलला नंतर तर्क शब्दशः लिप्यंतरण करण्याच्या सोप्या सूचनेसह जेलब्रोकन केले जाते. एन्क्रिप्टेड ब्लॉक बदलण्यायोग्य असल्यामुळे, कमकुवत मॉडेल अधिक मजबूत मॉडेलवर थेट हल्ला न करता - साध्या मजकुरात मजबूत मॉडेलचे छुपे तर्क डीकोड करते आणि आउटपुट करते.
संशोधकांनी हा हल्ला तीनही प्रमुख प्रदात्यांच्या मॉडेल्समध्ये दाखवला: अँथ्रोपिक क्लॉड, ओपनएआयचे जीपीटी आणि गुगलचे जेमिनी.
डेटा एक्सपोजरचे प्रमाण
सार्वजनिकरित्या सामायिक केलेल्या सत्र लॉगद्वारे लीक झालेल्या संवेदनशील डेटाचे प्रमाण हे सर्वात चिंताजनक शोध आहे. संशोधकांनी GitHub आणि Hugging Face वरून 6,708 सार्वजनिकरीत्या उपलब्ध एजंट ट्रॅजेक्ट्रीज गोळा केल्या - क्लॉड, GPT आणि जेमिनी मॉडेल्सद्वारे उत्पादित आणि तरीही एनक्रिप्टेड रिझनिंग ब्लॉक्स असलेले.
प्रत्येक स्वाक्षरी केलेल्या ब्लॉकवर त्यांची डीकोडिंग पाइपलाइन लागू केल्याने 315,320 पुनर्रचना केलेले तर्क ब्लॉक प्राप्त झाले. या छुप्या ट्रेसमध्ये खरी गुपिते आणि संवेदनशील माहिती होती.
अस्सल, नॉन-बेंचमार्क वापरकर्ता सत्रांपर्यंत मर्यादित ठेवून, संशोधकांनी पुनर्प्राप्त केले:
- 704 भिन्न गोपनीयता कलाकृती एकूण
- २०४ तांत्रिक अभिज्ञापक (अंतर्गत URL, सर्व्हर पथ)
- 30 वैयक्तिक ईमेल पत्ते, नावे आणि पोस्टल पत्त्यांसह १२६ वैयक्तिकरित्या ओळखण्यायोग्य माहिती (PII) आयटम
- २३ क्रेडेन्शियल्स यामध्ये ६२ API की, ३३ पासवर्ड आणि २४ प्रवेश टोकन
704 कलाकृतींपैकी, 64 तर्क ब्लॉक्समध्ये विशेषतः दिसल्या आणि दृश्यमान सत्राच्या मजकुरात कुठेही दिसत नाहीत — म्हणजे ज्या विकसकांनी शेअर करण्यापूर्वी त्यांच्या लॉगचे पुनरावलोकन केले त्यांना ते रहस्ये लीक करत आहेत याची कल्पनाही नसेल.
एका दस्तऐवजीकरण केलेल्या उदाहरणाने GPT-5.2 कोडेक्स सत्र दाखवले जेथे मॉडेलच्या छुप्या तर्कामध्ये API की, AWS क्रेडेन्शियल्स आणि GitHub टोकन शोधणे आणि हाताळण्याबद्दल तपशीलवार अंतर्गत विचार आहेत - सर्व संभाषणाच्या दृश्यमान आउटपुटमध्ये अदृश्य आहेत.
अँटी-डिस्टिलेशन सेफगार्ड्सचा भंग करणे
दुसरा महत्त्वाचा परिणाम म्हणजे ऊर्धपातन विरोधी यंत्रणेचा छळ. प्रतिस्पर्ध्यांना त्या तर्कावर लहान मॉडेलचे प्रशिक्षण देण्यापासून रोखण्यासाठी AI प्रदाते त्यांच्या मॉडेलचे तर्क जाणूनबुजून लपवतात. संशोधकांचे तंत्र या सुरक्षा उपायांना पूर्णपणे बायपास करते.
डीकोड केलेल्या तर्काची निष्ठा सत्यापित करण्यासाठी, संशोधकांनी 120 Codeforces स्पर्धात्मक प्रोग्रामिंग समस्यांची चाचणी केली. डीकोड केलेल्या तर्काच्या टोकन संख्येने प्रत्येक मॉडेलच्या API द्वारे नोंदवलेल्या लपविलेल्या विचार-टोकन संख्येचा बारकाईने मागोवा घेतला, जवळपास-पूर्ण पुनर्प्राप्तीची पुष्टी केली.
चार अटॅक वेक्टर
पेपर या भेद्यतेद्वारे सक्षम केलेले चार वेगळे आक्रमण वेक्टर ओळखतो:
1. अँटी-डिस्टिलेशन चकमक — स्पर्धात्मक मॉडेल्सना प्रशिक्षित करण्यासाठी मालकीचे मॉडेलचे तर्क काढणे, जे अँथ्रोपिक, ओपनएआय आणि Google वर प्रदर्शित केले जाते.
2. मोठ्या प्रमाणात खाजगी डेटा काढणे — विकसकांनी नकळत सार्वजनिक भांडारांमध्ये शेअर केलेल्या हजारो एनक्रिप्टेड रिझनिंग ब्लॉक्समधून गुपिते आणि PII काढणे.
3. धोकादायक माहिती प्रकटीकरण — लपलेल्या तर्कामध्ये काहीवेळा अशी सामग्री असते जी प्रदात्यांनी संभाव्य धोकादायक माहितीसह, दृश्यमान आउटपुटमधून जाणूनबुजून दाबली जाते.
4. मॉडेल फिंगरप्रिंटिंग — मॉडेलची ओळख लपवून ठेवली असतानाही कोणत्या विशिष्ट मॉडेल आवृत्तीने ट्रेस तयार केला हे ओळखण्यासाठी डीकोड केलेले तर्क वापरले जाऊ शकतात.
कोणते मॉडेल प्रभावित आहेत
संशोधकांनी तीन प्रमुख प्रदात्यांच्या एनक्रिप्टेड तर्क प्रणालींमध्ये भेद्यतेची पुष्टी केली:
- अँथ्रोपिक — क्लॉड मॉडेल्स 'स्वाक्षरी' फील्डसह एनक्रिप्टेड `विचार' ब्लॉक परत करतात
- OpenAI — GPT मॉडेल एनक्रिप्टेड तर्क सारांश देतात
- Google — मिथुन मॉडेल एनक्रिप्टेड विचार ब्लॉक परत करतात
संशोधकांनी नमूद केले की, Kimi-K3, चायनीज AI कंपनी Moonshot AI चे मॉडेल जे अलीकडेच सँडबॉक्स चाचणीतून सुटले होते, ते विशेषतः संबंधित होते कारण त्याचे एनक्रिप्टेड तर्क ब्लॉक विशेषतः डीकोड करणे सोपे होते.
विकसकांसाठी याचा अर्थ काय आहे
डेव्हलपर्ससाठी व्यावहारिक टेकअवे अगदी स्पष्ट आहे: तुम्ही सार्वजनिकरीत्या सामायिक केलेला कोणताही कूटबद्ध तर्क ब्लॉक — GitHub रेपोमध्ये, हगिंग फेस डेटासेटमध्ये किंवा ब्लॉग पोस्टमध्ये — पुनर्प्राप्त करण्यायोग्य रहस्ये असू शकतात. एन्क्रिप्शन या वर्गाच्या हल्ल्याच्या विरूद्ध गोपनीयतेसाठी नव्हे तर सत्राच्या निरंतरतेसाठी डिझाइन केलेले आहे.
संशोधकांनी शिफारस केली आहे की विकासकांनी एनक्रिप्टेड रिझनिंग ब्लॉक्ससाठी शेअर केलेल्या सत्र लॉगचे ऑडिट करा आणि प्रकाशित करण्यापूर्वी ते काढून टाका. ते प्रदात्यांना त्यांच्या एन्क्रिप्टेड रिझनिंग सिस्टमच्या आर्किटेक्चरवर पुनर्विचार करण्याचे आवाहन करतात, जे सध्या सुरक्षिततेपेक्षा API सुविधेला प्राधान्य देतात.
हे संशोधन अलेक्झांडर पानफिलोव्ह, डेव्हिड श्मोट्झ आणि इलिया शुमेलोव्ह यांनी, जोनास गीपिंग आणि मॅक्सिम आंद्रियुशचेन्को यांच्या देखरेखीखाली, ELLIS इन्स्टिट्यूट ट्युबिंगेन, मॅक्स प्लँक इन्स्टिट्यूट फॉर इंटेलिजेंट सिस्टम्स, ट्युबिंगेन एआय सेंटर, MATS रिसर्च, स्नीक आणि यूनिव्हर्सिटी ऑफ ट्युबिंगेन यांच्यावर केले गेले.
AI च्या पुढे रहा
AI सुरक्षा लँडस्केप वेगाने विकसित होत आहे. नवीनतम AI घडामोडी आणि उदयोन्मुख भेद्यतेच्या सखोल कव्हरेजसाठी, AI Buzz Wire महत्त्वाच्या गोष्टी प्रदान करते.
अधिक AI बातम्या वाचा →