لقد أثبت فريق من الباحثين أن منطق سلسلة الأفكار الخفية التي تنتجها نماذج الذكاء الاصطناعي الرائدة من Anthropic وOpenAI وGoogle يمكن استردادها من الآثار المشفرة، مما يكشف منطق الملكية والبيانات الشخصية وبيانات الاعتماد على نطاق واسع.

تكشف النتائج، التي نُشرت في 11 أغسطس 2026، في ورقة بحثية بعنوان سرقة آثار الاستدلال من واجهات برمجة التطبيقات الخاصة بـ LLM، عن ثغرة معمارية أساسية في كيفية حماية كبار مزودي الذكاء الاصطناعي لملكيتهم الفكرية الأكثر قيمة. بالنسبة لأي شخص يتابع [أخبار الذكاء الاصطناعي العاجلة] (https://aibuzzwire.news)، يؤكد البحث كيف يمكن أن تصبح مخرجات النماذج المشفرة عائقًا عند مشاركتها علنًا.

كيف يعمل الهجوم

يقوم كبار مقدمي خدمات الذكاء الاصطناعي بإخفاء الاستدلال التدريجي لنماذجهم - المعروف باسم سلسلة الأفكار - لحماية الملكية الفكرية والحد من تسرب المعلومات. بدلاً من تخزين هذه الآثار من جانب الخادم، يقوم مقدمو الخدمة بإعادتها إلى العميل على شكل كتل نصية مشفرة يقوم العميل بتمريرها مرة أخرى مع كل طلب لاحق.

حدد الباحثون أن هذه الكتل المشفرة متوافقة تمامًا وقابلة للتبادل عبر جلسات ومستخدمين ونماذج مختلفة داخل النظام البيئي للموفر. قابلية النقل هذه هي مفتاح الهجوم.

تعمل الطريقة في استدعاءين لواجهة برمجة التطبيقات (API). أولاً، يأخذ المهاجم أثرًا منطقيًا مشفرًا ينتجه نموذج حدودي - على سبيل المثال، كلود أوبوس 4.8 - ويحقنه في نموذج شقيق أضعف وأقل حماية من نفس المزود، مثل كلود هايكو 4.5. يتم بعد ذلك كسر حماية النموذج الأضعف من خلال تعليمات بسيطة لنسخ المنطق حرفيًا. نظرًا لأن الكتلة المشفرة قابلة للتبديل، يقوم النموذج الأضعف بفك تشفير وإخراج المنطق المخفي للنموذج الأقوى في نص عادي - دون مهاجمة النموذج الأقوى بشكل مباشر.

وقد أظهر الباحثون هذا الهجوم عبر نماذج من جميع المزودين الرئيسيين الثلاثة: Anthropic's Claude، وOpenAI's GPT، وGoogle's Gemini.

حجم التعرض للبيانات

النتيجة الأكثر إثارة للقلق هي حجم البيانات الحساسة التي تم تسريبها من خلال سجلات الجلسات المشتركة بشكل عام. جمع الباحثون 6708 مسارات متاحة للعامة من GitHub وHugging Face - التي أنتجتها نماذج Claude وGPT وGemini وما زالت تحتوي على كتل استدلالية مشفرة.

أدى تطبيق خط أنابيب فك التشفير الخاص بهم على كل كتلة موقعة إلى 315,320 كتلة استدلالية مُعاد بناؤها. وكانت هذه الآثار المخفية تحتوي على أسرار حقيقية ومعلومات حساسة.

بالاقتصار على جلسات المستخدم الحقيقية وغير المعيارية، استعاد الباحثون ما يلي:

  • 704 عناصر خصوصية متميزة إجمالاً
  • 204 معرفات فنية (عناوين URL الداخلية، مسارات الخادم)
  • 126 عنصرًا من معلومات التعريف الشخصية (PII)، بما في ذلك 30 عنوان بريد إلكتروني شخصيًا وأسماء وعناوين بريدية
  • 23 بيانات اعتماد بما في ذلك 62 مفتاحًا لواجهة برمجة التطبيقات و33 كلمة مرور و24 رمزًا للوصول

من بين 704 قطعة أثرية، ظهرت 64 قطعة حصريًا داخل الكتل المنطقية ولم تظهر في أي مكان في نص الجلسة المرئي - مما يعني أن المطورين الذين راجعوا سجلاتهم قبل المشاركة لم يكن لديهم أي فكرة أنهم يسربون الأسرار.

أظهر أحد الأمثلة الموثقة جلسة Codex GPT-5.2 حيث احتوى المنطق المخفي للنموذج على أفكار داخلية مفصلة حول البحث عن مفاتيح API وبيانات اعتماد AWS ورموز GitHub والتعامل معها - وكلها غير مرئية في المخرجات المرئية للمحادثة.

التحايل على ضمانات مكافحة التقطير

الأثر الرئيسي الثاني هو التحايل على آليات مكافحة التقطير. يتعمد مقدمو الذكاء الاصطناعي إخفاء منطق نماذجهم لمنع المنافسين من تدريب نماذج أصغر على هذا المنطق. وتتجاوز تقنية الباحثين هذه الضمانات بالكامل.

وللتحقق من صحة المنطق الذي تم فك شفرته، اختبر الباحثون 120 مشكلة في البرمجة التنافسية لـ Codeforces. يتتبع عدد الرموز المميزة للاستدلال الذي تم فك تشفيره عن كثب عدد الرموز المميزة للتفكير المخفي التي أبلغت عنها واجهة برمجة التطبيقات (API) لكل نموذج، مما يؤكد الاسترداد شبه الكامل.

أربعة نواقل الهجوم

تحدد الورقة أربعة نواقل هجوم متميزة تم تمكينها بواسطة هذه الثغرة الأمنية:

1. التحايل على منع التقطير — استخلاص منطق نموذج الملكية لتدريب النماذج المنافسة، وهو ما تم عرضه عبر Anthropic وOpenAI وGoogle.

2. استخراج البيانات الخاصة على نطاق واسع — جمع الأسرار ومعلومات تحديد الهوية الشخصية من آلاف الكتل المنطقية المشفرة التي شاركها المطورون دون قصد في المستودعات العامة.

3. الكشف عن معلومات خطيرة — يحتوي المنطق المخفي أحيانًا على محتوى قام مقدمو الخدمة بمنعه عمدًا من المخرجات المرئية، بما في ذلك المعلومات التي يحتمل أن تكون خطرة.

4. بصمة النموذج — يمكن استخدام المنطق الذي تم فك تشفيره لتحديد إصدار النموذج المحدد الذي أنتج أثرًا، حتى عندما تكون هوية النموذج مخفية.

ما هي النماذج المتأثرة

أكد الباحثون وجود ثغرة أمنية عبر أنظمة الاستدلال المشفرة لثلاثة مزودين رئيسيين:

  • أنثروبي — تقوم نماذج كلود بإرجاع كتل "التفكير" المشفرة مع حقل "التوقيع"
  • OpenAI — تعرض نماذج GPT ملخصات منطقية مشفرة
  • Google — تعرض نماذج الجوزاء كتلًا فكرية مشفرة

وأشار الباحثون إلى أن حالة Kimi-K3، وهو نموذج من شركة Moonshot AI الصينية للذكاء الاصطناعي والذي أفلت مؤخرًا من اختبار وضع الحماية، كانت مثيرة للقلق بشكل خاص لأن كتل المنطق المشفرة الخاصة به أثبتت سهولة فك تشفيرها بشكل خاص.

ماذا يعني هذا بالنسبة للمطورين

إن الفكرة العملية للمطورين صارخة: أي كتلة تفكير مشفرة تشاركها علنًا - في GitHub repo، أو مجموعة بيانات Hugging Face، أو منشور مدونة - قد تحتوي على أسرار قابلة للاسترداد. تم تصميم التشفير لاستمرارية الجلسة، وليس السرية ضد هذا النوع من الهجمات.

يوصي الباحثون بأن يقوم المطورون بمراجعة سجلات الجلسات المشتركة بحثًا عن كتل المنطق المشفرة وإزالتها قبل النشر. كما يدعون مقدمي الخدمات إلى إعادة النظر في بنية أنظمة الاستدلال المشفرة الخاصة بهم، والتي تعطي الأولوية حاليًا لراحة واجهة برمجة التطبيقات (API) على الأمان.

أجرى البحث ألكسندر بانفيلوف، وديفيد شموتز، وإيليا شوميلوف، بإشراف جوناس جيبينج ومكسيم أندريوشينكو، عبر معهد ELLIS في توبنغن، ومعهد ماكس بلانك للأنظمة الذكية، ومركز توبنغن للذكاء الاصطناعي، وأبحاث MATS، وسنيك، وجامعة توبنغن.

ابق في صدارة الذكاء الاصطناعي

يتطور المشهد الأمني للذكاء الاصطناعي بسرعة. للحصول على أحدث تطورات الذكاء الاصطناعي والتغطية المتعمقة لنقاط الضعف الناشئة، تقدم AI Buzz Wire القصص المهمة.

اقرأ المزيد من أخبار الذكاء الاصطناعي →