تیمی از محققان نشان دادهاند که استدلال زنجیرهای از افکار پنهان تولید شده توسط مدلهای پیشرو هوش مصنوعی Anthropic، OpenAI و Google را میتوان از ردیابیهای رمزگذاریشده بازیابی کرد و منطق اختصاصی، دادههای شخصی و اعتبارنامهها را در مقیاس در معرض دید قرار داد.
این یافتهها که در ۱۱ آگوست ۲۰۲۶ در مقالهای با عنوان Stealing Reasoning Traces from Proprietary LLM APIs منتشر شد، یک آسیبپذیری اساسی معماری را در نحوه محافظت ارائهدهندگان اصلی هوش مصنوعی از ارزشمندترین داراییهای معنوی خود نشان میدهد. برای هر کسی که [اخبار فوری هوش مصنوعی] (https://aibuzzwire.news) را دنبال میکند، این تحقیق نشان میدهد که چگونه حتی خروجیهای مدل رمزگذاریشده میتوانند در صورت اشتراکگذاری عمومی به یک بدهی تبدیل شوند.
حمله چگونه کار می کند
ارائه دهندگان پیشرو هوش مصنوعی استدلال گام به گام مدل های خود را پنهان می کنند - معروف به زنجیره فکر - برای محافظت از مالکیت معنوی و محدود کردن نشت اطلاعات. بهجای ذخیرهسازی این ردیابیها در سمت سرور، ارائهدهندگان آنها را بهعنوان بلوکهای متن رمزگذاریشده به مشتری برمیگردانند که مشتری با هر درخواست بعدی آنها را پس میدهد.
محققان تشخیص دادند که این بلوکهای رمزگذاریشده کاملاً سازگار و قابل تعویض در جلسات، کاربران و مدلهای مختلف در اکوسیستم ارائهدهنده هستند. این قابلیت حمل کلید حمله است.
این روش در دو فراخوانی API کار می کند. ابتدا، یک مهاجم یک رد استدلال رمزگذاری شده تولید شده توسط یک مدل مرزی - به عنوان مثال، Claude Opus 4.8 - را می گیرد و آن را به یک مدل خواهر و برادر ضعیف تر و کمتر محافظت شده از همان ارائه دهنده، مانند Claude Haiku 4.5 تزریق می کند. سپس مدل ضعیفتر با یک دستورالعمل ساده برای رونویسی کلمه به کلمه استدلال جیلبریک می شود. از آنجایی که بلوک رمزگذاریشده قابل تعویض است، مدل ضعیفتر استدلال پنهان مدل قویتر را در متن ساده رمزگشایی و خروجی میدهد - بدون اینکه هرگز به مدل قویتر حمله کند.
محققان این حمله را در مدلهای هر سه ارائهدهنده اصلی نشان دادند: Anthropic's Claude، OpenAI's GPT و Google's Gemini.
مقیاس قرار گرفتن در معرض داده ها
نگرانکنندهترین یافته، مقیاس دادههای حساس است که از طریق گزارشهای جلسه به اشتراک گذاشته شده عمومی به بیرون درز کرده است. محققان 6708 مسیر عامل در دسترس عموم را از GitHub و Hugging Face جمعآوری کردند که توسط مدلهای Claude، GPT و Gemini تولید شدهاند و همچنان حاوی بلوکهای استدلال رمزگذاریشده هستند.
با اعمال خط لوله رمزگشایی آنها برای هر بلوک امضا شده 315320 بلوک استدلال بازسازی شده به دست آمد. این آثار پنهان حاوی اسرار واقعی و اطلاعات حساس بود.
محققان با محدود کردن به جلسات کاربر واقعی و بدون معیار، موارد زیر را بازیابی کردند:
- 704 مصنوع حریم خصوصی مجزا مجموعا
- 204 شناسه فنی (نشانی های اینترنتی داخلی، مسیرهای سرور)
- 126 مورد اطلاعات شخصی قابل شناسایی (PII)، از جمله 30 آدرس ایمیل شخصی، نام و آدرس پستی
- 23 اعتبار شامل 62 کلید API، 33 رمز عبور و 24 توکن دسترسی
از 704 مصنوع، 64 مورد بهطور انحصاری** در بلوکهای استدلال ظاهر شدند و در هیچ جای متن جلسه قابل مشاهده نبودند - به این معنی که توسعهدهندگانی که گزارشهای خود را قبل از اشتراکگذاری مرور میکردند، نمیدانستند که اسرار افشا میشوند.
یک مثال مستند، جلسه کدکس GPT-5.2 را نشان میدهد که در آن استدلال پنهان مدل حاوی افکار داخلی دقیق در مورد جستجو و مدیریت کلیدهای API، اعتبارنامههای AWS و نشانههای GitHub بود - که همه در خروجی قابل مشاهده مکالمه نامرئی هستند.
دور زدن پادمان های ضد تقطیر
دومین پیامد اصلی دور زدن مکانیسم های ضد تقطیر است. ارائه دهندگان هوش مصنوعی به طور عمدی استدلال مدل های خود را پنهان می کنند تا از آموزش مدل های کوچکتر رقبا بر اساس آن منطق جلوگیری کنند. تکنیک محققین به طور کامل این حفاظت ها را دور می زند.
برای تأیید صحت استدلال رمزگشایی شده، محققان 120 مشکل برنامه نویسی رقابتی Codeforces را آزمایش کردند. تعداد نشانههای استدلال رمزگشایی شده، تعداد نشانههای تفکر پنهان گزارششده توسط API هر مدل را از نزدیک ردیابی میکرد و بازیابی تقریباً کامل را تأیید میکرد.
چهار بردار حمله
این مقاله چهار بردار حمله متمایز فعال شده توسط این آسیبپذیری را شناسایی میکند:
1. دور زدن ضد تقطیر - استخراج استدلال یک مدل اختصاصی برای آموزش مدل های رقیب، که در Anthropic، OpenAI و Google نشان داده شده است.
2. استخراج داده های خصوصی در مقیاس بزرگ - برداشت اسرار و PII از هزاران بلوک استدلال رمزگذاری شده که توسعه دهندگان ناآگاهانه در مخازن عمومی به اشتراک گذاشته اند.
3. افشای اطلاعات خطرناک - استدلال پنهان گاهی اوقات حاوی محتوایی است که ارائه دهندگان عمداً از خروجی قابل مشاهده حذف می کنند، از جمله اطلاعات بالقوه خطرناک.
4. انگشتنگاری مدل - استدلال رمزگشایی شده میتواند برای تشخیص اینکه کدام نسخه مدل خاص ردیابی ایجاد کرده است، حتی زمانی که هویت مدل پنهان است، استفاده شود.
کدام مدل ها تحت تاثیر قرار می گیرند
محققان این آسیبپذیری را در سیستمهای استدلال رمزگذاریشده سه ارائهدهنده اصلی تأیید کردند:
- Anthropic - مدل های کلود بلوک های "تفکر" رمزگذاری شده را با فیلد "امضا" برمی گرداند.
- OpenAI - مدل های GPT خلاصه های استدلال رمزگذاری شده را برمی گرداند
- Google - مدل های Gemini بلوک های فکری رمزگذاری شده را برمی گرداند
محققان خاطرنشان کردند که مورد Kimi-K3، مدلی از شرکت چینی هوش مصنوعی Moonshot AI که اخیراً از آزمایش جعبه شنی فرار کرده است، به ویژه نگرانکننده بود زیرا رمزگشایی بلوکهای استدلال رمزگذاریشده آن بسیار آسان بود.
این برای توسعه دهندگان به چه معناست
نکته عملی برای توسعه دهندگان بسیار واضح است: هر بلوک استدلال رمزگذاری شده ای که به صورت عمومی به اشتراک می گذارید - در مخزن GitHub، مجموعه داده Hugging Face یا یک پست وبلاگ - ممکن است حاوی اسرار قابل بازیابی باشد. رمزگذاری برای تداوم جلسه طراحی شده است، نه محرمانه بودن در برابر این دسته از حملات.
محققان توصیه میکنند که توسعهدهندگان گزارشهای جلسه مشترک را برای بلوکهای استدلال رمزگذاریشده بررسی کرده و قبل از انتشار آنها را حذف کنند. آنها همچنین از ارائه دهندگان می خواهند که در معماری سیستم های استدلال رمزگذاری شده خود که در حال حاضر راحتی API را بر امنیت اولویت دارند، تجدید نظر کنند.
این تحقیق توسط الکساندر پانفیلوف، دیوید اشموتز و ایلیا شومیلوف، با نظارت یوناس گایپینگ و ماکسیم آندریوشچنکو، در سراسر موسسه ELLIS توبینگن، موسسه Max Planck برای سیستمهای هوشمند، مرکز هوش مصنوعی توبینگن، تحقیقات MATS، Snyk و دانشگاه توبینگن انجام شد.
از هوش مصنوعی جلوتر بمانید
چشم انداز امنیتی هوش مصنوعی به سرعت در حال تحول است. برای [آخرین پیشرفتهای هوش مصنوعی] (https://aibuzzwire.news) و پوشش عمیق آسیبپذیریهای در حال ظهور، AI Buzz Wire داستانهای مهم را ارائه میدهد.
بیشتر بخوانید اخبار هوش مصنوعی →