تیمی از محققان نشان داده‌اند که استدلال زنجیره‌ای از افکار پنهان تولید شده توسط مدل‌های پیشرو هوش مصنوعی Anthropic، OpenAI و Google را می‌توان از ردیابی‌های رمزگذاری‌شده بازیابی کرد و منطق اختصاصی، داده‌های شخصی و اعتبارنامه‌ها را در مقیاس در معرض دید قرار داد.

این یافته‌ها که در ۱۱ آگوست ۲۰۲۶ در مقاله‌ای با عنوان Stealing Reasoning Traces from Proprietary LLM APIs منتشر شد، یک آسیب‌پذیری اساسی معماری را در نحوه محافظت ارائه‌دهندگان اصلی هوش مصنوعی از ارزشمندترین دارایی‌های معنوی خود نشان می‌دهد. برای هر کسی که [اخبار فوری هوش مصنوعی] (https://aibuzzwire.news) را دنبال می‌کند، این تحقیق نشان می‌دهد که چگونه حتی خروجی‌های مدل رمزگذاری‌شده می‌توانند در صورت اشتراک‌گذاری عمومی به یک بدهی تبدیل شوند.

حمله چگونه کار می کند

ارائه دهندگان پیشرو هوش مصنوعی استدلال گام به گام مدل های خود را پنهان می کنند - معروف به زنجیره فکر - برای محافظت از مالکیت معنوی و محدود کردن نشت اطلاعات. به‌جای ذخیره‌سازی این ردیابی‌ها در سمت سرور، ارائه‌دهندگان آنها را به‌عنوان بلوک‌های متن رمزگذاری‌شده به مشتری برمی‌گردانند که مشتری با هر درخواست بعدی آن‌ها را پس می‌دهد.

محققان تشخیص دادند که این بلوک‌های رمزگذاری‌شده کاملاً سازگار و قابل تعویض در جلسات، کاربران و مدل‌های مختلف در اکوسیستم ارائه‌دهنده هستند. این قابلیت حمل کلید حمله است.

این روش در دو فراخوانی API کار می کند. ابتدا، یک مهاجم یک رد استدلال رمزگذاری شده تولید شده توسط یک مدل مرزی - به عنوان مثال، Claude Opus 4.8 - را می گیرد و آن را به یک مدل خواهر و برادر ضعیف تر و کمتر محافظت شده از همان ارائه دهنده، مانند Claude Haiku 4.5 تزریق می کند. سپس مدل ضعیفتر با یک دستورالعمل ساده برای رونویسی کلمه به کلمه استدلال جیلبریک می شود. از آنجایی که بلوک رمزگذاری‌شده قابل تعویض است، مدل ضعیف‌تر استدلال پنهان مدل قوی‌تر را در متن ساده رمزگشایی و خروجی می‌دهد - بدون اینکه هرگز به مدل قوی‌تر حمله کند.

محققان این حمله را در مدل‌های هر سه ارائه‌دهنده اصلی نشان دادند: Anthropic's Claude، OpenAI's GPT و Google's Gemini.

مقیاس قرار گرفتن در معرض داده ها

نگران‌کننده‌ترین یافته، مقیاس داده‌های حساس است که از طریق گزارش‌های جلسه به اشتراک گذاشته شده عمومی به بیرون درز کرده است. محققان 6708 مسیر عامل در دسترس عموم را از GitHub و Hugging Face جمع‌آوری کردند که توسط مدل‌های Claude، GPT و Gemini تولید شده‌اند و همچنان حاوی بلوک‌های استدلال رمزگذاری‌شده هستند.

با اعمال خط لوله رمزگشایی آنها برای هر بلوک امضا شده 315320 بلوک استدلال بازسازی شده به دست آمد. این آثار پنهان حاوی اسرار واقعی و اطلاعات حساس بود.

محققان با محدود کردن به جلسات کاربر واقعی و بدون معیار، موارد زیر را بازیابی کردند:

  • 704 مصنوع حریم خصوصی مجزا مجموعا
  • 204 شناسه فنی (نشانی های اینترنتی داخلی، مسیرهای سرور)
  • 126 مورد اطلاعات شخصی قابل شناسایی (PII)، از جمله 30 آدرس ایمیل شخصی، نام و آدرس پستی
  • 23 اعتبار شامل 62 کلید API، 33 رمز عبور و 24 توکن دسترسی

از 704 مصنوع، 64 مورد به‌طور انحصاری** در بلوک‌های استدلال ظاهر شدند و در هیچ جای متن جلسه قابل مشاهده نبودند - به این معنی که توسعه‌دهندگانی که گزارش‌های خود را قبل از اشتراک‌گذاری مرور می‌کردند، نمی‌دانستند که اسرار افشا می‌شوند.

یک مثال مستند، جلسه کدکس GPT-5.2 را نشان می‌دهد که در آن استدلال پنهان مدل حاوی افکار داخلی دقیق در مورد جستجو و مدیریت کلیدهای API، اعتبارنامه‌های AWS و نشانه‌های GitHub بود - که همه در خروجی قابل مشاهده مکالمه نامرئی هستند.

دور زدن پادمان های ضد تقطیر

دومین پیامد اصلی دور زدن مکانیسم های ضد تقطیر است. ارائه دهندگان هوش مصنوعی به طور عمدی استدلال مدل های خود را پنهان می کنند تا از آموزش مدل های کوچکتر رقبا بر اساس آن منطق جلوگیری کنند. تکنیک محققین به طور کامل این حفاظت ها را دور می زند.

برای تأیید صحت استدلال رمزگشایی شده، محققان 120 مشکل برنامه نویسی رقابتی Codeforces را آزمایش کردند. تعداد نشانه‌های استدلال رمزگشایی شده، تعداد نشانه‌های تفکر پنهان گزارش‌شده توسط API هر مدل را از نزدیک ردیابی می‌کرد و بازیابی تقریباً کامل را تأیید می‌کرد.

چهار بردار حمله

این مقاله چهار بردار حمله متمایز فعال شده توسط این آسیب‌پذیری را شناسایی می‌کند:

1. دور زدن ضد تقطیر - استخراج استدلال یک مدل اختصاصی برای آموزش مدل های رقیب، که در Anthropic، OpenAI و Google نشان داده شده است.

2. استخراج داده های خصوصی در مقیاس بزرگ - برداشت اسرار و PII از هزاران بلوک استدلال رمزگذاری شده که توسعه دهندگان ناآگاهانه در مخازن عمومی به اشتراک گذاشته اند.

3. افشای اطلاعات خطرناک - استدلال پنهان گاهی اوقات حاوی محتوایی است که ارائه دهندگان عمداً از خروجی قابل مشاهده حذف می کنند، از جمله اطلاعات بالقوه خطرناک.

4. انگشت‌نگاری مدل - استدلال رمزگشایی شده می‌تواند برای تشخیص اینکه کدام نسخه مدل خاص ردیابی ایجاد کرده است، حتی زمانی که هویت مدل پنهان است، استفاده شود.

کدام مدل ها تحت تاثیر قرار می گیرند

محققان این آسیب‌پذیری را در سیستم‌های استدلال رمزگذاری‌شده سه ارائه‌دهنده اصلی تأیید کردند:

  • Anthropic - مدل های کلود بلوک های "تفکر" رمزگذاری شده را با فیلد "امضا" برمی گرداند.
  • OpenAI - مدل های GPT خلاصه های استدلال رمزگذاری شده را برمی گرداند
  • Google - مدل های Gemini بلوک های فکری رمزگذاری شده را برمی گرداند

محققان خاطرنشان کردند که مورد Kimi-K3، مدلی از شرکت چینی هوش مصنوعی Moonshot AI که اخیراً از آزمایش جعبه شنی فرار کرده است، به ویژه نگران‌کننده بود زیرا رمزگشایی بلوک‌های استدلال رمزگذاری‌شده آن بسیار آسان بود.

این برای توسعه دهندگان به چه معناست

نکته عملی برای توسعه دهندگان بسیار واضح است: هر بلوک استدلال رمزگذاری شده ای که به صورت عمومی به اشتراک می گذارید - در مخزن GitHub، مجموعه داده Hugging Face یا یک پست وبلاگ - ممکن است حاوی اسرار قابل بازیابی باشد. رمزگذاری برای تداوم جلسه طراحی شده است، نه محرمانه بودن در برابر این دسته از حملات.

محققان توصیه می‌کنند که توسعه‌دهندگان گزارش‌های جلسه مشترک را برای بلوک‌های استدلال رمزگذاری‌شده بررسی کرده و قبل از انتشار آن‌ها را حذف کنند. آنها همچنین از ارائه دهندگان می خواهند که در معماری سیستم های استدلال رمزگذاری شده خود که در حال حاضر راحتی API را بر امنیت اولویت دارند، تجدید نظر کنند.

این تحقیق توسط الکساندر پانفیلوف، دیوید اشموتز و ایلیا شومیلوف، با نظارت یوناس گایپینگ و ماکسیم آندریوشچنکو، در سراسر موسسه ELLIS توبینگن، موسسه Max Planck برای سیستم‌های هوشمند، مرکز هوش مصنوعی توبینگن، تحقیقات MATS، Snyk و دانشگاه توبینگن انجام شد.

از هوش مصنوعی جلوتر بمانید

چشم انداز امنیتی هوش مصنوعی به سرعت در حال تحول است. برای [آخرین پیشرفت‌های هوش مصنوعی] (https://aibuzzwire.news) و پوشش عمیق آسیب‌پذیری‌های در حال ظهور، AI Buzz Wire داستان‌های مهم را ارائه می‌دهد.

بیشتر بخوانید اخبار هوش مصنوعی →