یک تیم امنیتی سه نفره در استارت‌آپ Hacktron AI از Claude Opus 5 برای هک کردن سیستم‌های داخلی OpenAI استفاده کردند و با جایزه 6500 دلاری برنامه پاداش باگ خود OpenAI کنار رفتند. وال استریت ژورنال اولین بار در روز پنجشنبه این نقض را گزارش کرد و TechCrunch یک حساب فنی دقیق را در روز جمعه بر اساس نوشته خود محققان منتشر کرد.

این تیم دو آسیب‌پذیری حیاتی را برای دسترسی به چندین اکانت ChatGPT کارمند OpenAI به هم متصل کردند که به آنها اجازه ورود به نرم‌افزار داخلی شرکت را داد. OpenAI می‌گوید مشکلات کشف شده توسط Hacktron را حل کرده است، اما این قسمت در حال حاضر بحث گسترده‌تری را در مورد اینکه چگونه مدل‌های هوش مصنوعی در یافتن و بهره‌برداری از نقص‌های امنیتی در دنیای واقعی توانمند شده‌اند، دامن می‌زند. For more context on this story, see our ongoing AI industry coverage.

چگونه هک آشکار شد

بر اساس یک پست وبلاگ منتشر شده توسط محققان Hacktron، مسیر ورود به OpenAI در 25 ژوئیه از طریق نقص در Discourse، نرم افزار شخص ثالثی که انجمن انجمن OpenAI را قدرت می دهد، باز شد.

نقطه ورود به طرز قابل توجهی پیش پا افتاده بود: آپلود تصویر. هنگامی که کاربران فایل‌های HEIF یا HEIC را ارسال می‌کردند - فرمت‌های عکسی که آیفون‌ها به‌طور پیش‌فرض از آنها استفاده می‌کنند - Discourse آنها را از طریق زنجیره‌ای از ابزارهای پس‌زمینه برای تبدیل آن‌ها به JPEG استاندارد عبور داد. اولین ایستگاه ImageMagick بود، یک ابزار منبع باز چند دهه ای برای تغییر اندازه تصاویر. از آنجایی که ImageMagick نمی تواند به تنهایی فرمت های اپل را مدیریت کند، فایل را به کتابخانه دیگری به نام libheif تحویل داد.

در داخل libheif یک اشکال حافظه مدفون بود. تغذیه کتابخانه با یک تصویر ساخته شده خاص باعث شد که محاسبه اشتباهی در جایی که یک لایه تصویر بر روی لایه دیگر قرار گرفته است - برای ربودن سرور کافی باشد.

چیزی که این نقص را برای جامعه امنیتی ناخوشایند می کند این است که توسعه دهندگان libheif قبلاً این باگ را ماه ها قبل برطرف کرده بودند. اما از آنجایی که این تعمیر هرگز به‌عنوان آسیب‌پذیری به‌طور رسمی علامت‌گذاری نشد، هرگز شماره CVE، شناسه استاندارد صنعت برای ضعف‌های امنیتی ردیابی‌شده را دریافت نکرد. Hacktron می گوید که این ممکن است توضیح دهد که چرا نسخه نرم افزار مورد استفاده توسط Discourse هنوز آسیب پذیر بود.

جایی که کلود وارد شد

نقش مدل هوش مصنوعی تعیین کننده بود. محققان گفتند نسخه ای از Claude که آنها استفاده می کردند - ساخت ویژه ای از Opus 4.8 که در اختیار محققان امنیت سایبری قرار گرفته است - علیرغم تلاش های مکرر نتوانست یک اکسپلویت کاری تولید کند. زمانی که Anthropic بازی Opus 5 را منتشر کرد، این موضوع تغییر کرد.

Hacktron در پست وبلاگ خود نوشت: "Opus 4.8 در چندین جلسه برای تولید یک اکسپلویت کار تلاش کرد." در عرض چند ساعت پس از انتشار Opus 5، ما همان مشکل را به آن دادیم و موفق شد.

هنگامی که وارد سرور Discourse شدند، تیم یک نقص دوم را پیدا کرد که به آنها اجازه می‌داد حساب‌های ChatGPT و Codex کاربران، از جمله حساب‌های متعلق به کارکنان OpenAI را در اختیار بگیرند. محققان نوشتند: «ما سپس حساب یکی از کارکنان OpenAI را که Codex آن به سازمان OpenAI GitHub متصل بود، تصاحب کردیم. در آن مرحله آنها به OpenAI و Discourse هشدار دادند که در 27 ژوئیه یک مشکل را ارسال کردند.

"اگر برای آنها اتفاق بیفتد، ممکن است برای هر کسی بیفتد"

کارشناسان امنیتی می گویند نکته مهم این نیست که OpenAI بی دقت بوده است، بلکه این است که هک با کمک هوش مصنوعی ارزان و قابل دسترس شده است. مت فردریکسون، مدیر عامل شرکت امنیتی Gray Swan، به TechCrunch گفت: «با 200 دلار در ماه، هر کسی می‌تواند از این ابزارها استفاده کند و شرکتی مانند OpenAI را هک کند. "اگر ممکن است برای آنها اتفاق بیفتد - و من فکر نمی کنم آنها اخیراً در مورد بهداشت امنیت سایبری کوتاهی کرده اند - ممکن است برای هر کسی اتفاق بیفتد."

TechCrunch همچنین به واکنش یکی از کارشناسان هوش مصنوعی در رسانه‌های اجتماعی اشاره کرد: اگر سه محقق با اشتراک کلود بتوانند این کار را انجام دهند، این سوال پیش می‌آید که یک دشمن دولت ملت با ابزارهای مشابه چه کاری می‌تواند انجام دهد.

پرش قابلیت توجه را به نحوه دروازه‌بندی مدل‌های مرزی جلب می‌کند. محققان خاطرنشان کردند که Claude Opus 5، مدلی که در نهایت باگ را برطرف کرد، با محدودیت‌های صادرات امنیتی که آنتروپیک برای مدل جدیدتر Mythos 5 اعمال کرد، مواجه نشده است، که به دلیل نگرانی در مورد قابلیت‌های هک آن موقتا قفل شده بود. از طرفی، سازمان غیرانتفاعی ایمنی SaferAI اخیراً دریافت که GLM-5.2 Z.ai تنها چند ماه از مرز قابلیت‌های سایبری عقب است.

الگویی از نقص های امنیتی مبتنی بر هوش مصنوعی

این افشاگری در یک لحظه حساس انجام می شود. این چند هفته پس از آن رخ می‌دهد که عوامل هوش مصنوعی OpenAI در طی ارزیابی امنیت سایبری محدودیت‌ها را شکستند و Hugging Face را هک کردند، اتفاقی که نشان داد عوامل مرزی به ابتکار عمل خود علیه زیرساخت‌های واقعی عمل می‌کنند. آنتروپیک، به نوبه خود، در ماه جولای فاش کرد که مدل‌های کلود آن به دلیل پیکربندی نادرست در یک محیط آزمایشی شخص ثالث، در طول یک ارزیابی به اینترنت دسترسی پیدا کرده‌اند - نقصی که شرکت آن را به شکست امنیت عملیاتی، همراه با دو مشکل همسویی نسبت می‌دهد.

رگولاتورها در زمان واقعی واکنش نشان می دهند. روز جمعه، گاوین نیوسام، فرماندار کالیفرنیا، فرمان اجرایی برای تسریع نظارت مستقل بر شرکت‌های هوش مصنوعی و پیشبرد ایجاد یک «سوئیچ کشتار» اضطراری برای مدل‌های مرزی را امضا کرد و به حوادث اخیر - از جمله حمله صورت در آغوش‌کش - اشاره کرد که نشان می‌دهد پادمان‌های داوطلبانه همگام نیستند.

به نوبه خود، OpenAI پاداش را پرداخت، نقص ها را اصلاح کرد و این قسمت را به عنوان برنامه افشای مسئول خود در نظر گرفته است. اما نادیده گرفتن ریاضیات اساسی دشوار است: هزینه نهایی کار امنیتی تهاجمی سطح نخبگان به قیمت اشتراک ربات چت ممتاز کاهش یافته است، و مدل‌هایی که این کار را انجام می‌دهند، انتشار نسبت به انتشار را بهبود می‌بخشند.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →