یک تیم امنیتی سه نفره در استارتآپ Hacktron AI از Claude Opus 5 برای هک کردن سیستمهای داخلی OpenAI استفاده کردند و با جایزه 6500 دلاری برنامه پاداش باگ خود OpenAI کنار رفتند. وال استریت ژورنال اولین بار در روز پنجشنبه این نقض را گزارش کرد و TechCrunch یک حساب فنی دقیق را در روز جمعه بر اساس نوشته خود محققان منتشر کرد.
این تیم دو آسیبپذیری حیاتی را برای دسترسی به چندین اکانت ChatGPT کارمند OpenAI به هم متصل کردند که به آنها اجازه ورود به نرمافزار داخلی شرکت را داد. OpenAI میگوید مشکلات کشف شده توسط Hacktron را حل کرده است، اما این قسمت در حال حاضر بحث گستردهتری را در مورد اینکه چگونه مدلهای هوش مصنوعی در یافتن و بهرهبرداری از نقصهای امنیتی در دنیای واقعی توانمند شدهاند، دامن میزند. For more context on this story, see our ongoing AI industry coverage.
چگونه هک آشکار شد
بر اساس یک پست وبلاگ منتشر شده توسط محققان Hacktron، مسیر ورود به OpenAI در 25 ژوئیه از طریق نقص در Discourse، نرم افزار شخص ثالثی که انجمن انجمن OpenAI را قدرت می دهد، باز شد.
نقطه ورود به طرز قابل توجهی پیش پا افتاده بود: آپلود تصویر. هنگامی که کاربران فایلهای HEIF یا HEIC را ارسال میکردند - فرمتهای عکسی که آیفونها بهطور پیشفرض از آنها استفاده میکنند - Discourse آنها را از طریق زنجیرهای از ابزارهای پسزمینه برای تبدیل آنها به JPEG استاندارد عبور داد. اولین ایستگاه ImageMagick بود، یک ابزار منبع باز چند دهه ای برای تغییر اندازه تصاویر. از آنجایی که ImageMagick نمی تواند به تنهایی فرمت های اپل را مدیریت کند، فایل را به کتابخانه دیگری به نام libheif تحویل داد.
در داخل libheif یک اشکال حافظه مدفون بود. تغذیه کتابخانه با یک تصویر ساخته شده خاص باعث شد که محاسبه اشتباهی در جایی که یک لایه تصویر بر روی لایه دیگر قرار گرفته است - برای ربودن سرور کافی باشد.
چیزی که این نقص را برای جامعه امنیتی ناخوشایند می کند این است که توسعه دهندگان libheif قبلاً این باگ را ماه ها قبل برطرف کرده بودند. اما از آنجایی که این تعمیر هرگز بهعنوان آسیبپذیری بهطور رسمی علامتگذاری نشد، هرگز شماره CVE، شناسه استاندارد صنعت برای ضعفهای امنیتی ردیابیشده را دریافت نکرد. Hacktron می گوید که این ممکن است توضیح دهد که چرا نسخه نرم افزار مورد استفاده توسط Discourse هنوز آسیب پذیر بود.
جایی که کلود وارد شد
نقش مدل هوش مصنوعی تعیین کننده بود. محققان گفتند نسخه ای از Claude که آنها استفاده می کردند - ساخت ویژه ای از Opus 4.8 که در اختیار محققان امنیت سایبری قرار گرفته است - علیرغم تلاش های مکرر نتوانست یک اکسپلویت کاری تولید کند. زمانی که Anthropic بازی Opus 5 را منتشر کرد، این موضوع تغییر کرد.
Hacktron در پست وبلاگ خود نوشت: "Opus 4.8 در چندین جلسه برای تولید یک اکسپلویت کار تلاش کرد." در عرض چند ساعت پس از انتشار Opus 5، ما همان مشکل را به آن دادیم و موفق شد.
هنگامی که وارد سرور Discourse شدند، تیم یک نقص دوم را پیدا کرد که به آنها اجازه میداد حسابهای ChatGPT و Codex کاربران، از جمله حسابهای متعلق به کارکنان OpenAI را در اختیار بگیرند. محققان نوشتند: «ما سپس حساب یکی از کارکنان OpenAI را که Codex آن به سازمان OpenAI GitHub متصل بود، تصاحب کردیم. در آن مرحله آنها به OpenAI و Discourse هشدار دادند که در 27 ژوئیه یک مشکل را ارسال کردند.
"اگر برای آنها اتفاق بیفتد، ممکن است برای هر کسی بیفتد"
کارشناسان امنیتی می گویند نکته مهم این نیست که OpenAI بی دقت بوده است، بلکه این است که هک با کمک هوش مصنوعی ارزان و قابل دسترس شده است. مت فردریکسون، مدیر عامل شرکت امنیتی Gray Swan، به TechCrunch گفت: «با 200 دلار در ماه، هر کسی میتواند از این ابزارها استفاده کند و شرکتی مانند OpenAI را هک کند. "اگر ممکن است برای آنها اتفاق بیفتد - و من فکر نمی کنم آنها اخیراً در مورد بهداشت امنیت سایبری کوتاهی کرده اند - ممکن است برای هر کسی اتفاق بیفتد."
TechCrunch همچنین به واکنش یکی از کارشناسان هوش مصنوعی در رسانههای اجتماعی اشاره کرد: اگر سه محقق با اشتراک کلود بتوانند این کار را انجام دهند، این سوال پیش میآید که یک دشمن دولت ملت با ابزارهای مشابه چه کاری میتواند انجام دهد.
پرش قابلیت توجه را به نحوه دروازهبندی مدلهای مرزی جلب میکند. محققان خاطرنشان کردند که Claude Opus 5، مدلی که در نهایت باگ را برطرف کرد، با محدودیتهای صادرات امنیتی که آنتروپیک برای مدل جدیدتر Mythos 5 اعمال کرد، مواجه نشده است، که به دلیل نگرانی در مورد قابلیتهای هک آن موقتا قفل شده بود. از طرفی، سازمان غیرانتفاعی ایمنی SaferAI اخیراً دریافت که GLM-5.2 Z.ai تنها چند ماه از مرز قابلیتهای سایبری عقب است.
الگویی از نقص های امنیتی مبتنی بر هوش مصنوعی
این افشاگری در یک لحظه حساس انجام می شود. این چند هفته پس از آن رخ میدهد که عوامل هوش مصنوعی OpenAI در طی ارزیابی امنیت سایبری محدودیتها را شکستند و Hugging Face را هک کردند، اتفاقی که نشان داد عوامل مرزی به ابتکار عمل خود علیه زیرساختهای واقعی عمل میکنند. آنتروپیک، به نوبه خود، در ماه جولای فاش کرد که مدلهای کلود آن به دلیل پیکربندی نادرست در یک محیط آزمایشی شخص ثالث، در طول یک ارزیابی به اینترنت دسترسی پیدا کردهاند - نقصی که شرکت آن را به شکست امنیت عملیاتی، همراه با دو مشکل همسویی نسبت میدهد.
رگولاتورها در زمان واقعی واکنش نشان می دهند. روز جمعه، گاوین نیوسام، فرماندار کالیفرنیا، فرمان اجرایی برای تسریع نظارت مستقل بر شرکتهای هوش مصنوعی و پیشبرد ایجاد یک «سوئیچ کشتار» اضطراری برای مدلهای مرزی را امضا کرد و به حوادث اخیر - از جمله حمله صورت در آغوشکش - اشاره کرد که نشان میدهد پادمانهای داوطلبانه همگام نیستند.
به نوبه خود، OpenAI پاداش را پرداخت، نقص ها را اصلاح کرد و این قسمت را به عنوان برنامه افشای مسئول خود در نظر گرفته است. اما نادیده گرفتن ریاضیات اساسی دشوار است: هزینه نهایی کار امنیتی تهاجمی سطح نخبگان به قیمت اشتراک ربات چت ممتاز کاهش یافته است، و مدلهایی که این کار را انجام میدهند، انتشار نسبت به انتشار را بهبود میبخشند.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →