محققان یک حمله جدید قدرتمند را علیه مدلهای هوش مصنوعی استدلالی نشان دادهاند که از یک نقطه کور اساسی در نحوه جداسازی مدلهای زبان بزرگ (LLM) دستورالعملها از دادهها استفاده میکند. این تکنیک که جعل زنجیرهای از فکر (CoT) نامیده میشود، یک مدل را فریب میدهد تا با متن ارائهشده توسط مهاجم بهگونهای رفتار کند که گویی استدلال داخلی خصوصی خود مدل است و به متن اجازه میدهد دستورالعملهای قانونی را نادیده بگیرد.
این یافته ها که توسط Hackaday گزارش شده است، تاکید می کند که چرا ایمن سازی سیستم های هوش مصنوعی در برابر دستکاری یک مشکل حل نشده باقی مانده است. برای همگام شدن با تهدیدات در حال ظهور در این زمینه، [پوشش صنعت هوش مصنوعی] (https://aibuzzwire.news) ما را برای تجزیه و تحلیل مداوم دنبال کنید.
علت اصلی: سردرگمی نقش
در قلب این آسیبپذیری چیزی است که محققان به عنوان «آشفتگی نقش» توصیف میکنند. LLM های مدرن تمام ورودی های خود - قوانین سیستم، درخواست های کاربر و استدلال زنجیره ای فکری مدل را - از طریق یک کانال متنی واحد دریافت می کنند. برای تحمیل نظم، توسعه دهندگان از تگ های ابرداده مانند «
تگ «
حمله چگونه کار می کند
مهمتر از همه، CoT Forgery صرفاً به معنای قرار دادن یک پیام مخرب در داخل برچسبهای «
به گفته Hackaday، این باعث میشود که LLM استدلال غیرمنطقی شفاف را به عنوان یک نتیجهگیری پیشفرض بپذیرد و پاسخ خود را به درخواست کاربر تغییر دهد. از آنجایی که محتوای جعلی بهعنوان تفکر داخلی با اعتماد بالا به جای ورودی کاربر کماعتماد تلقی میشود، میتواند حفاظهای ایمنی را که معمولاً دستورالعملهای دستکاری را مسدود میکنند، دور بزند.
سلسله مراتب اعتماد در داخل یک LLM
درک اینکه چرا حمله موفق می شود، مستلزم درک نحوه عملکرد نقش ها است. در زیر سرپوش، نقش ها ورودی مدل را به یک سلسله مراتب سازمان یافته تقسیم می کنند. دستورالعمل های مربوط به یک نقش تا زمانی که با دستورالعمل های دارای اولویت بالاتر تضاد نداشته باشند، دنبال می شوند. برای مثال، یک دستورالعمل در سطح سیستم مبنی بر «درباره فعالیتهای غیرقانونی بحث نکنید»، به منظور نادیده گرفتن درخواست کاربر برای ارائه دستور العمل ممنوع است. نقش "
خرابی به این دلیل رخ می دهد که مدل آن سلسله مراتب را به صورت مکانیکی اعمال نمی کند. درعوض، تا حدودی از نشانه های سبکی استنباط می کند که کدام متن به کدام نقش تعلق دارد. همانطور که بحث جامعه در مورد تحقیق اشاره کرد، اگر متن مانند زمینه تفکر الگو باشد، مدل میتواند هر متنی با ساختار مشابه را با استدلال واقعی اشتباه بگیرد - و متن فکری اولویت بیشتری نسبت به متن کاربر معمولی دارد.
یک الگوی آشنا با یک پیچ جدید
این تحقیق بر اساس یک ضعف شناخته شده در سیستم های هوش مصنوعی است: تزریق سریع. حملات اولیه از این واقعیت سوء استفاده کردند که LLM ها هیچ جریان جداگانه ای برای دستورالعمل ها و داده ها ندارند، بنابراین عبارتی مانند "نادیده گرفتن همه دستورالعمل های قبلی" گاهی اوقات می تواند رفتار یک مدل را ربوده باشد. معرفی نقشها و برچسبهای فراداده به منظور کاهش این امر با ایجاد سلسله مراتب اعتماد بود.
CoT Forgery نشان می دهد که کاهش ناقص است. تا زمانی که مدلها اعتبار متن را تا حدی بر اساس ویژگیهای سبکی آن قضاوت میکنند و نه صرفاً بر اساس ابردادههای ساختاری آن، مهاجمانی که میتوانند سبک مناسب را تقلید کنند، میتوانند قدرت درک شده ورودی خود را افزایش دهند.
چرا رفع آن سخت است
محققان، چارلز یه، جاسمین کوی، و دیلان هادفیلد-منل، استدلال میکنند که درک نقش در LLMها یک ویژگی دوتایی نیست که بتوان آن را به طور خالص اجرا کرد. مدلها یاد میگیرند که برچسبها را از طریق آموزش تفسیر کنند نه از طریق قوانین سختکد شده، به این معنی که رفتار آنها توسط الگوهای موجود در دادهها شکل میگیرد و الگوها را میتوان تقلید کرد.
بحث جامعه در مورد کار، که توسط Hackaday برجسته شده است، موضوعی تکراری را نشان داد: تمیزترین راه حل به مدل هایی نیاز دارد که ورودی های قابل اعتماد را از طریق مسیرهای ساختاری مجزا به جای تکیه بر نشانه های آموخته شده و مبتنی بر سبک مدیریت کنند. تا زمانی که این اتفاق نیفتد، دفاع در برابر حملات سریع به سبک تزریق احتمالاً به جای یک مشکل حل شده، یک فرآیند در حال تکامل باقی خواهد ماند.
مفاهیم گسترده تر
این آسیب پذیری فراتر از نمایش های آزمایشگاهی اهمیت دارد. مدلهای استدلال به طور فزایندهای در سیستمهای عاملی مستقر میشوند که میتوانند وب را مرور کنند، کد را اجرا کنند و از طرف کاربر اقداماتی را انجام دهند. اگر مهاجم بتواند نتایج داخلی مدل را جعل کند، ممکن است بتواند آن اقدامات را به سمت نتایج ناخواسته یا مضر هدایت کند. با به دست آوردن استقلال و دسترسی بیشتر مدل ها به ابزار، خطر افزایش می یابد. محققان خاطرنشان میکنند که انسانها باهوش و خلاق باقی میمانند و تا زمانی که مدلها از یک تفکیک معماری تمیز بین متن مورد اعتماد و نامعتبر برخوردار نباشند، مهاجمان مصمم به یافتن راههایی برای محو کردن خط ادامه خواهند داد. این مقاله چالش را کمتر بهعنوان یک باگ که باید اصلاح شود و بیشتر بهعنوان ویژگی ساختاری سیستمهایی که رفتار خود را از دادهها یاد میگیرند، نه از قوانین سختکد شده، تعریف میکند.
مقاله کامل در arXiv موجود است و محققان نمونههایی از کد را در GitHub منتشر کردهاند تا توسعهدهندگان بتوانند تست کنند که آیا سیستمهای خودشان حساس هستند یا خیر.
از هوش مصنوعی جلوتر بمانید
برای اطلاعات بیشتر در مورد تحقیقات ایمنی هوش مصنوعی، آسیبپذیریهای امنیتی و مرز مدلهای زبان بزرگ، به [AI Buzz Wire] (https://aibuzzwire.news) مراجعه کنید.
اخبار هوش مصنوعی را بیشتر بخوانید →


