این فرض رایج که انسانی که هر فرمان را بررسی میکند میتواند عوامل کدنویسی هوش مصنوعی را تحت کنترل داشته باشد، با بررسی جدی مواجه است. یک تجزیه و تحلیل جدید از بیش از 40000 جلسه بازی و بیش از 409000 تصمیم تایید یا رد فردی نشان داد که بازبینان انسانی تقریباً از هر سه دستور مخرب عوامل هوش مصنوعی یک مورد را از دست داده اند و این سؤالات فوری را در مورد اینکه آیا "انسان در حلقه" اصلاً مرز امنیتی قابل اعتمادی است ایجاد می کند.
این یافتهها از یک بازی مبتنی بر مرورگر است که توسط Alex Wauters، مهندس کارکنان سابق Uber که در مورد امنیت توسعهدهندگان در Scale X مینویسد، ایجاد شده است. این بازی بازیکنان را در نقش یک بازبین انسانی برای یک عامل کدنویسی هوش مصنوعی قرار میدهد و از آنها میخواهد که دستورات پوسته را تحت فشار زمان تأیید یا رد کنند. برخی از دستورات معمولی هستند، مانند 'git status' یا 'npm test'. برخی دیگر تلاشهای پنهانی برای استخراج اعتبار، نصب درهای پشتی یا ارسال اسرار به سرورهای راه دور هستند. پس از افزودن ردیابی آمار، واترز دادههای کافی را جمعآوری کرد تا تصویری دقیق از جایی که قضاوت انسان موفق و غالباً شکست میخورد، به دست آورد. برای اطلاعات بیشتر در مورد [پوشش صنعت هوش مصنوعی] (https://aibuzzwire.news)، این مطالعه به عنوان یکی از غنیترین آزمایشها تا به امروز شناخته میشود.
خطرناک ترین دستورات سخت ترین بودند
قابل توجه ترین یافته این مطالعه این است که دستورات مخرب آشکار، مانند "rm -rf" در دایرکتوری های حیاتی، به طور قابل اعتمادی شناسایی شده اند. تهدیدهایی که در واقع موفق به سرقت مدارک تحصیلی شده بودند تقریباً سه برابر بیشتر از قلم افتاده بودند. تنها دستوری که بیش از همه از دست رفته در کل بازی، «npm run analysis» بود که با وجود گزارش سابقه عامل که به وضوح نشان میداد که اسکریپت زیربنایی برای انتقال اعتبار به سرور خارجی دستکاری شده بود، توسط 64.7 درصد از بازیکنان تأیید شد.
مشکل ساختاری است. دستوراتی مانند «npm run» هر اسکریپت تعریف شده در فایل «package.json» پروژه را اجرا می کند. آن اسکریپت میتواند یک تحلیلگر باندل قانونی یا کد مخرب باشد که توسط یک فایل قبلی ویرایش شده توسط عامل اصلاح شده تزریق میشود. برای اینکه مطمئن شوید، یک توسعهدهنده باید قبل از تأیید، همه فایلهای اصلاحشده را بررسی کند، که این مزیت سرعتی را که ابزارهای کدنویسی هوش مصنوعی قرار است ارائه کنند، نفی میکند.
در میان سه دستور محتوی بار مبدل در این بازی، میزان از دست دادن 52.5 درصد در مقایسه با 28.4 درصد برای سایر حملات حذف اعتبار بود. پنهان کردن یک محموله پشت یک نام اسکریپت آشنا تقریباً میزان موفقیت آن را دو برابر میکند، حتی زمانی که محموله در گزارش سابقه نمایش داده شده درست بالای دستور مجوز قابل مشاهده بود.
خستگی اجازه هوشیاری را در طول زمان از بین می برد
Anthropic قبلا اذعان کرده بود که خستگی مجوز یک پدیده واقعی در محصول Claude Code خود است، و خاطرنشان کرد که هر چه یک کاربر تأییدیههای بیشتری ببیند، توجه کمتری به هر یک میکند. داده های Scale X به طور تجربی از این نگرانی پشتیبانی می کنند. نرخ از دست دادن در طول چند دستور اول هر جلسه با گرم کردن بازیکنان کاهش مییابد، اما سپس به طور پیوسته به سمت پایان صعود میکند، مطابق با خستگی یا فشار بالا رفتن تیک تاک ساعت.
این الگو دینامیک دنیای واقعی را منعکس می کند. توسعهدهندگانی که برای ارسال ویژگیها تحت فشار ضرب الاجل مسابقه میدهند، با انگیزه مشابهی برای تأیید سریع کلیک مواجه میشوند، و حجم زیاد دستورات روتین، مشکلی را ایجاد میکند که در آن تهدیدهای واقعی از نظر آماری نادر هستند. نتیجه سیستمی است که به کاربران آموزش میدهد تا همه چیز را مهر و موم کنند.
طرف دیگر: مسدود کردن بیش از حد همه چیز را کند می کند
این مطالعه همچنین حالت شکست مخالف را مستند کرد. چندین فرمان واقعاً خوش خیم به طور معمول توسط بازیکنان محتاط مسدود می شدند، از جمله ساخت استاندارد و فراخوانی های آزمایشی. این انسداد بیش از حد عامل را کند می کند و به طور متناقض، خطر طولانی مدت را افزایش می دهد. وقتی مکرراً از کاربران خواسته میشود تا دستوراتی را تأیید کنند که معلوم میشود بیضرر هستند، نویز تمایل آنها را برای بررسی دقیق درخواستهای آینده کاهش میدهد و در نهایت آنها را به سمت دور زدن کامل یا حالتهای تأیید خودکار سوق میدهد که بازبینی انسانی را به طور کامل حذف میکند.
ویژگیهایی مانند حالت خودکار Anthropic تلاش میکنند تا با تعیین خودکار امن بودن یک فرمان قبل از درخواست از کاربر، این موضوع را کاهش دهند. اما همانطور که دادههای این مطالعه در مورد محمولههای مخفی نشان میدهد، حتی محتویات فرمان قابل مشاهده برای انسانها برای قضاوت قابل اعتماد تحت فشار کافی نیست.
متن از دست رفته مشکل اصلی است
یک فرمان، «cat ~/.zshrc»، بیشترین تفرقه را در کل بازی نشان داد که توسط 45.9 درصد از بازیکنان تأیید شد. این فرمان برای توسعه دهندگانی که هیچ رازی را در پروفایل پوسته خود نگه نمی دارند بی ضرر است، اما کلیدهای API را برای بسیاری از افرادی که اعتبارنامه ها را به آنجا صادر می کنند، نشان می دهد. ریسک آن کاملاً به پیکربندی سیستمی بستگی دارد که عامل نمی تواند ببیند و بازبینی کننده ممکن است به خاطر نداشته باشد.
چندین دستور دیگر به همین دلیل جنجال مشابهی را در موضوع بحث Hacker News ایجاد کردند. مسئله اساسی این است که از توسعه دهندگان خواسته می شود قضاوت امنیتی را بدون تصویر کامل از فایل هایی که تغییر کرده اند، کاری که عامل در مراحل قبلی انجام داده است و پیکربندی فعلی سیستم شامل چه مواردی است، انجام دهند. همانطور که یکی از نظردهنده ها اشاره کرد، درخواست از کاربران برای تأیید اعتبار دستوراتی که بدون زمینه مبهم هستند، یک محافظ قوی نیست.
بعدی برای امنیت عامل
واترز استدلال می کند که راه حل انسان بهتر نیست، بلکه ابزار بهتر است. عوامل Sandboxing به طوری که آنها نمی توانند به طور مستقیم به اعتبارنامه ها دسترسی داشته باشند، انزوای بافت سخت، و محدودیت های ساختاری در مورد آنچه که نمایندگان می توانند بدون مجوزهای بالا انجام دهند، همه امیدوارکننده تر از تکیه بر هوشیاری انسانی هستند. تا زمانی که این پادمان ها وجود نداشته باشند، اعطای مجوزهای گسترده به نمایندگان بدون در نظر گرفتن اینکه آیا یک انسان به طور اسمی در جریان است یا نه، خطرناک است.
این مطالعه یک مقاله دانشگاهی بررسی شده نیست و واترز محدودیت های آن را تایید می کند. بازی به بازیکنان در مورد تهدیدات هشدار داد و فشار زمانی مصنوعی را اعمال کرد که ممکن است کاملاً منعکس کننده محیط های توسعه واقعی نباشد. اما یافته اصلی، اینکه بازبینیکنندگان انسانی آموزشدیده تحت فشار یک سوم حملات پنهانشده عمدی را از دست میدهند، باید به هر تیمی که عاملهای کدنویسی هوش مصنوعی را مستقر میکنند دلیلی بدهد تا در مدل امنیتی خود تجدید نظر کنند.
برای توسعهدهندگانی که امروزه با عوامل هوش مصنوعی ساخته میشوند، راه حل عملی این است که فرض کنند انسان در حلقه در نهایت شکست خواهد خورد. مجوزهای عامل و سندباکس خود را طوری طراحی کنید که تأیید از دست رفته به معنای لو رفتن کلید AWS یا خط لوله ساخت به خطر افتاده نباشد. دادهها نشان میدهند که برخورد با بازبینی انسانی بهعنوان دفاع اصلی، شرطی است که نتیجه نمیدهد.
از هوش مصنوعی جلوتر بمانید
چشم انداز امنیتی عامل هوش مصنوعی به سرعت در حال تحول است. از آخرین [توسعه های هوش مصنوعی] (https://aibuzzwire.news) و تحقیقات جدید مطلع باشید.
اخبار هوش مصنوعی را بیشتر بخوانید →