مدلهای هوش مصنوعی مرزی بر اساس معیار جدیدی که از سوی سازمان غیرانتفاعی FAR.AI ارائه شده است، از نظر سختی شکستن تفاوتهای زیادی دارند – و این شکاف بسیار بزرگتر از آن چیزی است که بسیاری تصور میکردند.
در 29 ژوئیه، FAR.AI رهبران امنیتی هوش مصنوعی خود را راهاندازی کرد و پادمانهای چهار مدل پیشرو را در شرایط یکسان آزمایش کرد. به گفته این سازمان، Claude Fable 5 از Anthropic و GPT-5.6 Sol از OpenAI در برابر حملات محکم ایستادند، در حالی که Grok 4.5 از xAI و Gemini 3.1 Pro گوگل هر کدام زیر 300 دلار شکست خوردند. FAR.AI تفاوت بین قویترین و کماستحکامترین مدلها را «شکاف صد برابری» در پادمانها توصیف کرد. For more context on this story, see our ongoing latest AI developments.
در کنار تابلوی امتیازات، FAR.AI چیزی را معرفی کرد که آن را حداقل استاندارد برای پادمان ها می نامد، یک خط پایه امنیتی مشترک که به طور کامل از دفاعی که توسعه دهندگان همتا در حال حاضر در حال تولید هستند جمع آوری شده است. هدف این است که به آزمایشگاه ها یک کف بتنی داده شود تا بتوانند با یکدیگر ملاقات کنند - و محافظ های ضعیف قابل مشاهده باشند.
این یافته ها بازتاب تست های استرس قبلی FAR.AI است. گزارش ماه می نشان داد که حفاظت های DeepSeek-V4-Pro "تقریباً به طور کامل از بین رفته است" و مهاجمان با مهارت پایین مکانیسم های ایمنی را در 98 تا 100٪ مواقع در هر دامنه آزمایش شده دور می زنند. یک جیلبریک در دسترس عموم که برای نسخه قبلی این مدل ساخته شده بود، بدون هیچ تغییری کار میکرد و نشان میداد که آسیبپذیریهای شناخته شده اصلاح نشدهاند.
WIRED که در جدول امتیازات گزارش می دهد، به این نتیجه رسیده است که "به طرز وحشتناکی جیلبریک کردن برخی از مدل های هوش مصنوعی مرزی آسان است." از آنجایی که عوامل وظایف حساس تری را بر عهده می گیرند، این نابرابری سوالات مبرمی را در مورد اینکه کدام سیستم ها برای استقرار ایمن هستند، ایجاد می کند.
برای پوشش مداوم تحقیقات ایمنی و امنیت هوش مصنوعی، خوانندگان می توانند AI Buzz Wire را دنبال کنند.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →