مدل‌های هوش مصنوعی مرزی بر اساس معیار جدیدی که از سوی سازمان غیرانتفاعی FAR.AI ارائه شده است، از نظر سختی شکستن تفاوت‌های زیادی دارند – و این شکاف بسیار بزرگ‌تر از آن چیزی است که بسیاری تصور می‌کردند.

در 29 ژوئیه، FAR.AI رهبران امنیتی هوش مصنوعی خود را راه‌اندازی کرد و پادمان‌های چهار مدل پیشرو را در شرایط یکسان آزمایش کرد. به گفته این سازمان، Claude Fable 5 از Anthropic و GPT-5.6 Sol از OpenAI در برابر حملات محکم ایستادند، در حالی که Grok 4.5 از xAI و Gemini 3.1 Pro گوگل هر کدام زیر 300 دلار شکست خوردند. FAR.AI تفاوت بین قوی‌ترین و کم‌استحکام‌ترین مدل‌ها را «شکاف صد برابری» در پادمان‌ها توصیف کرد. For more context on this story, see our ongoing latest AI developments.

در کنار تابلوی امتیازات، FAR.AI چیزی را معرفی کرد که آن را حداقل استاندارد برای پادمان ها می نامد، یک خط پایه امنیتی مشترک که به طور کامل از دفاعی که توسعه دهندگان همتا در حال حاضر در حال تولید هستند جمع آوری شده است. هدف این است که به آزمایشگاه ها یک کف بتنی داده شود تا بتوانند با یکدیگر ملاقات کنند - و محافظ های ضعیف قابل مشاهده باشند.

این یافته ها بازتاب تست های استرس قبلی FAR.AI است. گزارش ماه می نشان داد که حفاظت های DeepSeek-V4-Pro "تقریباً به طور کامل از بین رفته است" و مهاجمان با مهارت پایین مکانیسم های ایمنی را در 98 تا 100٪ مواقع در هر دامنه آزمایش شده دور می زنند. یک جیلبریک در دسترس عموم که برای نسخه قبلی این مدل ساخته شده بود، بدون هیچ تغییری کار می‌کرد و نشان می‌داد که آسیب‌پذیری‌های شناخته شده اصلاح نشده‌اند.

WIRED که در جدول امتیازات گزارش می دهد، به این نتیجه رسیده است که "به طرز وحشتناکی جیلبریک کردن برخی از مدل های هوش مصنوعی مرزی آسان است." از آنجایی که عوامل وظایف حساس تری را بر عهده می گیرند، این نابرابری سوالات مبرمی را در مورد اینکه کدام سیستم ها برای استقرار ایمن هستند، ایجاد می کند.

برای پوشش مداوم تحقیقات ایمنی و امنیت هوش مصنوعی، خوانندگان می توانند AI Buzz Wire را دنبال کنند.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →