یک معیار جدید از شرکت امنیت برنامه کاربردی Semgrep نتیجه غیرمنتظره ای را ارائه کرده است: یک مدل وزن باز از Zhipu AI چین در یافتن نقص های امنیتی واقعی در نرم افزار از کلود Anthropic بهتر بود. این یافته به بحث در مورد اینکه آیا توانمندترین هوش مصنوعی لزوماً گران ترین یا محدودترین است، می افزاید.

با توجه به اینکه مدل قدرتمند Mythos آنتروپیک در پشت ممنوعیت صادرات ایالات متحده قفل شده است، تیم‌های امنیتی در جستجوی جایگزینی در دسترس برای آخرین پوشش صنعت هوش مصنوعی به گزینه‌های با وزن باز مانند [GLM 5.2] (https://aibuzzwire.news) روی آورده‌اند. آزمایش Semgrep که در 22 ژوئن منتشر شد، نشان می دهد که شکار ممکن است زودتر از آنچه انتظار می رفت نتیجه دهد.

آنچه Semgrep آزمایش کرد

Semgrep مجموعه ای از مدل های وزن باز و مرزی را بر اساس معیار تشخیص IDOR داخلی خود ارزیابی کرد. IDORها - ارجاعات مستقیم اشیاء ناامن - اشکالات کنترل دسترسی هستند که به یک کاربر اجازه می دهند به داده های کاربر دیگر دسترسی پیدا کند. تشخیص آنها با تجزیه و تحلیل استاتیک سنتی بسیار دشوار است زیرا این نقص به جای نحوی منطقی است: کد از نظر فنی معتبر است، به سادگی فاقد یک بررسی مجوز است.

این شرکت با ترکیب موتور مبتنی بر قوانین خود با استدلال هوش مصنوعی، یک گردش کار را برای شناسایی این آسیب‌پذیری‌ها اصلاح کرده است. برای جداسازی میزان عملکرد از خود مدل در مقابل داربست اطراف آن، محققان مجموعه‌ای از مدل‌های با وزن باز محبوب را از طریق یک مهار حداقل اجرا کردند - یک راه‌اندازی ساده Pydantic با استفاده از همان درخواست IDOR که به هر مدل داده می‌شود، بدون کشف نقطه پایانی و بدون ناوبری هدایت‌شده. این درخواست تنها یک استراتژی جستجوی اساسی و چند اشاره در مورد ظاهر IDOR ارائه می‌دهد - کمی بیشتر از "اینجا کد است، اشکالات را پیدا کنید"، اما بسیار کمتر از آنچه که عوامل کدگذاری مرزی هنگام اجرا در خط لوله کامل Semgrep دریافت می‌کنند.

IDORها برای تیم‌های امنیتی برنامه‌ها دردسر دائمی هستند، زیرا از شکاف‌های اسکنرهای معمولی می‌افتند. یک ابزار مبتنی بر قانون می‌تواند یک بررسی ورودی گمشده را علامت‌گذاری کند، اما درک اینکه آیا یک نقطه پایانی خاص واقعاً داده‌های کاربر دیگر را نشان می‌دهد نیاز به استدلال در مورد منطق تجاری برنامه دارد - دقیقاً همان نوع قضاوت زمینه‌ای که مدل‌های زبان بزرگ به طور فزاینده‌ای در آن خوب هستند.

GLM 5.2 حرف اول را می زند

برجسته GLM 5.2، مدل وزن باز Zhipu AI بود. با اجرای چیزی جز یک دستور ساده، امتیاز 39% F1 را در تشخیص IDOR به دست آورد – که 32% کلود کد را با هفت امتیاز کامل شکست داد. به گفته Semgrep، مدل وزن باز نیز در این کار از Claude Opus 4.8 پیشی گرفت و آن را به قوی ترین گزینه غیر مرزی آزمایش شده تبدیل کرد.

اقتصاد به همان اندازه چشمگیر بود. با قیمت گذاری GLM 5.2، هزینه اجرا به ازای هر آسیب پذیری یافت شده تقریباً 0.17 دلار است. برای سازمان‌هایی که ممکن است هزاران نقطه پایانی را اسکن کنند، Semgrep خاطرنشان کرد که هزینه هر اشکال اغلب عامل تعیین‌کننده در عملی بودن یک تکنیک تشخیص در مقیاس است.

سایر مدعیان وزن آزاد بیشتر عقب افتادند. MiniMax M3 امتیاز 23% F1 را به دست آورد و Kimi K2.7 Code به 22% رسید، هر دو بسیار کمتر از Claude Code قرار گرفتند. Semgrep GLM 5.2 را به‌عنوان استثنای واضح به‌جای یک نتیجه معرف برای دسته وزن باز معرفی کرد.

مهار هنوز مهم است

علیرغم پیروزی در وزن باز در رده خام، خط لوله هدفمند خود Semgrep همچنان رهبر کل باقی ماند. راه‌اندازی چندوجهی این شرکت - که استدلال هوش مصنوعی را با تشخیص مبتنی بر قانون و شمارش نقطه پایانی ساخت‌یافته ترکیب می‌کند - بسته به پیکربندی، 53٪ تا 61٪ F1 را به دست آورد. این شکاف بر سؤال اصلی محققان تأکید می‌کند: این مدل چقدر عملکرد تشخیص آسیب‌پذیری دارد و معماری اطراف آن چقدر است؟

به نظر می رسد که پاسخ این است که "هر دو، اما بیشتر از آنچه مردم تصور می کنند مهار است." GLM 5.2 ثابت کرد که یک مدل توانمند می‌تواند با حداقل پشتیبانی کار معناداری انجام دهد، اما هنوز نمی‌تواند با سیستمی که به‌طور خاص برای این مشکل مهندسی شده است، مطابقت داشته باشد.

تیم Semgrep که شامل محققین Paxton-Fear، Seth Jaksik، Brenden Noblitt و Erik Buchanan می‌شد، گفت که آنها واقعاً شوکه شده‌اند که یک مدل با وزن باز که یک دستور العمل ساده را اجرا می‌کند، از یک عامل کدگذاری مرزی در یک کار امنیتی سنگین پیشی گرفته است.

اسطوره ها در خانه

این معیار در برابر پس‌زمینه ژئوپلیتیک کنونی وزن بیشتری دارد. عنوان پست وبلاگ - "ما افسانه ها در خانه داریم" - اشاره ای است به این واقعیت که مدل Mythos متمرکز بر امنیت سایبری Anthropic عملاً برای بسیاری از نقاط جهان در دسترس نیست. پس از اینکه دولت ترامپ اتباع غیرآمریکایی را از استفاده از Mythos و برادر محدود آن Fable 5 منع کرد، تیم‌های امنیتی جهانی دسترسی به آنچه که به‌طور گسترده‌ای به‌عنوان قوی‌ترین هوش مصنوعی برای کارهای امنیتی تهاجمی و دفاعی شناخته می‌شد، از دست دادند.

در آن خلاء، مدل‌های با وزن باز قابل دسترس، شکاف را پر می‌کنند. این واقعیت که GLM 5.2 - قابل دانلود رایگان و قابل استقرار در هر کجا - می تواند از قبل با مدل های اختصاصی مرزی در وظایف امنیتی خاص مطابقت داشته باشد یا آن را شکست دهد، نشان می دهد که اثر سرد ممنوعیت صادرات ممکن است کمتر از آنچه در نظر گرفته شده باشد. اگر بهترین مدل "نامحدود" به بهبود ادامه دهد، ارزش استراتژیک احتکار قابلیت های مرزی کاهش می یابد.

در حال حاضر، نتیجه باریک است: یک معیار واحد بر روی یک طبقه از آسیب‌پذیری. اما این سیگنالی است که مرز با وزن باز سریعتر از آنچه بسیاری تصور می‌کردند بسته می‌شود و دسترسی - نه قابلیت خام - ممکن است به متغیر تعیین‌کننده در چشم‌انداز امنیتی هوش مصنوعی تبدیل شود.

این یافته همچنین سوالات ناراحت کننده ای را برای آزمایشگاه های مرزی ایجاد می کند. اگر یک مدل آزادانه در دسترس از قبل بتواند با سیستم‌های اختصاصی در وظایف استدلال امنیتی مطابقت داشته باشد، خندق رقابتی در مورد مدل‌های بسته محدود می‌شود - به‌ویژه زمانی که کنترل‌های صادراتی آن مدل‌های بسته را برای بخش‌هایی از بازار جهانی غیرقابل دسترس می‌کند. توسعه دهندگان با وزن باز، بدون محدودیت در استفاده، می توانند به طور همزمان در همه جا تکرار و مستقر شوند.

از هوش مصنوعی جلوتر بمانید

شکاف بین هوش مصنوعی مرزی و با وزن باز در [اخبار جدید هوش مصنوعی] (https://aibuzzwire.news) و تحقیقاتی که امنیت، زیرساخت ها و سیاست ها را تغییر می دهد در حال کاهش است.

اخبار هوش مصنوعی را بیشتر بخوانید →