یک معیار جدید از شرکت امنیت برنامه کاربردی Semgrep نتیجه غیرمنتظره ای را ارائه کرده است: یک مدل وزن باز از Zhipu AI چین در یافتن نقص های امنیتی واقعی در نرم افزار از کلود Anthropic بهتر بود. این یافته به بحث در مورد اینکه آیا توانمندترین هوش مصنوعی لزوماً گران ترین یا محدودترین است، می افزاید.
با توجه به اینکه مدل قدرتمند Mythos آنتروپیک در پشت ممنوعیت صادرات ایالات متحده قفل شده است، تیمهای امنیتی در جستجوی جایگزینی در دسترس برای آخرین پوشش صنعت هوش مصنوعی به گزینههای با وزن باز مانند [GLM 5.2] (https://aibuzzwire.news) روی آوردهاند. آزمایش Semgrep که در 22 ژوئن منتشر شد، نشان می دهد که شکار ممکن است زودتر از آنچه انتظار می رفت نتیجه دهد.
آنچه Semgrep آزمایش کرد
Semgrep مجموعه ای از مدل های وزن باز و مرزی را بر اساس معیار تشخیص IDOR داخلی خود ارزیابی کرد. IDORها - ارجاعات مستقیم اشیاء ناامن - اشکالات کنترل دسترسی هستند که به یک کاربر اجازه می دهند به داده های کاربر دیگر دسترسی پیدا کند. تشخیص آنها با تجزیه و تحلیل استاتیک سنتی بسیار دشوار است زیرا این نقص به جای نحوی منطقی است: کد از نظر فنی معتبر است، به سادگی فاقد یک بررسی مجوز است.
این شرکت با ترکیب موتور مبتنی بر قوانین خود با استدلال هوش مصنوعی، یک گردش کار را برای شناسایی این آسیبپذیریها اصلاح کرده است. برای جداسازی میزان عملکرد از خود مدل در مقابل داربست اطراف آن، محققان مجموعهای از مدلهای با وزن باز محبوب را از طریق یک مهار حداقل اجرا کردند - یک راهاندازی ساده Pydantic با استفاده از همان درخواست IDOR که به هر مدل داده میشود، بدون کشف نقطه پایانی و بدون ناوبری هدایتشده. این درخواست تنها یک استراتژی جستجوی اساسی و چند اشاره در مورد ظاهر IDOR ارائه میدهد - کمی بیشتر از "اینجا کد است، اشکالات را پیدا کنید"، اما بسیار کمتر از آنچه که عوامل کدگذاری مرزی هنگام اجرا در خط لوله کامل Semgrep دریافت میکنند.
IDORها برای تیمهای امنیتی برنامهها دردسر دائمی هستند، زیرا از شکافهای اسکنرهای معمولی میافتند. یک ابزار مبتنی بر قانون میتواند یک بررسی ورودی گمشده را علامتگذاری کند، اما درک اینکه آیا یک نقطه پایانی خاص واقعاً دادههای کاربر دیگر را نشان میدهد نیاز به استدلال در مورد منطق تجاری برنامه دارد - دقیقاً همان نوع قضاوت زمینهای که مدلهای زبان بزرگ به طور فزایندهای در آن خوب هستند.
GLM 5.2 حرف اول را می زند
برجسته GLM 5.2، مدل وزن باز Zhipu AI بود. با اجرای چیزی جز یک دستور ساده، امتیاز 39% F1 را در تشخیص IDOR به دست آورد – که 32% کلود کد را با هفت امتیاز کامل شکست داد. به گفته Semgrep، مدل وزن باز نیز در این کار از Claude Opus 4.8 پیشی گرفت و آن را به قوی ترین گزینه غیر مرزی آزمایش شده تبدیل کرد.
اقتصاد به همان اندازه چشمگیر بود. با قیمت گذاری GLM 5.2، هزینه اجرا به ازای هر آسیب پذیری یافت شده تقریباً 0.17 دلار است. برای سازمانهایی که ممکن است هزاران نقطه پایانی را اسکن کنند، Semgrep خاطرنشان کرد که هزینه هر اشکال اغلب عامل تعیینکننده در عملی بودن یک تکنیک تشخیص در مقیاس است.
سایر مدعیان وزن آزاد بیشتر عقب افتادند. MiniMax M3 امتیاز 23% F1 را به دست آورد و Kimi K2.7 Code به 22% رسید، هر دو بسیار کمتر از Claude Code قرار گرفتند. Semgrep GLM 5.2 را بهعنوان استثنای واضح بهجای یک نتیجه معرف برای دسته وزن باز معرفی کرد.
مهار هنوز مهم است
علیرغم پیروزی در وزن باز در رده خام، خط لوله هدفمند خود Semgrep همچنان رهبر کل باقی ماند. راهاندازی چندوجهی این شرکت - که استدلال هوش مصنوعی را با تشخیص مبتنی بر قانون و شمارش نقطه پایانی ساختیافته ترکیب میکند - بسته به پیکربندی، 53٪ تا 61٪ F1 را به دست آورد. این شکاف بر سؤال اصلی محققان تأکید میکند: این مدل چقدر عملکرد تشخیص آسیبپذیری دارد و معماری اطراف آن چقدر است؟
به نظر می رسد که پاسخ این است که "هر دو، اما بیشتر از آنچه مردم تصور می کنند مهار است." GLM 5.2 ثابت کرد که یک مدل توانمند میتواند با حداقل پشتیبانی کار معناداری انجام دهد، اما هنوز نمیتواند با سیستمی که بهطور خاص برای این مشکل مهندسی شده است، مطابقت داشته باشد.
تیم Semgrep که شامل محققین Paxton-Fear، Seth Jaksik، Brenden Noblitt و Erik Buchanan میشد، گفت که آنها واقعاً شوکه شدهاند که یک مدل با وزن باز که یک دستور العمل ساده را اجرا میکند، از یک عامل کدگذاری مرزی در یک کار امنیتی سنگین پیشی گرفته است.
اسطوره ها در خانه
این معیار در برابر پسزمینه ژئوپلیتیک کنونی وزن بیشتری دارد. عنوان پست وبلاگ - "ما افسانه ها در خانه داریم" - اشاره ای است به این واقعیت که مدل Mythos متمرکز بر امنیت سایبری Anthropic عملاً برای بسیاری از نقاط جهان در دسترس نیست. پس از اینکه دولت ترامپ اتباع غیرآمریکایی را از استفاده از Mythos و برادر محدود آن Fable 5 منع کرد، تیمهای امنیتی جهانی دسترسی به آنچه که بهطور گستردهای بهعنوان قویترین هوش مصنوعی برای کارهای امنیتی تهاجمی و دفاعی شناخته میشد، از دست دادند.
در آن خلاء، مدلهای با وزن باز قابل دسترس، شکاف را پر میکنند. این واقعیت که GLM 5.2 - قابل دانلود رایگان و قابل استقرار در هر کجا - می تواند از قبل با مدل های اختصاصی مرزی در وظایف امنیتی خاص مطابقت داشته باشد یا آن را شکست دهد، نشان می دهد که اثر سرد ممنوعیت صادرات ممکن است کمتر از آنچه در نظر گرفته شده باشد. اگر بهترین مدل "نامحدود" به بهبود ادامه دهد، ارزش استراتژیک احتکار قابلیت های مرزی کاهش می یابد.
در حال حاضر، نتیجه باریک است: یک معیار واحد بر روی یک طبقه از آسیبپذیری. اما این سیگنالی است که مرز با وزن باز سریعتر از آنچه بسیاری تصور میکردند بسته میشود و دسترسی - نه قابلیت خام - ممکن است به متغیر تعیینکننده در چشمانداز امنیتی هوش مصنوعی تبدیل شود.
این یافته همچنین سوالات ناراحت کننده ای را برای آزمایشگاه های مرزی ایجاد می کند. اگر یک مدل آزادانه در دسترس از قبل بتواند با سیستمهای اختصاصی در وظایف استدلال امنیتی مطابقت داشته باشد، خندق رقابتی در مورد مدلهای بسته محدود میشود - بهویژه زمانی که کنترلهای صادراتی آن مدلهای بسته را برای بخشهایی از بازار جهانی غیرقابل دسترس میکند. توسعه دهندگان با وزن باز، بدون محدودیت در استفاده، می توانند به طور همزمان در همه جا تکرار و مستقر شوند.
از هوش مصنوعی جلوتر بمانید
شکاف بین هوش مصنوعی مرزی و با وزن باز در [اخبار جدید هوش مصنوعی] (https://aibuzzwire.news) و تحقیقاتی که امنیت، زیرساخت ها و سیاست ها را تغییر می دهد در حال کاهش است.
اخبار هوش مصنوعی را بیشتر بخوانید →


