Z.ai، شرکت هوش مصنوعی مستقر در پکن که به نام ژیپو نیز شناخته می‌شود، GLM-5.3 را منتشر کرده است، نسخه جدیدی از مدل پرچم‌دار خود که به گفته این شرکت، تواناترین سیستم وزن باز آن برای مهندسی نرم‌افزار است – و به‌طور غیرمنتظره‌ای مهارت‌های امنیت سایبری فوق‌العاده‌ای را توسعه داده است. GLM-5.3 که در 14 آگوست اعلام شد و در یک پست وبلاگ شرکت توضیح داده شد، بر روی همان مدل پایه تقریباً 700 میلیارد پارامتری ساخته شده است که GLM-5.2 قبلی خود که در ژوئن منتشر شد. این شرکت می‌گوید هر پیشرفتی به‌جای یک پایه بزرگ‌تر، ناشی از پس از آموزش است. این نسخه جدیدترین در موج مدل‌های وزن باز چینی است که هدف آنها رقابت با سیستم‌های بسته Anthropic و OpenAI است. برای ردیاب مدل [AI Buzz Wire] (https://aibuzzwire.news)، GLM-5.3 یک سیگنال واضح است که مرز با وزن باز، شکاف کدگذاری را سریعتر از آنچه بسیاری انتظار داشتند، می بندد.

سود به طور کامل در پس از آموزش ساخته شده است

Z.ai در مورد رویکرد خود با GLM-5.3 صریح است: "مقیاس بندی بعد از آموزش تنها کاری است که ما انجام دادیم." این شرکت پشته یادگیری تقویتی را که با GLM-5.2 معرفی کرده بود حمل کرد - از جمله IndexShare برای پردازش کارآمد با زمینه طولانی، SAO برای یادگیری تقویتی در کارهای افق بلند، و یک چارچوب منبع باز به نام slime برای آموزش ناهمزمان در مقیاس بزرگ. در ماه گذشته محیط‌های بیشتر، وظایف متنوع‌تر و محاسبات بیشتری را در آن پشته ریخت.

سود در سراسر معیارهای کدنویسی نشان داده می شود. در ترمینال بنچ 3.0، GLM-5.3 از امتیاز 4.6 GLM-5.2 به 28.3 جهش می کند - که بیش از شش برابر پیشرفت است. نتایج به‌روزترین منبع باز را در ترمینال بنچ 3.0 و آخرین امتحان نمایندگان ارسال می‌کند، و از 23.8 به 28.5 در معیار ALE-CLI توانایی عامل بهبود می‌یابد. Z.ai نسبت به GLM-5.2 در Z.ai Code Bench داخلی خود، یک معیار خصوصی که برای ارزیابی عوامل کدگذاری در محیط‌های توسعه واقعی و کاهش خطر آلودگی ناشی از مجموعه‌های آزمایشی عمومی طراحی شده است، 50 درصد بهبود یافته است.

مهمتر از همه، دستاوردها با کارایی بهتر نشانه ها به دست می آیند، نه فقط نتایج بهتر. در تلاش High، GLM-5.3 در معیار داخلی با تقریباً 50000 توکن خروجی در هر کار به 31.4% می رسد که Z.ai می گوید که با 120000 توکن از Claude Opus 4.8 Anthropic با 29.5% پیشی می گیرد. GLM-5.3 همچنان از کلود فبل 5 پیشرفته‌تر Anthropic که با حداکثر تلاش به 39.5% می‌رسد، تعقیب می‌کند.

یک جهش غیرمنتظره در قابلیت سایبری

بارزترین نتیجه GLM-5.3 نه در کدنویسی بلکه در امنیت است. همانطور که Z.ai پس از آموزش را مقیاس‌بندی کرد و داده‌ها و محیط‌های کشف آسیب‌پذیری را در ترکیب آموزشی معرفی کرد، انتظار داشت که مدل در یافتن و استدلال درباره نقص‌ها بهبود یابد. چیزی که تیم را شگفت زده کرد این بود که این توانایی با چه سرعتی توسعه یافت.

GLM-5.3 فقط در تشخیص اشکالات جدا شده بهتر نشد. شروع به استدلال در مراحل مختلف بهره برداری کرد و طرح های منسجمی برای زنجیره های حمله کامل شکل داد. در CyberGym، معیاری که آزمایش می‌کند آیا یک مدل می‌تواند آسیب‌پذیری‌ها را از روی کد منبع سفید شناسایی و تأیید کند، GLM-5.3 امتیاز 84.5 درصدی را از GLM-5.2 به 77.2 درصد می‌دهد. این بهترین نتیجه در معیار است، بالاتر از Mythos 5 با 83.8٪ و GPT-5.6 Sol با 83.6٪. در ExploitBench، که مستلزم استدلال عمیق‌تر در مورد آسیب‌پذیری‌های واقعی و بهره‌برداری از آن‌ها است، GLM-5.3 امتیاز GLM-5.2 را بیش از دو برابر می‌کند و به 54.4 درصد می‌رسد – هرچند که بسیار عقب‌تر از Mythos 5 با 78.0 درصد و GPT-5.6 Sol با 76.5 درصد است.

Z.ai الگوی ثابتی را مشاهده می‌کند: هر چه یک معیار در زنجیره بهره‌برداری بالاتر باشد، افزایش نسبت به GLM-5.2 بیشتر است - و همچنین شکاف باقی‌مانده تا مرز بسته بیشتر می‌شود. این شرکت خاطرنشان می‌کند: «قابلیت دقیقاً در جایی که ما عقب‌تر هستیم، سریع‌ترین رشد را دارد.

کشف آسیب پذیری در دنیای واقعی

مهارت های سایبری به معیارها محدود نمی شود. Z.ai گزارش می دهد که از زمان GLM-5.2، با چندین تیم امنیتی در چین کار کرده است تا مدل های خود را در برابر پایگاه های کد واقعی آزمایش کند. پس از بررسی تخصصی، غربالگری و حذف مجدد، این مدل 2436 آسیب پذیری را در 269 پروژه شناسایی کرد که شامل 1097 مشکل با شدت متوسط ​​به بالا بود. یافته‌ها شامل هسته‌های سیستم، سیستم‌های عامل، موتورهای مرورگر، زیرساخت‌های منبع باز، برنامه‌های کاربردی وب و پروتکل‌های شبکه می‌شوند که بسیاری از آنها برای سال‌ها یا حتی دهه‌ها مورد توجه قرار نگرفته بودند و قدیمی‌ترین آن‌ها به حدود 40 سال قبل برمی‌گشتند.

این نتایج بازتاب کارهایی است که Anthropic در تحقیقات امنیتی چندعاملی خود شرح داده است، که در آن از گروه‌های هماهنگ از عوامل برای جستجوی آسیب‌پذیری‌ها در نرم‌افزار منبع باز در مقیاس استفاده می‌شود.

وزنه های باز - با تاخیر

Z.ai می گوید که وزنه های GLM-5.3 را در دو هفته پس از ارزیابی ایمنی و سخت شدن کامل آزاد می کند. این تأخیر عمدی منعکس کننده تنش‌هایی است که در این اعلامیه وجود دارد: مدلی که قابلیت‌های سایبری تهاجمی قوی را سریع‌تر از آنچه سازندگانش پیش‌بینی می‌کردند توسعه می‌دهد، دقیقاً همان سیستمی است که سؤالاتی را در مورد انتشار مسئولانه ایجاد می‌کند. این شرکت تأکید می‌کند که سازگاری آموزش-پرداخت آن تا حد بالایی از دقت عددی بهبود یافته است و بسیاری از دشواری‌های مقیاس‌بندی از خود مدل به طراحی محیط‌های کار واقعی و قابل تأیید تغییر کرده است.

تصویر رقابتی روشن است. GLM-5.3 فاصله تا مرز بسته در کدنویسی و وظایف عاملی را کاهش می‌دهد و در عین حال ادعای برتری مطلق در حداقل یک معیار اصلی کشف آسیب‌پذیری را دارد. این کار را به‌عنوان یک مدل وزن باز انجام می‌دهد - به این معنی که پس از انتشار، وزن‌ها به‌طور رایگان برای دانلود، مطالعه و ساختن برای همه در دسترس خواهند بود. اینکه آیا این باز بودن پیشرفت را تسریع می‌کند یا نگرانی‌های امنیتی تازه‌ای را ایجاد می‌کند، بحثی است که GLM-5.3 کاملاً تضمین شده است که دوباره روشن شود.

از هوش مصنوعی جلوتر بمانید

برای آخرین نسخه‌های مدل هوش مصنوعی، نبردهای معیار، و تحلیل صنعت، [AI Buzz Wire] (https://aibuzzwire.news) را نشانک‌گذاری کنید.

بیشتر بخوانید اخبار هوش مصنوعی →