Z.ai، شرکت هوش مصنوعی مستقر در پکن که به نام ژیپو نیز شناخته میشود، GLM-5.3 را منتشر کرده است، نسخه جدیدی از مدل پرچمدار خود که به گفته این شرکت، تواناترین سیستم وزن باز آن برای مهندسی نرمافزار است – و بهطور غیرمنتظرهای مهارتهای امنیت سایبری فوقالعادهای را توسعه داده است. GLM-5.3 که در 14 آگوست اعلام شد و در یک پست وبلاگ شرکت توضیح داده شد، بر روی همان مدل پایه تقریباً 700 میلیارد پارامتری ساخته شده است که GLM-5.2 قبلی خود که در ژوئن منتشر شد. این شرکت میگوید هر پیشرفتی بهجای یک پایه بزرگتر، ناشی از پس از آموزش است. این نسخه جدیدترین در موج مدلهای وزن باز چینی است که هدف آنها رقابت با سیستمهای بسته Anthropic و OpenAI است. برای ردیاب مدل [AI Buzz Wire] (https://aibuzzwire.news)، GLM-5.3 یک سیگنال واضح است که مرز با وزن باز، شکاف کدگذاری را سریعتر از آنچه بسیاری انتظار داشتند، می بندد.
سود به طور کامل در پس از آموزش ساخته شده است
Z.ai در مورد رویکرد خود با GLM-5.3 صریح است: "مقیاس بندی بعد از آموزش تنها کاری است که ما انجام دادیم." این شرکت پشته یادگیری تقویتی را که با GLM-5.2 معرفی کرده بود حمل کرد - از جمله IndexShare برای پردازش کارآمد با زمینه طولانی، SAO برای یادگیری تقویتی در کارهای افق بلند، و یک چارچوب منبع باز به نام slime برای آموزش ناهمزمان در مقیاس بزرگ. در ماه گذشته محیطهای بیشتر، وظایف متنوعتر و محاسبات بیشتری را در آن پشته ریخت.
سود در سراسر معیارهای کدنویسی نشان داده می شود. در ترمینال بنچ 3.0، GLM-5.3 از امتیاز 4.6 GLM-5.2 به 28.3 جهش می کند - که بیش از شش برابر پیشرفت است. نتایج بهروزترین منبع باز را در ترمینال بنچ 3.0 و آخرین امتحان نمایندگان ارسال میکند، و از 23.8 به 28.5 در معیار ALE-CLI توانایی عامل بهبود مییابد. Z.ai نسبت به GLM-5.2 در Z.ai Code Bench داخلی خود، یک معیار خصوصی که برای ارزیابی عوامل کدگذاری در محیطهای توسعه واقعی و کاهش خطر آلودگی ناشی از مجموعههای آزمایشی عمومی طراحی شده است، 50 درصد بهبود یافته است.
مهمتر از همه، دستاوردها با کارایی بهتر نشانه ها به دست می آیند، نه فقط نتایج بهتر. در تلاش High، GLM-5.3 در معیار داخلی با تقریباً 50000 توکن خروجی در هر کار به 31.4% می رسد که Z.ai می گوید که با 120000 توکن از Claude Opus 4.8 Anthropic با 29.5% پیشی می گیرد. GLM-5.3 همچنان از کلود فبل 5 پیشرفتهتر Anthropic که با حداکثر تلاش به 39.5% میرسد، تعقیب میکند.
یک جهش غیرمنتظره در قابلیت سایبری
بارزترین نتیجه GLM-5.3 نه در کدنویسی بلکه در امنیت است. همانطور که Z.ai پس از آموزش را مقیاسبندی کرد و دادهها و محیطهای کشف آسیبپذیری را در ترکیب آموزشی معرفی کرد، انتظار داشت که مدل در یافتن و استدلال درباره نقصها بهبود یابد. چیزی که تیم را شگفت زده کرد این بود که این توانایی با چه سرعتی توسعه یافت.
GLM-5.3 فقط در تشخیص اشکالات جدا شده بهتر نشد. شروع به استدلال در مراحل مختلف بهره برداری کرد و طرح های منسجمی برای زنجیره های حمله کامل شکل داد. در CyberGym، معیاری که آزمایش میکند آیا یک مدل میتواند آسیبپذیریها را از روی کد منبع سفید شناسایی و تأیید کند، GLM-5.3 امتیاز 84.5 درصدی را از GLM-5.2 به 77.2 درصد میدهد. این بهترین نتیجه در معیار است، بالاتر از Mythos 5 با 83.8٪ و GPT-5.6 Sol با 83.6٪. در ExploitBench، که مستلزم استدلال عمیقتر در مورد آسیبپذیریهای واقعی و بهرهبرداری از آنها است، GLM-5.3 امتیاز GLM-5.2 را بیش از دو برابر میکند و به 54.4 درصد میرسد – هرچند که بسیار عقبتر از Mythos 5 با 78.0 درصد و GPT-5.6 Sol با 76.5 درصد است.
Z.ai الگوی ثابتی را مشاهده میکند: هر چه یک معیار در زنجیره بهرهبرداری بالاتر باشد، افزایش نسبت به GLM-5.2 بیشتر است - و همچنین شکاف باقیمانده تا مرز بسته بیشتر میشود. این شرکت خاطرنشان میکند: «قابلیت دقیقاً در جایی که ما عقبتر هستیم، سریعترین رشد را دارد.
کشف آسیب پذیری در دنیای واقعی
مهارت های سایبری به معیارها محدود نمی شود. Z.ai گزارش می دهد که از زمان GLM-5.2، با چندین تیم امنیتی در چین کار کرده است تا مدل های خود را در برابر پایگاه های کد واقعی آزمایش کند. پس از بررسی تخصصی، غربالگری و حذف مجدد، این مدل 2436 آسیب پذیری را در 269 پروژه شناسایی کرد که شامل 1097 مشکل با شدت متوسط به بالا بود. یافتهها شامل هستههای سیستم، سیستمهای عامل، موتورهای مرورگر، زیرساختهای منبع باز، برنامههای کاربردی وب و پروتکلهای شبکه میشوند که بسیاری از آنها برای سالها یا حتی دههها مورد توجه قرار نگرفته بودند و قدیمیترین آنها به حدود 40 سال قبل برمیگشتند.
این نتایج بازتاب کارهایی است که Anthropic در تحقیقات امنیتی چندعاملی خود شرح داده است، که در آن از گروههای هماهنگ از عوامل برای جستجوی آسیبپذیریها در نرمافزار منبع باز در مقیاس استفاده میشود.
وزنه های باز - با تاخیر
Z.ai می گوید که وزنه های GLM-5.3 را در دو هفته پس از ارزیابی ایمنی و سخت شدن کامل آزاد می کند. این تأخیر عمدی منعکس کننده تنشهایی است که در این اعلامیه وجود دارد: مدلی که قابلیتهای سایبری تهاجمی قوی را سریعتر از آنچه سازندگانش پیشبینی میکردند توسعه میدهد، دقیقاً همان سیستمی است که سؤالاتی را در مورد انتشار مسئولانه ایجاد میکند. این شرکت تأکید میکند که سازگاری آموزش-پرداخت آن تا حد بالایی از دقت عددی بهبود یافته است و بسیاری از دشواریهای مقیاسبندی از خود مدل به طراحی محیطهای کار واقعی و قابل تأیید تغییر کرده است.
تصویر رقابتی روشن است. GLM-5.3 فاصله تا مرز بسته در کدنویسی و وظایف عاملی را کاهش میدهد و در عین حال ادعای برتری مطلق در حداقل یک معیار اصلی کشف آسیبپذیری را دارد. این کار را بهعنوان یک مدل وزن باز انجام میدهد - به این معنی که پس از انتشار، وزنها بهطور رایگان برای دانلود، مطالعه و ساختن برای همه در دسترس خواهند بود. اینکه آیا این باز بودن پیشرفت را تسریع میکند یا نگرانیهای امنیتی تازهای را ایجاد میکند، بحثی است که GLM-5.3 کاملاً تضمین شده است که دوباره روشن شود.
از هوش مصنوعی جلوتر بمانید
برای آخرین نسخههای مدل هوش مصنوعی، نبردهای معیار، و تحلیل صنعت، [AI Buzz Wire] (https://aibuzzwire.news) را نشانکگذاری کنید.
بیشتر بخوانید اخبار هوش مصنوعی →