أصدرت Z.ai، شركة الذكاء الاصطناعي ومقرها بكين والمعروفة أيضًا باسم Zhipu، GLM-5.3، وهو تكرار جديد لنموذجها الرئيسي الذي تقول الشركة إنه نظام الوزن المفتوح الأكثر قدرة حتى الآن في هندسة البرمجيات - والذي طور بشكل غير متوقع مهارات هائلة في مجال الأمن السيبراني. تم الإعلان عن GLM-5.3 في 14 أغسطس وتم تفصيله في منشور على مدونة الشركة، وهو مبني على نفس النموذج الأساسي الذي يحتوي على 700 مليار معلمة تقريبًا مثل سابقه GLM-5.2، الذي تم إصداره في يونيو. وتقول الشركة إن كل تحسن يأتي من مرحلة ما بعد التدريب وليس من أساس أكبر. يعد هذا الإصدار هو الأحدث في موجة من النماذج الصينية ذات الوزن المفتوح التي تهدف إلى التفوق على الأنظمة المغلقة من Anthropic وOpenAI. بالنسبة لتتبع نموذج AI Buzz Wire، يعد GLM-5.3 إشارة واضحة إلى أن حدود الوزن المفتوح تسد فجوة الترميز بشكل أسرع مما توقعه الكثيرون.
المكاسب مبنية بالكامل على مرحلة ما بعد التدريب
شركة Z.ai صريحة بشأن أسلوبها في التعامل مع GLM-5.3: "إن التوسع بعد التدريب هو كل ما فعلناه." واصلت الشركة حزمة التعلم المعزز التي قدمتها مع GLM-5.2، بما في ذلك IndexShare للمعالجة الفعالة للسياق الطويل، وSAO للتعلم المعزز في المهام طويلة المدى، وإطار عمل مفتوح المصدر يسمى Slime للتدريب غير المتزامن على نطاق واسع. على مدار الشهر الماضي، قامت ببساطة بإضافة المزيد من البيئات، والمزيد من المهام المتنوعة، والمزيد من الحوسبة في تلك المجموعة.
تظهر المكافأة عبر معايير الترميز. في Terminal Bench 3.0، قفز GLM-5.3 من درجة GLM-5.2 البالغة 4.6 إلى 28.3 - وهو تحسن يزيد عن ستة أضعاف. وينشر أحدث النتائج مفتوحة المصدر على Terminal Bench 3.0 وفي الاختبار الأخير للوكلاء، ويحسن من 23.8 إلى 28.5 في مقياس ALE-CLI لقدرة الوكيل. أعلنت شركة Z.ai عن تحسن بنسبة 50% عن GLM-5.2 في Z.ai Code Bench الداخلي الخاص بها، وهو معيار خاص مصمم لتقييم عوامل الترميز في بيئات التطوير الواقعية وتقليل مخاطر التلوث من مجموعات الاختبار العامة.
والأهم من ذلك، أن المكاسب تأتي بكفاءة رمزية أفضل، وليس فقط نتائج أفضل. في الجهد العالي، يصل GLM-5.3 إلى 31.4% من الإنجاز وفقًا للمعيار الداخلي بحوالي 50000 رمز مميز للإنتاج لكل مهمة، والتي تقول Z.ai إنها تتفوق على Claude Opus 4.8 من Anthropic بنسبة 29.5% مع 120000 رمز مميز. لا يزال GLM-5.3 يتخلف عن Claude Fable 5 الأكثر تقدمًا من Anthropic، والذي يصل إلى 39.5% بأقصى جهد.
قفزة غير متوقعة في القدرة السيبرانية
النتيجة الأكثر لفتًا للانتباه من GLM-5.3 ليست في الترميز بل في الأمان. ومع توسع شركة Z.ai في مرحلة ما بعد التدريب وإدخال بيانات وبيئات اكتشاف الثغرات الأمنية في مزيج التدريب، توقعت أن يتحسن النموذج في اكتشاف العيوب والتفكير بشأنها. ما فاجأ الفريق هو مدى سرعة تطور هذه القدرة.
لم يصبح GLM-5.3 أفضل في اكتشاف الأخطاء المعزولة فحسب؛ وبدأت في التفكير عبر مراحل متعددة من الاستغلال، وتشكيل خطط متماسكة لسلاسل الهجوم الكاملة. في CyberGym، وهو معيار يختبر ما إذا كان النموذج يمكنه تحديد نقاط الضعف والتحقق من صحتها من كود مصدر الصندوق الأبيض، حصل GLM-5.3 على 84.5%، مقارنة بـ 77.2% لـ GLM-5.2. هذه هي أفضل نتيجة على المؤشر، متقدمة على Mythos 5 بنسبة 83.8% وGPT-5.6 Sol بنسبة 83.6%. في ExploitBench، الذي يتطلب تفكيرًا أعمق حول الثغرات الحقيقية واستغلالها، ضاعف GLM-5.3 نتيجة GLM-5.2، حيث وصل إلى 54.4% - على الرغم من أنه لا يزال متأخرًا كثيرًا عن Mythos 5 بنسبة 78.0% وGPT-5.6 Sol بنسبة 76.5%.
وتلاحظ شركة Z.ai نمطًا ثابتًا: كلما ارتفع المعيار في سلسلة الاستغلال، كلما زاد المكاسب على GLM-5.2 - وكذلك اتسعت الفجوة المتبقية حتى الحدود المغلقة. وتشير الشركة إلى أن "القدرة تنمو بشكل أسرع حيث نحن متخلفون عن الركب".
اكتشافات الثغرات الأمنية في العالم الحقيقي
لا تقتصر المهارات السيبرانية على المعايير. تفيد Z.ai أنه منذ إصدار GLM-5.2، عملت مع العديد من فرق الأمان في الصين لاختبار نماذجها مقابل قواعد التعليمات البرمجية في العالم الحقيقي. وبعد مراجعة الخبراء والفحص وإلغاء البيانات المكررة، حدد النموذج 2,436 نقطة ضعف في 269 مشروعًا، بما في ذلك 1,097 مشكلة متوسطة إلى عالية الخطورة. تشمل النتائج نواة النظام، وأنظمة التشغيل، ومحركات المتصفح، والبنية التحتية مفتوحة المصدر، وتطبيقات الويب، وبروتوكولات الشبكة - والتي ظل الكثير منها دون أن يلاحظها أحد لسنوات أو حتى عقود، ويعود تاريخ أقدمها إلى ما يقرب من 40 عامًا.
تعكس هذه النتائج العمل الذي وصفته شركة Anthropic في أبحاثها الأمنية متعددة الوكلاء، حيث تم استخدام مجموعات منسقة من الوكلاء للبحث عن نقاط الضعف في البرامج مفتوحة المصدر على نطاق واسع.
الأوزان المفتوحة — مع تأخير
وتقول Z.ai إنها ستطلق أوزان GLM-5.3 في غضون أسبوعين، بمجرد اكتمال تقييم السلامة والتصلب. ويعكس هذا التأخير المتعمد التوتر السائد خلال الإعلان: فالنموذج الذي يطور قدرات سيبرانية هجومية قوية بشكل أسرع مما توقعه مبدعوه هو بالضبط نوع النظام الذي يثير تساؤلات حول الإطلاق المسؤول. تؤكد الشركة على أن اتساق التدريب والطرح قد تم تحسينه إلى درجة عالية من الدقة العددية، وأن الكثير من الصعوبة في القياس قد تحولت من النموذج نفسه إلى تصميم بيئات مهام واقعية يمكن التحقق منها.
الصورة التنافسية واضحة. يعمل GLM-5.3 على تضييق المسافة إلى الحدود المغلقة في مهام البرمجة والوكلاء، بينما يدعي الريادة المطلقة في معيار رئيسي واحد على الأقل لاكتشاف الثغرات الأمنية. وهو يفعل ذلك كنموذج مفتوح الوزن - مما يعني أنه بمجرد إصداره، ستكون الأوزان متاحة مجانًا لأي شخص لتنزيلها ودراستها والبناء عليها. وسواء كان هذا الانفتاح يسرع التقدم أو يثير مخاوف أمنية جديدة، فمن المؤكد أن النقاش حول GLM-5.3 سيشتعل من جديد.
البقاء في صدارة الذكاء الاصطناعي
للحصول على أحدث إصدارات نماذج الذكاء الاصطناعي والمعارك المعيارية وتحليلات الصناعة، ضع إشارة مرجعية على AI Buzz Wire.
اقرأ المزيد من أخبار الذكاء الاصطناعي →