Z.ai، بیجنگ میں مقیم مصنوعی ذہانت کی کمپنی جسے Zhipu کے نام سے بھی جانا جاتا ہے، نے GLM-5.3 جاری کیا ہے، جو اس کے فلیگ شپ ماڈل کا ایک نیا اعادہ ہے جس کے بارے میں کمپنی کا کہنا ہے کہ سافٹ ویئر انجینئرنگ کے لیے ابھی تک اس کا سب سے زیادہ قابل اوپن ویٹ سسٹم ہے - اور ایک جس نے غیر متوقع طور پر زبردست سائبر سیکیورٹی کی مہارتیں تیار کی ہیں۔ 14 اگست کو اعلان کیا گیا اور کمپنی کی ایک بلاگ پوسٹ میں تفصیل سے بتایا گیا، GLM-5.3 اسی تقریباً 700-بلین پیرامیٹر بیس ماڈل پر بنایا گیا ہے جو کہ اس کے پیشرو GLM-5.2، جون میں جاری کیا گیا تھا۔ کمپنی کا کہنا ہے کہ ہر بہتری ایک بڑی بنیاد کے بجائے پوسٹ ٹریننگ سے آتی ہے۔ ریلیز چینی اوپن ویٹ ماڈلز کی ایک لہر میں تازہ ترین ہے جس کا مقصد اینتھروپک اور اوپن اے آئی سے بند سسٹمز کا مقابلہ کرنا ہے۔ AI Buzz Wire ماڈل ٹریکر کے لیے، GLM-5.3 ایک واضح اشارہ ہے کہ اوپن ویٹ فرنٹیئر بہت سے لوگوں کی توقع سے زیادہ تیزی سے کوڈنگ گیپ کو بند کر رہا ہے۔

مکمل طور پر پوسٹ ٹریننگ پر بنائے گئے فوائد

Z.ai GLM-5.3 کے ساتھ اپنے نقطہ نظر کے بارے میں دو ٹوک ہے: "تربیت کے بعد کی پیمائش صرف ہم نے کی۔" کمپنی نے GLM-5.2 کے ساتھ متعارف کرائے گئے ری انفورسمنٹ لرننگ اسٹیک کو سنبھالا — جس میں موثر لانگ سیاق و سباق کی پروسیسنگ کے لیے IndexShare، طویل افق کے کاموں پر کمک سیکھنے کے لیے SAO، اور بڑے پیمانے پر غیر مطابقت پذیر تربیت کے لیے سلائم نامی اوپن سورس فریم ورک شامل ہے۔ پچھلے مہینے کے دوران اس نے اس اسٹیک میں مزید ماحول، زیادہ متنوع کام، اور زیادہ کمپیوٹنگ ڈالی۔

ادائیگی کوڈنگ بینچ مارکس میں ظاہر ہوتی ہے۔ ٹرمینل بنچ 3.0 پر، GLM-5.3 GLM-5.2 کے 4.6 کے اسکور سے 28.3 تک چھلانگ لگاتا ہے - چھ گنا سے زیادہ بہتری۔ یہ ٹرمینل بنچ 3.0 اور ایجنٹوں کے آخری امتحان پر اوپن سورس کے جدید ترین نتائج شائع کرتا ہے، اور ایجنٹ کی صلاحیت کے ALE-CLI پیمائش پر 23.8 سے 28.5 تک بہتر ہوتا ہے۔ Z.ai نے اپنے اندرون خانہ Z.ai کوڈ بنچ پر GLM-5.2 کے مقابلے میں 50% بہتری کی اطلاع دی ہے، یہ ایک نجی بینچ مارک ہے جو حقیقت پسندانہ ترقی کے ماحول میں کوڈنگ ایجنٹوں کا جائزہ لینے اور عوامی ٹیسٹ سیٹس سے آلودگی کے خطرے کو کم کرنے کے لیے ڈیزائن کیا گیا ہے۔

اہم طور پر، فوائد بہتر ٹوکن کارکردگی کے ساتھ آتے ہیں، نہ صرف بہتر نتائج۔ زیادہ کوششوں پر، GLM-5.3 اندرون خانہ بینچ مارک پر تقریباً 50,000 آؤٹ پٹ ٹوکن فی ٹاسک پر 31.4% تکمیل تک پہنچ جاتا ہے، جو Z.ai کا کہنا ہے کہ 120,000 ٹوکنز کے ساتھ 29.5% پر Anthropic's Claude Opus 4.8 کو پیچھے چھوڑ دیتا ہے۔ GLM-5.3 اب بھی Anthropic کے زیادہ جدید Claude Fable 5 سے پیچھے ہے، جو زیادہ سے زیادہ کوشش پر 39.5% تک پہنچ جاتا ہے۔

سائبر صلاحیت میں ایک غیر متوقع چھلانگ

GLM-5.3 کا سب سے حیران کن نتیجہ کوڈنگ میں نہیں بلکہ سیکیورٹی میں ہے۔ جیسا کہ Z.ai نے تربیت کے بعد کی پیمائش کی اور تربیتی مکس میں خطرے کی دریافت کے ڈیٹا اور ماحول کو متعارف کرایا، اس سے توقع کی گئی کہ ماڈل خامیوں کو تلاش کرنے اور ان پر استدلال کرنے میں بہتری لائے گا۔ ٹیم کو جس چیز نے حیران کیا وہ یہ تھا کہ اس صلاحیت نے کتنی جلدی ترقی کی۔

GLM-5.3 صرف الگ تھلگ کیڑے تلاش کرنے میں بہتر نہیں ہوا؛ اس نے استحصال کے متعدد مراحل میں استدلال شروع کیا، مکمل حملے کی زنجیروں کے لیے مربوط منصوبے بنائے۔ سائبر جیم پر، ایک بینچ مارک جو یہ جانچتا ہے کہ آیا کوئی ماڈل وائٹ باکس سورس کوڈ سے کمزوریوں کی شناخت اور توثیق کر سکتا ہے، GLM-5.3 اسکور 84.5%، GLM-5.2 کے 77.2% سے زیادہ ہے۔ یہ بینچ مارک پر بہترین نتیجہ ہے، Mythos 5 سے 83.8% اور GPT-5.6 Sol سے 83.6% پر۔ ExploitBench پر، جو حقیقی کمزوریوں اور ان کے استحصال کے بارے میں گہری استدلال کا مطالبہ کرتا ہے، GLM-5.3 GLM-5.2 کے اسکور کو دگنا کرتا ہے، جو 54.4% تک پہنچ جاتا ہے — حالانکہ یہ Mythos 5 سے 78.0% اور GPT-5.6 Sol سے 76.5% پر کافی پیچھے ہے۔

Z.ai ایک مستقل پیٹرن کا مشاہدہ کرتا ہے: استحصالی سلسلہ جتنا آگے بڑھتا ہے، ایک بینچ مارک بیٹھتا ہے، GLM-5.2 پر اتنا ہی بڑا فائدہ ہوتا ہے — اور بند سرحد تک بقیہ خلا بھی اتنا ہی وسیع ہوتا ہے۔ کمپنی نے نوٹ کیا کہ "صلاحیت بالکل تیزی سے بڑھ رہی ہے جہاں ہم سب سے پیچھے ہیں۔"

حقیقی دنیا کے خطرے سے متعلق دریافتیں۔

سائبر کی مہارتیں بینچ مارکس تک محدود نہیں ہیں۔ Z.ai نے رپورٹ کیا ہے کہ GLM-5.2 کے بعد سے، یہ چین میں کئی سیکیورٹی ٹیموں کے ساتھ مل کر اپنے ماڈلز کو حقیقی دنیا کے کوڈ بیسز کے خلاف جانچنے کے لیے کام کر رہا ہے۔ ماہرانہ جائزہ، اسکریننگ، اور ڈپلیکیشن کے بعد، ماڈل نے 269 پروجیکٹوں میں 2,436 کمزوریوں کی نشاندہی کی، جن میں 1,097 درمیانے درجے سے زیادہ شدت کے مسائل شامل ہیں۔ نتائج سسٹم کے کرنل، آپریٹنگ سسٹم، براؤزر انجن، اوپن سورس انفراسٹرکچر، ویب ایپلیکیشنز، اور نیٹ ورک پروٹوکولز پر محیط ہیں - جن میں سے بہت سے سالوں یا اس سے بھی دہائیوں تک کسی کا دھیان نہیں گئے، جن کی تاریخ تقریباً 40 سال پرانی ہے۔

ان نتائج کی بازگشت Anthropic نے اپنی ملٹی ایجنٹ سیکیورٹی ریسرچ میں بیان کی ہے، جہاں بڑے پیمانے پر اوپن سورس سافٹ ویئر میں کمزوریوں کی تلاش کے لیے ایجنٹوں کے مربوط بھیڑ کا استعمال کیا گیا تھا۔

کھلے وزن - تاخیر کے ساتھ

Z.ai کا کہنا ہے کہ یہ GLM-5.3 وزن کو دو ہفتوں میں جاری کرے گا، ایک بار جب حفاظت کی جانچ اور سختی مکمل ہو جائے گی۔ یہ جان بوجھ کر تاخیر اعلان کے دوران جاری تناؤ کی عکاسی کرتی ہے: ایک ایسا ماڈل جو طاقتور جارحانہ سائبر صلاحیتوں کو اپنے تخلیق کاروں کی توقع سے زیادہ تیزی سے تیار کرتا ہے بالکل وہی نظام ہے جو ذمہ دارانہ رہائی کے بارے میں سوالات اٹھاتا ہے۔ کمپنی اس بات پر زور دیتی ہے کہ اس کی تربیت – رول آؤٹ کی مستقل مزاجی کو اعلیٰ درجے کی عددی درستگی تک بہتر بنایا گیا ہے، اور اسکیلنگ میں زیادہ تر دشواری خود ماڈل سے حقیقت پسندانہ، قابل تصدیق کام کے ماحول کے ڈیزائن کی طرف منتقل ہو گئی ہے۔

مسابقتی تصویر واضح ہے۔ GLM-5.3 کوڈنگ اور ایجنٹی کاموں پر بند فرنٹیئر تک فاصلے کو کم کرتا ہے جبکہ کم از کم ایک بڑے خطرے سے متعلق دریافت بینچ مارک پر مکمل برتری کا دعوی کرتا ہے۔ یہ ایک کھلے وزن والے ماڈل کے طور پر ایسا کرتا ہے - مطلب یہ ہے کہ، ایک بار جاری ہونے کے بعد، وزن کسی کے لیے بھی ڈاؤن لوڈ، مطالعہ اور تعمیر کرنے کے لیے آزادانہ طور پر دستیاب ہوگا۔ چاہے یہ کھلا پن ترقی کو تیز کرتا ہے یا تازہ سیکیورٹی خدشات کو جنم دیتا ہے ایک بحث ہے GLM-5.3 پھر سے شروع ہونے کی ضمانت ہے۔

AI سے آگے رہیں

تازہ ترین AI ماڈل کی ریلیز، بینچ مارک لڑائیوں، اور صنعت کے تجزیہ کے لیے، بک مارک AI Buzz Wire۔

مزید AI خبریں پڑھیں →