Z.ai, বেইজিং-ভিত্তিক কৃত্রিম বুদ্ধিমত্তা কোম্পানী যা Zhipu নামেও পরিচিত, GLM-5.3 প্রকাশ করেছে, এটি তার ফ্ল্যাগশিপ মডেলের একটি নতুন পুনরাবৃত্তি যা কোম্পানি বলে যে এটি সফ্টওয়্যার ইঞ্জিনিয়ারিংয়ের জন্য এখনও পর্যন্ত সবচেয়ে সক্ষম ওপেন-ওয়েট সিস্টেম - এবং এটি অপ্রত্যাশিতভাবে ভয়ঙ্কর সাইবার নিরাপত্তা দক্ষতা বিকাশ করেছে। 14 আগস্টে ঘোষণা করা হয়েছে এবং একটি কোম্পানির ব্লগ পোস্টে বিস্তারিতভাবে বলা হয়েছে, GLM-5.3 একই মোটামুটি 700-বিলিয়ন-প্যারামিটার বেস মডেলের উপর তৈরি করা হয়েছে যার পূর্বসূরি GLM-5.2 জুন মাসে প্রকাশিত হয়েছে। প্রতিটি উন্নতি, কোম্পানি বলে, একটি বৃহত্তর ভিত্তির পরিবর্তে প্রশিক্ষণ-পরবর্তী থেকে আসে। অ্যানথ্রোপিক এবং ওপেনএআই থেকে বন্ধ সিস্টেমগুলিকে পরাজিত করার লক্ষ্যে চীনা ওপেন-ওয়েট মডেলগুলির একটি তরঙ্গের মধ্যে প্রকাশটি সর্বশেষ। AI Buzz Wire মডেল ট্র্যাকারের জন্য, GLM-5.3 একটি স্পষ্ট সংকেত যে ওপেন-ওয়েট ফ্রন্টিয়ার অনেকের প্রত্যাশার চেয়ে দ্রুত কোডিং গ্যাপ বন্ধ করছে।
লাভ সম্পূর্ণভাবে পোস্ট-ট্রেনিং এর উপর নির্মিত
Z.ai GLM-5.3-এর সাথে তার পদ্ধতির বিষয়ে ভোঁতা: "প্রশিক্ষণ-পরবর্তী স্কেলিংই আমরা করেছি।" কোম্পানিটি GLM-5.2-এর সাথে প্রবর্তিত রিইনফোর্সমেন্ট-লার্নিং স্ট্যাকটি বহন করে — যার মধ্যে রয়েছে দক্ষ দীর্ঘ-প্রসঙ্গ প্রক্রিয়াকরণের জন্য IndexShare, দীর্ঘ-দিগন্তের কাজগুলিতে শক্তিবৃদ্ধি শেখার জন্য SAO এবং বড়-স্কেল অ্যাসিঙ্ক্রোনাস প্রশিক্ষণের জন্য স্লাইম নামে একটি ওপেন-সোর্স ফ্রেমওয়ার্ক। গত মাসে এটি কেবল সেই স্ট্যাকের মধ্যে আরও পরিবেশ, আরও বৈচিত্র্যপূর্ণ কাজ এবং আরও গণনা ঢেলে দিয়েছে।
পেঅফ কোডিং বেঞ্চমার্ক জুড়ে দেখায়। টার্মিনাল বেঞ্চ 3.0-এ, GLM-5.3 GLM-5.2-এর স্কোর 4.6 থেকে 28.3-তে লাফিয়েছে - এটি ছয় গুণেরও বেশি উন্নতি। এটি টার্মিনাল বেঞ্চ 3.0 এবং এজেন্টদের শেষ পরীক্ষায় ওপেন-সোর্স অত্যাধুনিক ফলাফল পোস্ট করে এবং এজেন্টিক ক্ষমতার ALE-CLI পরিমাপে 23.8 থেকে 28.5 পর্যন্ত উন্নতি করে। Z.ai তার ইন-হাউস Z.ai কোড বেঞ্চে GLM-5.2-এর তুলনায় 50% উন্নতির রিপোর্ট করেছে, বাস্তবসম্মত উন্নয়ন পরিবেশে কোডিং এজেন্টদের মূল্যায়ন করতে এবং পাবলিক টেস্ট সেট থেকে দূষণের ঝুঁকি কমানোর জন্য ডিজাইন করা একটি ব্যক্তিগত বেঞ্চমার্ক।
গুরুত্বপূর্ণভাবে, লাভগুলি আরও ভাল টোকেন দক্ষতার সাথে আসে, শুধু ভাল ফলাফল নয়। উচ্চ প্রচেষ্টায়, GLM-5.3 ইন-হাউস বেঞ্চমার্কে প্রায় 50,000 আউটপুট টোকেন প্রতি টাস্কে 31.4% সমাপ্তিতে পৌঁছেছে, যা Z.ai বলে 120,000 টোকেনের সাথে 29.5% এ Anthropic's Claude Opus 4.8 কে ছাড়িয়ে গেছে। GLM-5.3 এখনও অ্যানথ্রপিকের আরও উন্নত ক্লাউড ফেবেল 5 এর পিছনে রয়েছে, যা সর্বোচ্চ প্রচেষ্টায় 39.5% এ পৌঁছেছে।
সাইবার সক্ষমতায় একটি অপ্রত্যাশিত উল্লম্ফন
GLM-5.3 থেকে সবচেয়ে আকর্ষণীয় ফলাফল কোডিং নয়, নিরাপত্তার ক্ষেত্রে। যেহেতু Z.ai প্রশিক্ষণ-পরবর্তী স্কেল করেছে এবং প্রশিক্ষণের সংমিশ্রণে দুর্বলতা-আবিষ্কার ডেটা এবং পরিবেশ প্রবর্তন করেছে, তাই এটি আশা করেছিল যে মডেলটি ত্রুটিগুলি খুঁজে বের করা এবং যুক্তি করার ক্ষেত্রে উন্নতি করবে। দলটি কী অবাক করেছিল তা হল কত দ্রুত সেই সক্ষমতা বিকশিত হয়েছিল।
GLM-5.3 শুধুমাত্র বিচ্ছিন্ন বাগ খুঁজে বের করার ক্ষেত্রেই ভালো হয়ে ওঠেনি; এটি শোষণের একাধিক পর্যায় জুড়ে যুক্তি দেখাতে শুরু করে, সম্পূর্ণ আক্রমণ চেইনের জন্য সুসংগত পরিকল্পনা তৈরি করে। সাইবারজিমে, একটি বেঞ্চমার্ক যা পরীক্ষা করে যে একটি মডেল হোয়াইট-বক্স সোর্স কোড থেকে দুর্বলতা সনাক্ত এবং যাচাই করতে পারে, GLM-5.3 স্কোর 84.5%, GLM-5.2 এর 77.2% থেকে। বেঞ্চমার্কে এটাই সেরা ফলাফল, Mythos 5-এর থেকে 83.8% এবং GPT-5.6 Sol-এর থেকে 83.6% এগিয়ে৷ ExploitBench-এ, যা প্রকৃত দুর্বলতা এবং তাদের শোষণ সম্পর্কে গভীর যুক্তির দাবি করে, GLM-5.3 GLM-5.2-এর স্কোর দ্বিগুণ করে, 54.4%-এ পৌঁছেছে — যদিও এটি 78.0%-এ Mythos 5 এবং GPT-5.6 Sol-এ 76.5%-এর পিছনে রয়েছে।
Z.ai একটি সামঞ্জস্যপূর্ণ প্যাটার্ন পর্যবেক্ষণ করে: শোষণ শৃঙ্খল যত উপরে একটি বেঞ্চমার্ক বসবে, GLM-5.2-এর উপরে লাভ তত বেশি হবে — এবং বন্ধ সীমান্তের অবশিষ্ট ব্যবধানও তত বেশি। "সামর্থ্য দ্রুত বৃদ্ধি পাচ্ছে ঠিক যেখানে আমরা পিছিয়ে আছি," কোম্পানি নোট করে।
বাস্তব-বিশ্বের দুর্বলতা আবিষ্কার
সাইবার দক্ষতা বেঞ্চমার্কের মধ্যে সীমাবদ্ধ নয়। Z.ai রিপোর্ট করে যে GLM-5.2 থেকে, এটি বাস্তব-বিশ্ব কোডবেসের বিরুদ্ধে তার মডেলগুলি পরীক্ষা করার জন্য চীনে বেশ কয়েকটি নিরাপত্তা দলের সাথে কাজ করছে। বিশেষজ্ঞ পর্যালোচনা, স্ক্রীনিং এবং অনুলিপিকরণের পর, মডেলটি 269টি প্রকল্প জুড়ে 2,436টি দুর্বলতা চিহ্নিত করেছে, যার মধ্যে 1,097টি মাঝারি থেকে উচ্চ তীব্রতার সমস্যা রয়েছে। ফলাফলগুলি সিস্টেম কার্নেল, অপারেটিং সিস্টেম, ব্রাউজার ইঞ্জিন, ওপেন-সোর্স অবকাঠামো, ওয়েব অ্যাপ্লিকেশন, এবং নেটওয়ার্ক প্রোটোকল - যার মধ্যে অনেকগুলি বছরের পর বছর বা এমনকি দশক ধরে অলক্ষিত ছিল, সবচেয়ে পুরানোটি প্রায় 40 বছর আগের।
এই ফলাফলগুলি ইকো ওয়ার্ক অ্যানথ্রোপিক তার নিজস্ব মাল্টিএজেন্ট সুরক্ষা গবেষণায় বর্ণনা করেছে, যেখানে ওপেন সোর্স সফ্টওয়্যার স্কেলে দুর্বলতা খুঁজে বের করতে এজেন্টদের সমন্বিত ঝাঁক ব্যবহার করা হয়েছিল।
ওপেন ওয়েটস — বিলম্বের সাথে
Z.ai বলে যে এটি দুই সপ্তাহের মধ্যে GLM-5.3 ওজন প্রকাশ করবে, একবার নিরাপত্তা মূল্যায়ন এবং শক্তকরণ সম্পূর্ণ হয়ে গেলে। এই ইচ্ছাকৃত বিলম্ব ঘোষণার মধ্য দিয়ে চলমান উত্তেজনাকে প্রতিফলিত করে: একটি মডেল যা তার নির্মাতাদের প্রত্যাশার চেয়ে দ্রুত শক্তিশালী আক্রমণাত্মক সাইবার ক্ষমতা বিকাশ করে ঠিক সেই ধরনের সিস্টেম যা দায়িত্বশীল মুক্তির বিষয়ে প্রশ্ন উত্থাপন করে। কোম্পানী জোর দেয় যে এর প্রশিক্ষণ-রোলআউট সামঞ্জস্যকে উচ্চ মাত্রার সংখ্যাগত নির্ভুলতায় উন্নত করা হয়েছে, এবং স্কেলিংয়ে অনেক অসুবিধা মডেল থেকে বাস্তবসম্মত, যাচাইযোগ্য টাস্ক পরিবেশের ডিজাইনে স্থানান্তরিত হয়েছে।
প্রতিযোগিতামূলক চিত্র স্পষ্ট। GLM-5.3 কোডিং এবং এজেন্টিক কাজগুলিতে বদ্ধ সীমান্তের দূরত্বকে সংকুচিত করে যখন অন্তত একটি প্রধান দুর্বলতা-আবিষ্কার বেঞ্চমার্কে সরাসরি নেতৃত্ব দাবি করে। এটি একটি ওপেন-ওয়েট মডেল হিসাবে এটি করে — যার অর্থ, একবার প্রকাশিত হলে, ওজনগুলি যে কেউ ডাউনলোড করতে, অধ্যয়ন করতে এবং তৈরি করতে অবাধে উপলব্ধ হবে৷ যে খোলামেলাতা অগ্রগতি ত্বরান্বিত বা নতুন নিরাপত্তা উদ্বেগ উত্থাপন একটি বিতর্ক GLM-5.3 সব কিন্তু পুনর্জাগরণ নিশ্চিত.
এআই থেকে এগিয়ে থাকুন
সর্বশেষ AI মডেল রিলিজ, বেঞ্চমার্ক যুদ্ধ এবং শিল্প বিশ্লেষণের জন্য বুকমার্ক AI Buzz Wire।
আরও এআই খবর পড়ুন →