অ্যাপ্লিকেশন-সিকিউরিটি ফার্ম সেমগ্রেপের একটি নতুন বেঞ্চমার্ক একটি অপ্রত্যাশিত ফলাফল দিয়েছে: চীনের ঝিপু এআই-এর একটি ওপেন-ওয়েট মডেল সফ্টওয়্যারে প্রকৃত নিরাপত্তা ত্রুটিগুলি খুঁজে বের করার ক্ষেত্রে অ্যানথ্রপিকের ক্লডকে ছাড়িয়ে গেছে। অনুসন্ধানটি সবচেয়ে সক্ষম এআই অগত্যা সবচেয়ে ব্যয়বহুল বা সবচেয়ে সীমাবদ্ধ কিনা তা নিয়ে বিতর্কে জ্বালানি যোগ করে।
অ্যানথ্রপিকের শক্তিশালী মিথোস মডেলটি মার্কিন রপ্তানি নিষেধাজ্ঞার আড়ালে আটকে থাকার কারণে, একটি অ্যাক্সেসযোগ্য বিকল্পের সন্ধানে থাকা নিরাপত্তা দলগুলি সর্বশেষ AI শিল্পের কভারেজের জন্য GLM 5.2 এর মতো ওপেন-ওয়েট বিকল্পগুলির দিকে ঝুঁকছে। সেমগ্রেপের পরীক্ষা, 22 জুন প্রকাশিত, পরামর্শ দেয় যে শিকার আশার চেয়ে তাড়াতাড়ি পরিশোধ করতে পারে।
সেমগ্রেপ কি পরীক্ষা করেছে
সেমগ্রেপ তার অভ্যন্তরীণ IDOR- সনাক্তকরণ বেঞ্চমার্কে ওপেন-ওয়েট এবং ফ্রন্টিয়ার মডেলগুলির একটি লাইনআপ মূল্যায়ন করেছে। IDORs — ইনসিকিউর ডাইরেক্ট অবজেক্ট রেফারেন্স — হল অ্যাক্সেস-কন্ট্রোল বাগ যা একজন ব্যবহারকারীকে অন্য ব্যবহারকারীর ডেটাতে পৌঁছাতে দেয়। প্রথাগত স্ট্যাটিক বিশ্লেষণের সাথে তাদের ধরা কুখ্যাতভাবে কঠিন কারণ ত্রুটিটি সিনট্যাক্টিকের চেয়ে যৌক্তিক: কোডটি প্রযুক্তিগতভাবে বৈধ, এটিতে কেবল অনুমোদন চেকের অভাব রয়েছে।
কোম্পানিটি এআই যুক্তির সাথে তার নিয়ম-ভিত্তিক ইঞ্জিনকে একত্রিত করে এই দুর্বলতাগুলি চিহ্নিত করার জন্য একটি কর্মপ্রবাহকে পরিমার্জন করছে। মডেল থেকে কতটা পারফরম্যান্স আসে তার চারপাশের স্ক্যাফোল্ডিং থেকে আলাদা করার জন্য, গবেষকরা একটি ন্যূনতম জোতা দিয়ে জনপ্রিয় ওপেন-ওয়েট মডেলের একটি সেট চালান — প্রতিটি মডেলকে দেওয়া একই IDOR প্রম্পট ব্যবহার করে একটি সাধারণ Pydantic সেটআপ, কোনো এন্ডপয়েন্ট আবিষ্কার এবং কোনো নির্দেশিত নেভিগেশন ছাড়াই। প্রম্পটটি শুধুমাত্র একটি মৌলিক অনুসন্ধান কৌশল এবং একটি IDOR দেখতে কেমন তা নিয়ে কয়েকটি পয়েন্টার দেয় — "এখানে কোড আছে, বাগগুলি খুঁজুন" এর চেয়ে একটু বেশি, কিন্তু সেমগ্রেপের সম্পূর্ণ পাইপলাইনের ভিতরে চলাকালীন সীমান্ত কোডিং এজেন্টরা যা পায় তার চেয়ে অনেক কম।
আইডিওআরগুলি অ্যাপ্লিকেশন সুরক্ষা দলগুলির জন্য একটি ক্রমাগত মাথাব্যথা কারণ তারা প্রচলিত স্ক্যানারগুলির ফাটলের মধ্যে পড়ে। একটি নিয়ম-ভিত্তিক টুল একটি অনুপস্থিত ইনপুট চেককে পতাকাঙ্কিত করতে পারে, তবে একটি নির্দিষ্ট শেষ পয়েন্ট আসলে অন্য ব্যবহারকারীর ডেটা প্রকাশ করে কিনা তা বোঝার জন্য অ্যাপ্লিকেশনটির ব্যবসায়িক যুক্তি সম্পর্কে যুক্তির প্রয়োজন হয় — ঠিক সেই ধরনের প্রাসঙ্গিক রায় যা বড় ভাষার মডেলগুলি ক্রমবর্ধমানভাবে ভাল।
GLM 5.2 নেতৃত্ব দেয়
স্ট্যান্ডআউট ছিল GLM 5.2, Zhipu AI এর ওপেন-ওয়েট মডেল। একটি বেয়ার প্রম্পট ছাড়া আর কিছুই না চালিয়ে, এটি IDOR সনাক্তকরণে 39% F1 স্কোর করেছে — ক্লড কোডের 32% কে সাতটি পূর্ণ পয়েন্টে পরাজিত করেছে। সেমগ্রেপের মতে, ওপেন-ওয়েট মডেলটি টাস্কে Claude Opus 4.8-কেও ছাড়িয়ে গেছে, এটিকে পরীক্ষিত সবচেয়ে শক্তিশালী নন-ফ্রন্টিয়ার বিকল্পে পরিণত করেছে।
অর্থনীতি একইভাবে আকর্ষণীয় ছিল। GLM 5.2-এর মূল্যে, প্রতি দুর্বলতার জন্য রানের খরচ প্রায় $0.17। হাজার হাজার এন্ডপয়েন্ট স্ক্যান করতে পারে এমন সংস্থাগুলির জন্য, সেমগ্রেপ উল্লেখ করেছেন যে প্রতি-বাগ খরচ প্রায়শই একটি শনাক্তকরণ কৌশল স্কেলে ব্যবহারিক কিনা তা নির্ধারণকারী ফ্যাক্টর।
অন্যান্য ওপেন-ওয়েট প্রতিযোগীরা আরও পিছিয়ে। MiniMax M3 23% F1 স্কোর করেছে এবং Kimi K2.7 কোড 22% এ অবতরণ করেছে, উভয়ই ক্লাউড কোডের নীচে ক্লাস্টার। সেমগ্রেপ ওপেন-ওয়েট বিভাগের জন্য একটি প্রতিনিধি ফলাফলের পরিবর্তে GLM 5.2 কে স্পষ্ট ব্যতিক্রম হিসাবে চিহ্নিত করেছে।
জোতা এখনও গুরুত্বপূর্ণ
কাঁচা-প্রম্পট বিভাগে ওপেন-ওয়েট জয় সত্ত্বেও, সেমগ্রেপের নিজস্ব উদ্দেশ্য-নির্মিত পাইপলাইন সামগ্রিকভাবে শীর্ষস্থানীয় ছিল। কোম্পানির মাল্টিমোডাল সেটআপ - যা নিয়ম-ভিত্তিক সনাক্তকরণ এবং কাঠামোগত এন্ডপয়েন্ট গণনার সাথে AI যুক্তিকে একত্রিত করে — কনফিগারেশনের উপর নির্ভর করে 53% থেকে 61% F1 অর্জন করেছে। এই ব্যবধানটি গবেষকদের মূল প্রশ্নটিকে আন্ডারস্কোর করে: কতটা দুর্বলতা-সনাক্তকরণ কার্যকারিতা মডেল, এবং এর চারপাশে কতটা আর্কিটেকচার?
উত্তরটি বলে মনে হচ্ছে "উভয়ই, কিন্তু মানুষ যতটা না ধরে নেয় তার চেয়ে বেশি হয় জোতা।" GLM 5.2 প্রমাণ করেছে যে একটি সক্ষম মডেল ন্যূনতম সমর্থনের সাথে অর্থপূর্ণ কাজ করতে পারে, তবুও এটি এখনও সমস্যার জন্য বিশেষভাবে তৈরি করা সিস্টেমের সাথে মেলেনি।
সেমগ্রেপ দল - যার মধ্যে গবেষক প্যাক্সটন-ফিয়ার, সেথ জ্যাকসিক, ব্রেন্ডেন নোব্লিট এবং এরিক বুকানান অন্তর্ভুক্ত ছিল - বলেছে যে তারা "সত্যিই হতবাক" যে একটি খোলা ওজনের মডেল একটি বেয়ার প্রম্পটে চলমান একটি ফ্রন্টিয়ার কোডিং এজেন্টকে একটি যুক্তি-ভারী নিরাপত্তা টাস্কে ছাড়িয়ে গেছে।
বাড়িতে পৌরাণিক কাহিনী
বেঞ্চমার্ক বর্তমান ভূ-রাজনৈতিক পটভূমিতে অতিরিক্ত ওজন বহন করে। ব্লগ পোস্টের শিরোনাম - "আমরা বাড়িতে মিথোস আছে" - এই সত্যটির একটি সুস্পষ্ট রেফারেন্স যে অ্যানথ্রপিকের সাইবারসিকিউরিটি-কেন্দ্রিক মিথোস মডেলটি বিশ্বের বেশিরভাগ ক্ষেত্রে কার্যকরভাবে অনুপলব্ধ। ট্রাম্প প্রশাসন অ-মার্কিন নাগরিকদের মিথোস এবং এর সীমাবদ্ধ সহোদর Fable 5 ব্যবহার করতে নিষেধ করার পরে, গ্লোবাল সিকিউরিটি দলগুলি আক্রমণাত্মক এবং প্রতিরক্ষামূলক সুরক্ষা কাজের জন্য সর্বাধিক সক্ষম AI হিসাবে বিবেচিত হওয়ার অ্যাক্সেস হারিয়েছিল।
সেই ভ্যাকুয়ামে, অ্যাক্সেসযোগ্য ওপেন-ওয়েট মডেলগুলি শূন্যস্থান পূরণ করছে। সত্য যে GLM 5.2 — অবাধে ডাউনলোডযোগ্য এবং যে কোনও জায়গায় স্থাপনযোগ্য — ইতিমধ্যেই নির্দিষ্ট সুরক্ষা কাজের ক্ষেত্রে সীমান্ত মালিকানাধীন মডেলের সাথে মিল বা হারাতে পারে তা প্রস্তাব করে যে রপ্তানি নিষেধাজ্ঞার শীতল প্রভাব লক্ষ্যের চেয়ে ছোট হতে পারে। যদি সেরা "অনিয়ন্ত্রিত" মডেলটি উন্নতি করতে থাকে, তাহলে মজুতদার সীমান্তের ক্ষমতার কৌশলগত মান হ্রাস পায়।
আপাতত, ফলাফলটি সংকীর্ণ: দুর্বলতার একক শ্রেণীর উপর একটি একক মানদণ্ড। কিন্তু এটি একটি সংকেত যে ওপেন-ওয়েট ফ্রন্টিয়ার অনেকের ধারণার চেয়ে দ্রুত বন্ধ হয়ে যাচ্ছে, এবং সেই অ্যাক্সেসযোগ্যতা - কাঁচা সামর্থ্য নয় - AI নিরাপত্তা ল্যান্ডস্কেপে সংজ্ঞায়িত পরিবর্তনশীল হতে পারে।
অনুসন্ধানটি ফ্রন্টিয়ার ল্যাবগুলির জন্য অস্বস্তিকর প্রশ্নও উত্থাপন করে। যদি একটি অবাধে উপলব্ধ মডেল ইতিমধ্যেই নিরাপত্তা যুক্তির কাজগুলিতে মালিকানাধীন সিস্টেমের সাথে মেলে, তবে বন্ধ মডেলগুলির চারপাশে প্রতিযোগিতামূলক পরিখা সংকুচিত হয় - বিশেষ করে যখন রপ্তানি নিয়ন্ত্রণ সেই বন্ধ মডেলগুলিকে বিশ্ববাজারের বিভিন্ন অংশের কাছে অ্যাক্সেসযোগ্য করে তোলে। ওপেন-ওয়েট ডেভেলপাররা, ব্যবহারের বিধিনিষেধ দ্বারা ভারমুক্ত, একই সাথে সব জায়গায় পুনরাবৃত্তি এবং স্থাপন করতে পারে।



