গবেষকরা যুক্তিযুক্ত AI মডেলগুলির বিরুদ্ধে একটি শক্তিশালী নতুন আক্রমণ প্রদর্শন করেছেন যা একটি মৌলিক অন্ধ স্থানকে কাজে লাগায় যে কীভাবে বড় ভাষা মডেলগুলি (LLMs) ডেটা থেকে নির্দেশাবলীকে আলাদা করে। চেইন-অফ-থট (CoT) ফোরজি নামক কৌশলটি একটি মডেলকে আক্রমণকারী দ্বারা সরবরাহ করা পাঠ্যকে এমনভাবে ব্যবহার করে যেন এটি মডেলের নিজস্ব ব্যক্তিগত অভ্যন্তরীণ যুক্তি, পাঠ্যটিকে বৈধ নির্দেশাবলীকে ওভাররাইড করার অনুমতি দেয়।
হ্যাকাডে দ্বারা রিপোর্ট করা ফলাফলগুলি নির্দেশ করে যে কেন ম্যানিপুলেশনের বিরুদ্ধে এআই সিস্টেমগুলি সুরক্ষিত করা একটি অমীমাংসিত সমস্যা রয়ে গেছে। ক্ষেত্রের উদীয়মান হুমকির সাথে তাল মিলিয়ে চলতে, চলমান বিশ্লেষণের জন্য আমাদের AI শিল্প কভারেজ অনুসরণ করুন।
মূল কারণ: ভূমিকা বিভ্রান্তি
দুর্বলতার কেন্দ্রবিন্দুতে গবেষকরা "ভূমিকা বিভ্রান্তি" হিসাবে বর্ণনা করেছেন। আধুনিক এলএলএমগুলি তাদের সমস্ত ইনপুট-সিস্টেম নিয়ম, ব্যবহারকারীর অনুরোধ এবং মডেলের নিজস্ব চেইন-অফ-থট যুক্তি-একটি পাঠ্য চ্যানেলের মাধ্যমে গ্রহণ করে। অর্ডার আরোপ করতে, ডেভেলপাররা বিশ্বাসের একটি অনুক্রম তৈরি করতে `
`
কিভাবে আক্রমণ কাজ করে
গুরুত্বপূর্ণভাবে, CoT জালিয়াতি শুধুমাত্র `
হ্যাকাডে-এর মতে, এর ফলে এলএলএম স্বচ্ছভাবে অযৌক্তিক যুক্তিকে পূর্ববর্তী উপসংহার হিসাবে গ্রহণ করে, ব্যবহারকারীর অনুরোধে তার প্রতিক্রিয়া পরিবর্তন করে। কারণ স্পুফ করা বিষয়বস্তু কম-বিশ্বাসের ব্যবহারকারীর ইনপুটের পরিবর্তে উচ্চ-বিশ্বাসের অভ্যন্তরীণ চিন্তা হিসাবে বিবেচিত হয়, এটি নিরাপত্তার গার্ডেলগুলিকে বাইপাস করতে পারে যা সাধারণত ম্যানিপুলটিভ নির্দেশাবলীকে ব্লক করে।
একটি এলএলএম-এর ভিতরে ট্রাস্টের শ্রেণিবিন্যাস
কেন আক্রমণ সফল হয় তা বোঝার জন্য ভূমিকাগুলি কীভাবে কাজ করে তা বোঝা প্রয়োজন। হুডের নীচে, ভূমিকাগুলি মডেলের ইনপুটকে একটি সংগঠিত শ্রেণিবিন্যাসে ভাগ করে। একটি ভূমিকার নির্দেশাবলী অনুসরণ করা হয় যতক্ষণ না তারা উচ্চ-অগ্রাধিকারের সাথে বিরোধ না করে। উদাহরণস্বরূপ, "অবৈধ কার্যকলাপ নিয়ে আলোচনা করবেন না" এর একটি সিস্টেম-স্তরের নির্দেশ, একটি নিষিদ্ধ রেসিপি প্রদানের জন্য একটি ব্যবহারকারীর অনুরোধকে অগ্রাহ্য করা। `
ব্রেকডাউন ঘটে কারণ মডেলটি যান্ত্রিকভাবে সেই অনুক্রমটি প্রয়োগ করে না। পরিবর্তে, এটি আংশিকভাবে শৈলীগত সংকেত থেকে কোন পাঠ্যটি কোন ভূমিকার অন্তর্গত তা অনুমান করে। গবেষণার সম্প্রদায়ের আলোচনা হিসাবে উল্লেখ করা হয়েছে, যদি পাঠ্যটি চিন্তার প্রেক্ষাপটের মতো প্যাটার্ন করা হয়, তাহলে মডেলটি প্রকৃত যুক্তির জন্য অনুরূপ কাঠামোর সাথে যেকোন পাঠ্যকে ভুল করতে পারে-এবং চিন্তার পাঠ্য সাধারণ ব্যবহারকারী পাঠ্যের চেয়ে উচ্চতর অগ্রাধিকার বহন করে।
একটি নতুন টুইস্ট সহ একটি পরিচিত প্যাটার্ন
গবেষণাটি এআই সিস্টেমে দীর্ঘ-স্বীকৃত দুর্বলতার উপর তৈরি করে: প্রম্পট ইনজেকশন। প্রারম্ভিক আক্রমণগুলি এই সত্যকে কাজে লাগিয়েছিল যে LLM-তে নির্দেশাবলী এবং ডেটার জন্য কোনও পৃথক স্ট্রিম নেই, তাই "পূর্ববর্তী সমস্ত নির্দেশাবলী উপেক্ষা করুন" এর মতো একটি বাক্যাংশ কখনও কখনও একটি মডেলের আচরণকে হাইজ্যাক করতে পারে। ভূমিকা এবং মেটাডেটা ট্যাগগুলির প্রবর্তনের উদ্দেশ্য ছিল একটি বিশ্বস্ত শ্রেণিবিন্যাস তৈরি করে এটি প্রশমিত করা।
CoT জালিয়াতি দেখায় যে প্রশমন অসম্পূর্ণ। যতক্ষণ পর্যন্ত মডেলগুলি তার কাঠামোগত মেটাডেটা দ্বারা কঠোরভাবে না হয়ে আংশিকভাবে তার শৈলীগত বৈশিষ্ট্যগুলির দ্বারা পাঠ্যের বিশ্বাসযোগ্যতা বিচার করে, আক্রমণকারীরা যারা সঠিক শৈলীর অনুকরণ করতে পারে তারা তাদের ইনপুটের অনুভূত কর্তৃত্বকে বাড়িয়ে তুলতে পারে।
কেন এটা ঠিক করা কঠিন
গবেষক, চার্লস ইয়ে, জেসমিন কুই এবং ডিলান হ্যাডফিল্ড-মেনল যুক্তি দেন যে LLM-তে ভূমিকা উপলব্ধি একটি বাইনারি সম্পত্তি নয় যা পরিষ্কারভাবে প্রয়োগ করা যেতে পারে। মডেলরা হার্ড-কোডেড নিয়মের পরিবর্তে প্রশিক্ষণের মাধ্যমে ট্যাগগুলিকে ব্যাখ্যা করতে শেখে, যার অর্থ তাদের আচরণ ডেটাতে প্যাটার্ন দ্বারা আকৃতি হয়—এবং প্যাটার্নগুলি অনুকরণ করা যেতে পারে।
কাজের সম্প্রদায়ের আলোচনা, হ্যাকাডে দ্বারা হাইলাইট করা, একটি পুনরাবৃত্ত থিম উত্থাপন করেছে: সবচেয়ে পরিষ্কার সমাধানের জন্য শেখা, শৈলী-ভিত্তিক সংকেতের উপর নির্ভর না করে কাঠামোগতভাবে পৃথক পথের মাধ্যমে বিশ্বস্ত ইনপুটগুলি পরিচালনা করার জন্য মডেলগুলির প্রয়োজন হবে। এটি না হওয়া পর্যন্ত, প্রম্পট ইনজেকশন-স্টাইল আক্রমণের বিরুদ্ধে রক্ষা করা সম্ভবত একটি বিকশিত প্রক্রিয়া থেকে যাবে একটি সমাধান করা সমস্যার পরিবর্তে।
বিস্তৃত প্রভাব
দুর্বলতা পরীক্ষাগার প্রদর্শনের বাইরেও গুরুত্বপূর্ণ। যুক্তিযুক্ত মডেলগুলি এজেন্টিক সিস্টেমগুলিতে ক্রমবর্ধমানভাবে স্থাপন করা হচ্ছে যা ওয়েব ব্রাউজ করতে, কোড কার্যকর করতে এবং ব্যবহারকারীর পক্ষে পদক্ষেপ নিতে পারে। যদি একজন আক্রমণকারী একটি মডেলের অভ্যন্তরীণ সিদ্ধান্তে জাল করতে পারে, তাহলে তারা সেই ক্রিয়াগুলিকে অনিচ্ছাকৃত বা ক্ষতিকারক ফলাফলের দিকে নিয়ে যেতে সক্ষম হতে পারে। মডেলগুলি আরও স্বায়ত্তশাসন এবং সরঞ্জামগুলিতে অ্যাক্সেস পাওয়ার সাথে সাথে ঝুঁকি বৃদ্ধি পায়। গবেষকরা নোট করেছেন যে মানুষ চতুর এবং সৃজনশীল থাকে, এবং যতক্ষণ পর্যন্ত মডেলগুলিতে বিশ্বস্ত এবং অবিশ্বস্ত পাঠ্যের মধ্যে একটি পরিষ্কার স্থাপত্যগত বিচ্ছেদ নেই, দৃঢ়প্রতিজ্ঞ আক্রমণকারীরা লাইনটি অস্পষ্ট করার উপায় খুঁজে বের করতে থাকবে। কাগজটি প্যাচ করার জন্য একটি বাগ হিসাবে চ্যালেঞ্জটিকে কম এবং সিস্টেমের কাঠামোগত সম্পত্তি হিসাবে আরও বেশি করে যা হার্ড-কোডেড নিয়মের পরিবর্তে ডেটা থেকে তাদের আচরণ শেখে।
সম্পূর্ণ কাগজটি arXiv-এ উপলব্ধ, এবং গবেষকরা GitHub-এ কোডের উদাহরণ প্রকাশ করেছেন যাতে বিকাশকারীরা তাদের নিজস্ব সিস্টেমগুলি সংবেদনশীল কিনা তা পরীক্ষা করতে পারে।
এআই থেকে এগিয়ে থাকুন
AI নিরাপত্তা গবেষণা, নিরাপত্তা দুর্বলতা এবং বৃহৎ ভাষার মডেলের সীমানা সম্পর্কে আরও জানতে, AI Buzz Wire দেখুন।
আরও এআই খবর পড়ুন →


