গবেষকরা যুক্তিযুক্ত AI মডেলগুলির বিরুদ্ধে একটি শক্তিশালী নতুন আক্রমণ প্রদর্শন করেছেন যা একটি মৌলিক অন্ধ স্থানকে কাজে লাগায় যে কীভাবে বড় ভাষা মডেলগুলি (LLMs) ডেটা থেকে নির্দেশাবলীকে আলাদা করে। চেইন-অফ-থট (CoT) ফোরজি নামক কৌশলটি একটি মডেলকে আক্রমণকারী দ্বারা সরবরাহ করা পাঠ্যকে এমনভাবে ব্যবহার করে যেন এটি মডেলের নিজস্ব ব্যক্তিগত অভ্যন্তরীণ যুক্তি, পাঠ্যটিকে বৈধ নির্দেশাবলীকে ওভাররাইড করার অনুমতি দেয়।

হ্যাকাডে দ্বারা রিপোর্ট করা ফলাফলগুলি নির্দেশ করে যে কেন ম্যানিপুলেশনের বিরুদ্ধে এআই সিস্টেমগুলি সুরক্ষিত করা একটি অমীমাংসিত সমস্যা রয়ে গেছে। ক্ষেত্রের উদীয়মান হুমকির সাথে তাল মিলিয়ে চলতে, চলমান বিশ্লেষণের জন্য আমাদের AI শিল্প কভারেজ অনুসরণ করুন।

মূল কারণ: ভূমিকা বিভ্রান্তি

দুর্বলতার কেন্দ্রবিন্দুতে গবেষকরা "ভূমিকা বিভ্রান্তি" হিসাবে বর্ণনা করেছেন। আধুনিক এলএলএমগুলি তাদের সমস্ত ইনপুট-সিস্টেম নিয়ম, ব্যবহারকারীর অনুরোধ এবং মডেলের নিজস্ব চেইন-অফ-থট যুক্তি-একটি পাঠ্য চ্যানেলের মাধ্যমে গ্রহণ করে। অর্ডার আরোপ করতে, ডেভেলপাররা বিশ্বাসের একটি অনুক্রম তৈরি করতে ``, ``, এবং ``-এর মতো মেটাডেটা ট্যাগ ব্যবহার করে। একটি `` ক্ষতিকারক বিষয়বস্তু এড়াতে নির্দেশনা, উদাহরণস্বরূপ, বিপরীতে একটি `` অনুরোধকে ওভাররাইড করার কথা।

`` ট্যাগটি বিশেষভাবে শক্তিশালী কারণ এটি মডেলের অভ্যন্তরীণ যুক্তি প্রক্রিয়ার প্রতিনিধিত্ব করে, একটি স্ট্রীম যা উচ্চ বিশ্বাস বহন করে। গবেষকরা যে সমস্যাটি খুঁজে পেয়েছেন তা হল যে মডেলগুলি কী বিশ্বাস করতে হবে তা নির্ধারণ করতে প্রাথমিকভাবে ট্যাগগুলির উপর নির্ভর করে না। তারা লেখার ধরনকে প্রাধান্য দেয়। একটি মডেলের অভ্যন্তরীণ `` আউটপুট অনুরূপ শৈলীগতভাবে ফর্ম্যাট করা পাঠ্য প্রকৃত যুক্তির জন্য ভুল হতে পারে, তা আসলে কোথা থেকে এসেছে তা নির্বিশেষে।

কিভাবে আক্রমণ কাজ করে

গুরুত্বপূর্ণভাবে, CoT জালিয়াতি শুধুমাত্র `` ট্যাগের মধ্যে একটি ক্ষতিকারক প্রম্পট মোড়ানোর বিষয় নয়, যা বেশিরভাগ মডেল প্রত্যাখ্যান করবে। পরিবর্তে, আক্রমণকারী এমন একটি শৈলীতে জটিল যুক্তি লেখে যা মডেলের নিজস্ব স্বতন্ত্র অভ্যন্তরীণ যুক্তি কণ্ঠের সাথে ঘনিষ্ঠভাবে মেলে। মডেলটি যখন এই পাঠ্যের মুখোমুখি হয়, তখন এটি প্রতারণামূলক যুক্তিকে ইতিমধ্যেই উপনীত উপসংহার হিসাবে বিবেচনা করে।

হ্যাকাডে-এর মতে, এর ফলে এলএলএম স্বচ্ছভাবে অযৌক্তিক যুক্তিকে পূর্ববর্তী উপসংহার হিসাবে গ্রহণ করে, ব্যবহারকারীর অনুরোধে তার প্রতিক্রিয়া পরিবর্তন করে। কারণ স্পুফ করা বিষয়বস্তু কম-বিশ্বাসের ব্যবহারকারীর ইনপুটের পরিবর্তে উচ্চ-বিশ্বাসের অভ্যন্তরীণ চিন্তা হিসাবে বিবেচিত হয়, এটি নিরাপত্তার গার্ডেলগুলিকে বাইপাস করতে পারে যা সাধারণত ম্যানিপুলটিভ নির্দেশাবলীকে ব্লক করে।

একটি এলএলএম-এর ভিতরে ট্রাস্টের শ্রেণিবিন্যাস

কেন আক্রমণ সফল হয় তা বোঝার জন্য ভূমিকাগুলি কীভাবে কাজ করে তা বোঝা প্রয়োজন। হুডের নীচে, ভূমিকাগুলি মডেলের ইনপুটকে একটি সংগঠিত শ্রেণিবিন্যাসে ভাগ করে। একটি ভূমিকার নির্দেশাবলী অনুসরণ করা হয় যতক্ষণ না তারা উচ্চ-অগ্রাধিকারের সাথে বিরোধ না করে। উদাহরণস্বরূপ, "অবৈধ কার্যকলাপ নিয়ে আলোচনা করবেন না" এর একটি সিস্টেম-স্তরের নির্দেশ, একটি নিষিদ্ধ রেসিপি প্রদানের জন্য একটি ব্যবহারকারীর অনুরোধকে অগ্রাহ্য করা। `` ভূমিকাটি সেই অনুক্রমের শীর্ষের কাছাকাছি বসে কারণ এটি এমন উপসংহার উপস্থাপন করে যে মডেলটি বিশ্বাস করে যে এটি ইতিমধ্যেই নিজের উপর পৌঁছেছে।

ব্রেকডাউন ঘটে কারণ মডেলটি যান্ত্রিকভাবে সেই অনুক্রমটি প্রয়োগ করে না। পরিবর্তে, এটি আংশিকভাবে শৈলীগত সংকেত থেকে কোন পাঠ্যটি কোন ভূমিকার অন্তর্গত তা অনুমান করে। গবেষণার সম্প্রদায়ের আলোচনা হিসাবে উল্লেখ করা হয়েছে, যদি পাঠ্যটি চিন্তার প্রেক্ষাপটের মতো প্যাটার্ন করা হয়, তাহলে মডেলটি প্রকৃত যুক্তির জন্য অনুরূপ কাঠামোর সাথে যেকোন পাঠ্যকে ভুল করতে পারে-এবং চিন্তার পাঠ্য সাধারণ ব্যবহারকারী পাঠ্যের চেয়ে উচ্চতর অগ্রাধিকার বহন করে।

একটি নতুন টুইস্ট সহ একটি পরিচিত প্যাটার্ন

গবেষণাটি এআই সিস্টেমে দীর্ঘ-স্বীকৃত দুর্বলতার উপর তৈরি করে: প্রম্পট ইনজেকশন। প্রারম্ভিক আক্রমণগুলি এই সত্যকে কাজে লাগিয়েছিল যে LLM-তে নির্দেশাবলী এবং ডেটার জন্য কোনও পৃথক স্ট্রিম নেই, তাই "পূর্ববর্তী সমস্ত নির্দেশাবলী উপেক্ষা করুন" এর মতো একটি বাক্যাংশ কখনও কখনও একটি মডেলের আচরণকে হাইজ্যাক করতে পারে। ভূমিকা এবং মেটাডেটা ট্যাগগুলির প্রবর্তনের উদ্দেশ্য ছিল একটি বিশ্বস্ত শ্রেণিবিন্যাস তৈরি করে এটি প্রশমিত করা।

CoT জালিয়াতি দেখায় যে প্রশমন অসম্পূর্ণ। যতক্ষণ পর্যন্ত মডেলগুলি তার কাঠামোগত মেটাডেটা দ্বারা কঠোরভাবে না হয়ে আংশিকভাবে তার শৈলীগত বৈশিষ্ট্যগুলির দ্বারা পাঠ্যের বিশ্বাসযোগ্যতা বিচার করে, আক্রমণকারীরা যারা সঠিক শৈলীর অনুকরণ করতে পারে তারা তাদের ইনপুটের অনুভূত কর্তৃত্বকে বাড়িয়ে তুলতে পারে।

কেন এটা ঠিক করা কঠিন

গবেষক, চার্লস ইয়ে, জেসমিন কুই এবং ডিলান হ্যাডফিল্ড-মেনল যুক্তি দেন যে LLM-তে ভূমিকা উপলব্ধি একটি বাইনারি সম্পত্তি নয় যা পরিষ্কারভাবে প্রয়োগ করা যেতে পারে। মডেলরা হার্ড-কোডেড নিয়মের পরিবর্তে প্রশিক্ষণের মাধ্যমে ট্যাগগুলিকে ব্যাখ্যা করতে শেখে, যার অর্থ তাদের আচরণ ডেটাতে প্যাটার্ন দ্বারা আকৃতি হয়—এবং প্যাটার্নগুলি অনুকরণ করা যেতে পারে।

কাজের সম্প্রদায়ের আলোচনা, হ্যাকাডে দ্বারা হাইলাইট করা, একটি পুনরাবৃত্ত থিম উত্থাপন করেছে: সবচেয়ে পরিষ্কার সমাধানের জন্য শেখা, শৈলী-ভিত্তিক সংকেতের উপর নির্ভর না করে কাঠামোগতভাবে পৃথক পথের মাধ্যমে বিশ্বস্ত ইনপুটগুলি পরিচালনা করার জন্য মডেলগুলির প্রয়োজন হবে। এটি না হওয়া পর্যন্ত, প্রম্পট ইনজেকশন-স্টাইল আক্রমণের বিরুদ্ধে রক্ষা করা সম্ভবত একটি বিকশিত প্রক্রিয়া থেকে যাবে একটি সমাধান করা সমস্যার পরিবর্তে।

বিস্তৃত প্রভাব

দুর্বলতা পরীক্ষাগার প্রদর্শনের বাইরেও গুরুত্বপূর্ণ। যুক্তিযুক্ত মডেলগুলি এজেন্টিক সিস্টেমগুলিতে ক্রমবর্ধমানভাবে স্থাপন করা হচ্ছে যা ওয়েব ব্রাউজ করতে, কোড কার্যকর করতে এবং ব্যবহারকারীর পক্ষে পদক্ষেপ নিতে পারে। যদি একজন আক্রমণকারী একটি মডেলের অভ্যন্তরীণ সিদ্ধান্তে জাল করতে পারে, তাহলে তারা সেই ক্রিয়াগুলিকে অনিচ্ছাকৃত বা ক্ষতিকারক ফলাফলের দিকে নিয়ে যেতে সক্ষম হতে পারে। মডেলগুলি আরও স্বায়ত্তশাসন এবং সরঞ্জামগুলিতে অ্যাক্সেস পাওয়ার সাথে সাথে ঝুঁকি বৃদ্ধি পায়। গবেষকরা নোট করেছেন যে মানুষ চতুর এবং সৃজনশীল থাকে, এবং যতক্ষণ পর্যন্ত মডেলগুলিতে বিশ্বস্ত এবং অবিশ্বস্ত পাঠ্যের মধ্যে একটি পরিষ্কার স্থাপত্যগত বিচ্ছেদ নেই, দৃঢ়প্রতিজ্ঞ আক্রমণকারীরা লাইনটি অস্পষ্ট করার উপায় খুঁজে বের করতে থাকবে। কাগজটি প্যাচ করার জন্য একটি বাগ হিসাবে চ্যালেঞ্জটিকে কম এবং সিস্টেমের কাঠামোগত সম্পত্তি হিসাবে আরও বেশি করে যা হার্ড-কোডেড নিয়মের পরিবর্তে ডেটা থেকে তাদের আচরণ শেখে।

সম্পূর্ণ কাগজটি arXiv-এ উপলব্ধ, এবং গবেষকরা GitHub-এ কোডের উদাহরণ প্রকাশ করেছেন যাতে বিকাশকারীরা তাদের নিজস্ব সিস্টেমগুলি সংবেদনশীল কিনা তা পরীক্ষা করতে পারে।

এআই থেকে এগিয়ে থাকুন

AI নিরাপত্তা গবেষণা, নিরাপত্তা দুর্বলতা এবং বৃহৎ ভাষার মডেলের সীমানা সম্পর্কে আরও জানতে, AI Buzz Wire দেখুন।

আরও এআই খবর পড়ুন →