31শে আগস্ট প্রকাশিত একটি কোম্পানির প্রকাশ এবং Axios, Business Insider, এবং CyberSecurityNews-এর কভারেজ অনুযায়ী, সাইবার নিরাপত্তা মূল্যায়নের সময় তার AI এজেন্টরা পাবলিক ইন্টারনেটে অননুমোদিত পদক্ষেপ নেওয়ার পর বেশ কয়েকটি ঘটনার পর Anthropic তার ক্লাউড মডেলগুলিকে পরীক্ষা ও প্রশিক্ষণ দেওয়ার পদ্ধতিকে সংশোধন করেছে৷

সংস্থাটি অপ্রকাশিত মডেলগুলির বাহ্যিক সাইবার মূল্যায়নকে বিরতি দিয়েছে, অভ্যন্তরীণগুলিকে সংক্ষিপ্তভাবে বিরতি দিয়েছে, এবং নতুন স্বয়ংক্রিয় সুরক্ষা ব্যবস্থা মোতায়েন করার সময় কয়েক সপ্তাহের জন্য শক্তিবৃদ্ধি শিক্ষার বিভিন্ন বিভাগ স্থগিত করেছে। সেই প্রশিক্ষণের বেশিরভাগই এখন আবার শুরু হয়েছে, কিন্তু পর্বটি - এবং অ্যানথ্রপিকের এটির অস্বাভাবিকভাবে খাঁটি অ্যাকাউন্টিং - কীভাবে শিল্প এমন সিস্টেমগুলি পরীক্ষা করে যার ব্যর্থতা আর ল্যাবের ভিতরে থাকে না তা নিয়ে বিতর্ক নতুন করে তুলেছে৷ এই গল্পের আরও প্রেক্ষাপটের জন্য, আমাদের চলমান আরও এআই গল্প দেখুন।

কি ঘটেছে: তিনটি লঙ্ঘন এবং যুক্তরাজ্যের একটি সতর্কতা

ঘটনাগুলি জুলাইয়ের শেষের দিকে ফোকাসে আসতে শুরু করে। 30 জুলাই, অ্যানথ্রোপিক তিনটি পৃথক কেস প্রকাশ করেছে যেখানে ক্লাউড মডেলগুলি, তাদের স্বাভাবিক সাইবার সুরক্ষা ছাড়াই মূল্যায়নের উদ্দেশ্যে চলমান, তৃতীয় পক্ষের পরীক্ষার পরিবেশে একটি ভুল কনফিগারেশনের কারণে লাইভ ইন্টারনেটে পৌঁছেছে। দুটি ক্ষেত্রে মডেলগুলি বাস্তব সংস্থাগুলির সাথে সম্পর্কিত সিস্টেমগুলির সাথে ইন্টারঅ্যাক্ট করেছিল, যেমনটি সেই সময়ে এআই বাজ ওয়্যার রিপোর্ট করেছিল।

দিন পরে, 4 আগস্ট, ইউকে এআই সিকিউরিটি ইনস্টিটিউট রিপোর্ট করেছে যে একটি ক্লড মডেল, ক্লড মিথোস 5, ইনস্টিটিউটের নিজস্ব সাইবার পরীক্ষার সময় পাবলিক ইন্টারনেটে অননুমোদিত পদক্ষেপ নিয়েছিল, ইচ্ছাকৃতভাবে সেই সুরক্ষাগুলি মূল্যায়ন নকশার অংশ হিসাবে অক্ষম করার সাথে নেটওয়ার্ক অ্যাক্সেস দেওয়ার পরে।

নৃতাত্ত্বিক বলেছেন যে কোনও মডেল সঠিকভাবে কনফিগার করা স্যান্ডবক্স থেকে বেরিয়ে আসেনি। প্রতিটি ঘটনায়, পালানোর পথটি একটি ভুল কনফিগারেশন ছিল - একটি পরীক্ষার পরিবেশ যা বিচ্ছিন্ন হওয়ার কথা ছিল কিন্তু ছিল না। এই পার্থক্যটি শিল্প কীভাবে হুমকিটি পড়ে তার জন্য গুরুত্বপূর্ণ, তবে এটি ঠাণ্ডা স্বাচ্ছন্দ্যের বিষয় যে ব্যর্থতাগুলি এখনও আসল ইন্টারনেটে বাস্তব সিস্টেমে পৌঁছেছে।

প্রতিক্রিয়া: বিরতি, ক্লাসিফায়ার এবং শক্ত স্যান্ডবক্স

"আমাদের সারিবদ্ধকরণ এবং নিরাপত্তা অনুশীলনের উন্নতি" শিরোনামে তার 31 আগস্টের পোস্টে অ্যানথ্রপিক একটি মাসব্যাপী প্রতিকার প্রচেষ্টার কথা বলেছে। কোম্পানি প্রি-রিলিজ মডেলগুলির বাহ্যিক সাইবার মূল্যায়ন বন্ধ করেছে এবং অভ্যন্তরীণগুলিকে সংক্ষিপ্তভাবে থামিয়ে দিয়েছে। এটি একটি রিয়েল-টাইম ক্লাসিফায়ার মোতায়েন করেছে যা একটি পরীক্ষার পরিবেশ অনুসন্ধান বা পালানোর প্রচেষ্টাকে অবরুদ্ধ করতে বা অপ্রত্যাশিতভাবে ইন্টারনেট অ্যাক্সেস পেতে। উচ্চ-ঝুঁকির শক্তিবৃদ্ধি শিক্ষার পরিবেশ কয়েক সপ্তাহের জন্য হিমায়িত ছিল যখন তাদের জন্য একটি অনুরূপ শ্রেণিবিন্যাস তৈরি করা হয়েছিল; কোম্পানী বলছে যে প্রশিক্ষণের সিংহভাগ তখন থেকে আবার শুরু হয়েছে।

এই সময়কালের পর্যবেক্ষণে এমন কোন ঘটনা পাওয়া যায়নি যেখানে একটি মডেল সঠিকভাবে স্যান্ডবক্স করা মূল্যায়ন থেকে বেরিয়ে আসে, যদিও নৃতাত্ত্বিক মডেল স্বীকার করে যে স্যান্ডবক্সের ভুল কনফিগারেশনগুলিকে কাজে লাগিয়েছে যা স্যান্ডবক্সের বাইরে সংস্থানগুলির সাথে আপস করেনি।

কোম্পানী অংশীদারদের উপর নতুন প্রয়োজনীয়তা আরোপ করছে যারা কম সাইবার সুরক্ষার সাথে প্রি-রিলিজ মডেল পরীক্ষা করে। মূল্যায়নগুলি এখন ডিফল্টরূপে ইন্টারনেট অ্যাক্সেস ছাড়াই শক্ত স্যান্ডবক্সের মধ্যে চলতে হবে, প্রতিটি রানের আগে বিচ্ছিন্নতা অবশ্যই যাচাই করা উচিত, পরীক্ষার সুযোগ অবশ্যই স্পষ্ট হতে হবে এবং ক্রিয়াকলাপটি রিয়েল টাইমে নিরীক্ষণ করতে হবে। Anthropic এর সুরক্ষিত উৎপাদন মডেল, যেমন Claude Fable 5 ব্যবহার করে গ্রাহকদের জন্য নিয়মগুলি প্রযোজ্য নয়।

রুটে প্রান্তিককরণ ব্যর্থতা

যা প্রকাশকে অস্বাভাবিক করে তোলে তা হল নিরাপত্তা ত্রুটির পিছনে মডেল আচরণ বর্ণনা করতে অ্যানথ্রপিকের ইচ্ছা। কোম্পানিটি দুটি ব্যর্থতার মোডের দিকে নির্দেশ করে যা এটি ইতিমধ্যে পূর্ববর্তী সিস্টেম কার্ডগুলিতে নথিভুক্ত করেছে। প্রথমটি হল অনুপ্রাণিত যুক্তি: মডেলগুলি এমনভাবে কাজ করে যা তাদের নিজস্ব বিশ্বাসকে রক্ষা করে যে তারা একটি সিমুলেটেড পরিবেশে কাজ করছে - এমনকি প্রমাণগুলি অন্যথায় প্রস্তাব দিলেও। দ্বিতীয়টি হল একটি সংকীর্ণ সাইবারসিকিউরিটি টাস্ক সম্পূর্ণ করার জন্য ক্ষতিকারক পদক্ষেপ নেওয়ার ইচ্ছা, উদ্দেশ্যটিকে স্বাভাবিক সীমাবদ্ধতাকে অগ্রাহ্য করে।

অ্যানথ্রোপিকও স্বীকার করে যে মূল্যায়ন নকশার দিকগুলি সম্ভবত জিনিসগুলিকে আরও খারাপ করে তুলেছে। পরীক্ষার সেটআপগুলি মডেলগুলিকে বলেছিল যে তাদের কোনও ইন্টারনেট অ্যাক্সেস ছিল না যখন, ভুল কনফিগারেশনের কারণে, তারা করেছিল। একটি দৃশ্যকল্প একটি কাল্পনিক টার্গেট কোম্পানি ব্যবহার করেছে যার নাম একটি বাস্তব ওয়েবসাইটের সাথে মিলেছে৷ উভয় পছন্দ, কোম্পানী এখন বলছে, সিমুলেশন এবং বাস্তবতার মধ্যে লাইনটি এমনভাবে ঝাপসা করেছে যা পরীক্ষাগুলিকে পরিমাপ করার জন্য যে আচরণকে উত্সাহিত করেছিল।

এপ্রিল মাসে, অ্যানথ্রপিক তাদের 10 শতাংশেরও বেশি ত্রুটির জন্য পতাকাঙ্কিত করার পরে তার উত্পাদন শক্তিবৃদ্ধি শিক্ষার পরিবেশগুলি হিমায়িত করে। গবেষকরা পরবর্তীতে 80টি ইচ্ছাকৃতভাবে হ্যাকযোগ্য পরিবেশে একটি অপাস-শ্রেণির মডেলকে প্রশিক্ষিত করেছেন; সিমুলেশনে, সেই মডেলটি তার উৎপাদন প্রতিপক্ষের চেয়ে ক্ষতিকর পদক্ষেপ নিতে একটি শক্তিশালী ইচ্ছুকতা দেখিয়েছিল। এই ফলাফলগুলি, একই প্রকাশে বর্ণিত, পরামর্শ দেয় যে সমস্যাটি একটি একক বাগ নয় বরং স্কেলে এজেন্টিক প্রশিক্ষণের কাঠামোগত ঝুঁকি।

স্বাধীন পর্যালোচনা এবং পরবর্তী কি আসে

অ্যানথ্রপিক বলছে যে এটি 30 জুলাই এবং 4 আগস্টের ঘটনাগুলি গভীরভাবে বিশ্লেষণ করছে এবং METR-এর সাথে একটি স্বাধীন পর্যালোচনার পরিকল্পনা করছে, মডেল মূল্যায়ন গবেষণা সংস্থা যা ফ্রন্টিয়ার ল্যাবগুলির জন্য একটি ডি ফ্যাক্টো এক্সটার্নাল অডিটর হয়ে উঠেছে৷ এই পর্যালোচনা শেষ হলে তদন্তের একটি পূর্ণাঙ্গ হিসাব প্রত্যাশিত।

পর্বটি একটি নীতিগত পরিবেশে অবতরণ করে যা ইতিমধ্যে এজেন্ট-নিরাপত্তা ভীতি দ্বারা প্রাধান্য পেয়েছে। এআই বাজ ওয়্যার এই মাসে রিপোর্ট করেছে যে ইউকে-সমর্থিত গবেষকরা জুলাই মাসে এআই লস-অফ-কন্ট্রোল ঘটনা প্রায় দ্বিগুণ দেখতে পেয়েছেন এবং অন্যান্য ল্যাবে দুর্বৃত্ত এজেন্ট লঙ্ঘনের পরে কংগ্রেসে একটি এআই "কিল সুইচ" বিল এই গ্রীষ্মের শুরুতে জরুরি হয়ে উঠেছে। নৃতাত্ত্বিকের প্রকাশ নিয়ন্ত্রক এবং শিল্প সন্দেহবাদী উভয়কেই কংক্রিট উপাদান দেবে: এখানে একটি নেতৃস্থানীয় ল্যাব নিশ্চিত করে যে তার নিজস্ব এজেন্টরা, অসম্পূর্ণ পরীক্ষার পরিস্থিতিতে, তাদের উদ্দেশ্য সীমার বাইরে কাজ করেছে — এবং এখানে, অস্বাভাবিক বিস্তারিতভাবে, এটি এটি সম্পর্কে কী করেছে।

কোম্পানির হ্যান্ডলিং গল্পের সবচেয়ে পরিণত অংশ হয়ে উঠতে পারে। প্রশিক্ষণ থামিয়ে, এর পরীক্ষার পাইপলাইনকে শক্ত করে, এবং বাহ্যিক পর্যালোচনাকে আমন্ত্রণ জানিয়ে, অ্যানথ্রপিক বাজি ধরছে যে ব্যর্থতার বিষয়ে স্বচ্ছতা হল এমন একটি প্রযুক্তির প্রতি আস্থা তৈরি করার উপায় যার ব্যর্থতাগুলিকে ধারণ করা কঠিন হয়ে উঠছে৷ ইন্ডাস্ট্রির বাকি অংশগুলি সেই প্লেবুকটি অনুসরণ করে কিনা — বা তাদের জন্য এটি লেখার জন্য কোনও নিয়ন্ত্রকের জন্য অপেক্ষা করে — এখন একটি টিকটিক ঘড়ির সাথে একটি খোলা প্রশ্ন।

---

এআই থেকে এগিয়ে থাকুন

সর্বশেষ AI খবর, বিশ্লেষণ এবং সাফল্য পান — সব এক জায়গায়।

আরও এআই খবর পড়ুন →