অ্যানথ্রোপিক গবেষণা প্রকাশ করেছে যে দেখায় যে স্বয়ংক্রিয় AI সিস্টেমগুলি নির্ভরযোগ্যভাবে একটি মডেলের প্রান্তিককরণ ব্যর্থতাগুলি মেরামত করতে পারে, যার ফলে AI শিল্পের কেন্দ্রে নিরাপত্তার কাজ কীভাবে সম্পন্ন হয় তা পুনর্নির্মাণ করতে পারে। "স্বয়ংক্রিয় গবেষকরা নির্ভরযোগ্যভাবে অ্যালাইনমেন্ট ব্যর্থতাগুলি প্রশমিত করতে পারে" শিরোনামের কাগজটি শুক্রবার প্রকাশিত হয়েছিল এবং টেকক্রাঞ্চ দ্বারা বিস্তারিত প্রকাশিত হয়েছিল।
গবেষণাটি অ্যানথ্রপিকের ফেলো প্রোগ্রাম থেকে বেরিয়ে আসে এবং চেন ইউয়েহ-হান এর নেতৃত্বে ছিলেন। এর কেন্দ্রীয় দাবিটি আকর্ষণীয়: যখন কোম্পানির স্বয়ংক্রিয় গবেষণা সিস্টেমগুলি নির্দিষ্ট ভুল-সংযুক্ত আচরণ পরিমাপের দশটি বেঞ্চমার্কের দিকে নির্দেশিত হয়েছিল, তখন তারা মডেলের সামগ্রিক ক্ষমতাকে অবনমিত না করেই - প্রতিটিতে কর্মক্ষমতা উন্নত করেছিল। এমন একটি ক্ষেত্রের জন্য যা মডেল স্কেলের সাথে ধাপে ধাপে সুরক্ষা কাজ রাখতে লড়াই করেছে, এটি একটি উল্লেখযোগ্য ফলাফল। For more context on this story, see our ongoing latest AI developments.
গল্পটি AI নিরাপত্তা কভারেজের জন্য একটি ব্যস্ত প্রসারিত সময়ে অবতরণ করেছে। এটি একটি গ্রীষ্মের অনুসরণ করে যেখানে এজেন্টিক দুর্ব্যবহার শিরোনামগুলিতে প্রাধান্য পেয়েছে, পুরস্কার-হ্যাকিং এজেন্টদের উপর OpenAI-এর অভ্যন্তরীণ রিপোর্ট থেকে শুরু করে Hugging Face লঙ্ঘনের স্বাধীন তদন্তের আহ্বান। অ্যানথ্রোপিকের নতুন কাগজটি বিপরীত দিক থেকে সমস্যাটির দিকে এগিয়ে যায়: এজেন্টরা কীভাবে দুর্ব্যবহার করে তা জিজ্ঞাসা করার পরিবর্তে, এটি তাদের সমাধান করার জন্য অন্যান্য এজেন্টদের বিশ্বাস করা যেতে পারে কিনা তা জিজ্ঞাসা করে।
পেপার আসলে কি রিপোর্ট করে
কাগজে বর্ণিত সিস্টেমটিকে একটি স্বয়ংক্রিয় প্রান্তিককরণ গবেষক বা AAR বলা হয়। গবেষণা প্রক্রিয়াটি প্রতিস্থাপন করার পরিবর্তে, AAR এটির বেশিরভাগ প্রতিলিপি করে: প্রতিটি স্বয়ংক্রিয় সিস্টেম উপলব্ধ সাহিত্য অনুসন্ধান করে, একটি পদ্ধতি প্রস্তাব করে এবং প্রায় 30 মিনিটের জন্য সেই পদ্ধতিটি ব্যবহার করে মডেলটিকে প্রশিক্ষণ দেয়। প্রক্রিয়া তারপর বিভিন্ন পুনরাবৃত্তি জুড়ে পুনরাবৃত্তি.
নির্বাচন প্রক্রিয়া সহজ. বেঞ্চমার্ক সরানো পদ্ধতি সংরক্ষিত হয়; যে পদ্ধতিগুলি বাতিল করা হয় না। এই লুপটি সিস্টেমটিকে দ্রুত কাজ করতে দেয় এবং এমন একটি স্কেলে কোনো মানব দল মিলতে পারে না, সমান্তরালভাবে অনেক গবেষণার দিক পরীক্ষা করে এবং শুধুমাত্র যা কাজ করে তা রাখে।
কাগজ অনুসারে, ফলাফল বোর্ড জুড়ে সামঞ্জস্যপূর্ণ ছিল। নির্দিষ্ট ভুল-সংযুক্ত আচরণগুলিকে কভার করে সমস্ত দশটি বেঞ্চমার্কে, স্বয়ংক্রিয় সিস্টেমগুলি সামগ্রিক মডেলের কার্যকারিতাকে ক্ষতিগ্রস্থ না করে পরিমাপযোগ্য উন্নতি তৈরি করেছে - সাধারণ ট্রেড-অফ যা প্রান্তিককরণের কাজকে কঠিন করে তোলে।
"সামগ্রিকভাবে, এই ফলাফলগুলি প্রাথমিক প্রমাণ প্রদান করে যে স্বয়ংক্রিয় প্রান্তিককরণ পোস্ট-প্রশিক্ষণ কাছাকাছি মেয়াদে ব্যবহারিক হয়ে উঠতে পারে," কাগজটি বলে।
মানুষের মারধর, 1/37তম মূল্যে
কাগজে সবচেয়ে উদ্ধৃত প্যাসেজগুলি হল যেখানে এটি AAR কে সরাসরি তার মানব প্রতিরূপের সাথে তুলনা করে। নৃতাত্ত্বিক তুলনা হেজ না.
"সর্বোত্তম AAR পদ্ধতিটি গড়ে ছয় ঘন্টার মধ্যে অভিজ্ঞ মানুষেরা যা প্রস্তাব করে তা ছাড়িয়ে যায়," কাগজটি পড়ে। এটি স্পষ্টভাবে যোগ করে যে "মানব নির্দেশিত গবেষণা নির্দেশাবলী শক্তিশালী কর্মক্ষমতার দিকে পরিচালিত করে না।"
অর্থনীতি যেমন ভোঁতা। লেখকরা লিখেছেন, "একটি AAR প্রতি ঘন্টায় প্রায় $4 খরচ করে API অনুমানে প্রতি ঘন্টায় $150 এর বিপরীতে আমরা আমাদের মানব গবেষকদের প্রদান করি।" এটি প্রায় 40 গুণের ব্যয়ের পার্থক্য, এবং এটি ব্যাখ্যা করে যে কেন ল্যাবগুলি একটি কৌতূহলের চেয়ে বেশি স্বয়ংক্রিয় গবেষণাকে গুরুত্ব সহকারে নিচ্ছে।
কেন খরচের ব্যবধান গুরুত্বপূর্ণ
সারিবদ্ধকরণ গবেষণা এমনভাবে ব্যয়বহুল যা অবমূল্যায়ন করা সহজ। প্রতিটি প্রার্থীর হস্তক্ষেপ বাস্তবায়ন, প্রশিক্ষিত এবং মানদণ্ডের বিরুদ্ধে মূল্যায়ন করতে হবে এবং বেশিরভাগ প্রার্থী ব্যর্থ হয়। যদি একটি সিস্টেম এপিআই কলের মূল্যের জন্য সেই অনুসন্ধান লুপটি ক্রমাগত চালাতে পারে, তবে আরও একটি ধারণা চেষ্টা করার প্রান্তিক খরচ শূন্যের কাছাকাছি পৌঁছে যায়। সীমাবদ্ধতা হেডকাউন্ট থেকে গণনায় স্থানান্তরিত হয়।
সীমাবদ্ধতা নৃতাত্ত্বিক নিজেই পতাকাঙ্কিত
ফলাফল কি প্রতিষ্ঠা করে না সে সম্পর্কে কাগজটি অকপট। স্বয়ংক্রিয় ব্যবস্থা কেবলমাত্র এতদূরে কাজ করে কারণ বেঞ্চমার্কগুলি প্রকৃতপক্ষে গুরুত্বপূর্ণ সারিবদ্ধ লক্ষ্যগুলিকে প্রতিফলিত করে — এবং বাস্তব-বিশ্বের দুর্ব্যবহারকে ক্যাপচার করে এমন বেঞ্চমার্কগুলি তৈরি এবং বজায় রাখা এই ক্ষেত্রে একটি উন্মুক্ত সমস্যা হিসাবে রয়ে গেছে।
এছাড়াও একটি নির্ভরতা রয়েছে যা মিস করা সহজ: স্বয়ংক্রিয় গবেষকরা পদ্ধতির একটি বিদ্যমান সাহিত্যের উপর আঁকেন। সেই সাহিত্য বজায় রাখা এবং সম্প্রসারণ করা নিজেই একটি গুরুত্বপূর্ণ কাজ, এবং এমন একটি সিস্টেম যা শুধুমাত্র পরিচিত কৌশলগুলিকে রিমিক্স করে এমন একটি সিলিংকে আঘাত করতে পারে যা মানুষের সৃজনশীলতা করবে না।
এই সতর্কতাগুলি গুরুত্বপূর্ণ কারণ গবেষণার দীর্ঘমেয়াদী তাত্পর্য তাদের উপর নির্ভর করে। যদি বেঞ্চমার্কগুলি ভুল জিনিসগুলি পরিমাপ করে, তাহলে একটি AAR শক্তিশালী সংখ্যায় তার পথকে অপ্টিমাইজ করতে পারে যখন অন্তর্নিহিত ঝুঁকিগুলি অস্পর্শ্য থাকে। নৃতাত্ত্বিক এর কাঠামো - "প্রাথমিক প্রমাণ," একটি সমাধান নয় - সেই অনিশ্চয়তাকে প্রতিফলিত করে।
পুনরাবৃত্ত স্ব-উন্নতির দিকে একটি পদক্ষেপ
কাগজটি পুনরাবৃত্ত স্ব-উন্নতি সম্পর্কে একটি বৃহত্তর বিতর্ককেও ফিড করে, এই ধারণা যে এআই সিস্টেমগুলি শেষ পর্যন্ত খুব প্রশিক্ষণের প্রক্রিয়াগুলিকে উন্নত করতে পারে যা তাদের উত্পাদন করে। অন্যান্য এআই মডেলের সাথে এআই মডেলের প্রশিক্ষণ ফ্রন্টিয়ার ল্যাবগুলির জন্য একটি জনপ্রিয় লক্ষ্য হয়ে উঠেছে এবং অ্যানথ্রপিকের ফলাফলটি একটি সংকীর্ণ ডোমেনে কেমন দেখায় তা একটি প্রাথমিক, কংক্রিট চেহারা।
যুক্তিটা সোজা। যদি মডেলগুলি তাদের নিজস্ব সারিবদ্ধকরণ প্রশিক্ষণকে নির্ভরযোগ্যভাবে উন্নত করতে পারে, তবে একই যন্ত্রপাতি আরও বিস্তৃতভাবে প্রশিক্ষণ অনুশীলনের দিকে নির্দেশ করা যেতে পারে — সক্ষমতার কাজ অন্তর্ভুক্ত। টেকক্রাঞ্চ উল্লেখ করেছে যে মানব এআই গবেষকরা শেষ পর্যন্ত প্রক্রিয়াটির কম কেন্দ্রীয় হয়ে উঠতে পারে, এমন একটি সম্ভাবনা যা কাগজটি এড়ানোর পরিবর্তে এর সাথে জড়িত।
পরবর্তী কি দেখতে হবে
তিনটি প্রশ্ন এই ফলাফল সাধারণীকরণ কিনা তা নির্ধারণ করবে। প্রথমত, অ্যানথ্রপিক পরীক্ষা করা দশটি বেঞ্চমার্কের বাইরে পদ্ধতিটি ধারণ করে কিনা, ব্যর্থতার মোডগুলির উপর যা অগোছালো এবং কম ভাল-সংজ্ঞায়িত। দ্বিতীয়ত, স্বয়ংক্রিয় গবেষণাকে সৎ রাখার জন্য বেঞ্চমার্ক-রক্ষণাবেক্ষণ সমস্যাটি যথেষ্ট দ্রুত সমাধান করা যেতে পারে কিনা। তৃতীয়ত, অন্যান্য ল্যাবগুলি তুলনামূলক ফলাফল প্রকাশ করে কিনা, যা একটি একক কাগজকে শিল্পের দিকে পরিণত করবে।
আপাতত, অনুসন্ধানটি সংকীর্ণ কিন্তু বাস্তব: অ্যানথ্রোপিক পরীক্ষিত নির্দিষ্ট প্রান্তিককরণের কাজগুলিতে, স্বয়ংক্রিয় গবেষকরা অভিজ্ঞ মানুষের চেয়ে দ্রুত এবং অনেক সস্তা। এআই শিল্পের নিরাপত্তার দিকটি প্রথম স্থান হতে পারে যেখানে এআই গবেষকরা - মানুষ নয় - বেশিরভাগ কাজ করে।
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →
