মেটা, ইউনিভার্সিটি অফ অক্সফোর্ড এবং ইউনিভার্সিটি কলেজ লন্ডন-এ FAIR-এর একটি গবেষণা দল AI রিসার্চ প্রেফারেন্স মডেল (RPMs) চালু করেছে, একটি স্বায়ত্তশাসিত গবেষণা এজেন্টের আসলে কোন মেশিন লার্নিং পরীক্ষা চালানো উচিত তা নির্ধারণ করার একটি পদ্ধতি। একটি পরীক্ষা কীভাবে স্কোর করবে তা ভবিষ্যদ্বাণী করার পরিবর্তে, একটি RPM অকার্যকর প্রার্থীদের র্যাঙ্ক করে এবং সবচেয়ে প্রতিশ্রুতিশীল একটিকে বেছে নেয়, একটি শিফট বলে যে দলটি AI-চালিত গবেষণার আসল বাধার সমাধান করে: কাজের বিষয়ে MarkTechPost-এর প্রতিবেদন অনুসারে যাচাইকরণ গণনা৷
ধারণাটি এমন এক মুহুর্তে আসে যখন গবেষণা এজেন্টরা ইতিমধ্যে তাদের নিজস্ব পরীক্ষা-নিরীক্ষার প্রস্তাব, বাস্তবায়ন এবং স্কোর করতে পারে। ধারণা প্রজন্ম সস্তা; মৃত্যুদন্ড না. একজন একক প্রার্থীকে প্রশিক্ষণ দেওয়ার জন্য ঘন্টা থেকে কয়েক দিন পর্যন্ত GPU সময় ব্যয় করতে পারে, তাই একজন এজেন্ট অনিবার্যভাবে চালানোর সামর্থ্যের চেয়ে অনেক বেশি পরীক্ষা-নিরীক্ষার প্রস্তাব করে। কোন প্রার্থীদের মৃত্যুদন্ড কার্যকর করা হয়, যেহেতু দল এটিকে ফ্রেম করে, গবেষণার অগ্রগতির আসল লিভার। ল্যাবগুলির জন্য তাদের কম্পিউট বিল আরোহণ দেখে, সেই ফ্রেমিংটি ঠিক কেন এই কাজটি গবেষণা অটোমেশনের সাম্প্রতিকতম AI উন্নয়ন জুড়ে মনোযোগ আকর্ষণ করছে৷
কেন পরীক্ষা নির্বাচন বাধাগ্রস্ত হয়
দলটি খুঁজে পেয়েছে যে ভাষার মডেলগুলি পরম মেট্রিক্স বা কার্যকরী ফলাফলের পূর্বাভাস দেওয়ার ক্ষেত্রে অবিশ্বস্ত। একটি মডেল প্রার্থীর পরীক্ষার দিকে তাকাতে পারে না এবং এটি যে স্কোর অর্জন করবে তা সঠিকভাবে ভবিষ্যদ্বাণী করতে পারে না। এটি কী করতে পারে, গবেষকরা খুঁজে পেয়েছেন, বিচার করা হয় দুই প্রার্থীর মধ্যে কোনটি ভাল বাজি - একটি পরম ভবিষ্যদ্বাণীর পরিবর্তে একটি আপেক্ষিক তুলনা৷ RPMগুলি সম্পূর্ণরূপে সেই পার্থক্যকে ঘিরে তৈরি করা হয়েছে: তারা কখনই একটি স্কোরের পূর্বাভাস দেয় না, তারা শুধুমাত্র র্যাঙ্ক করে।
সিস্টেমটি AIRA-dojo-এর ভিতরে চলে, একটি ওপেন-সোর্স বিবর্তনীয় ট্রি সার্চ স্ক্যাফোল্ড যা লোভী অভিভাবক নির্বাচন এবং খসড়া, উন্নতি এবং ডিবাগ অপারেটরদের মাধ্যমে মেশিন লার্নিং পরীক্ষাগুলি তৈরি করে, শেষে সর্বোচ্চ-বৈধকরণ-স্কোর নোড ফিরিয়ে দেয়। বেঞ্চমার্ক, এআইআরএস-বেঞ্চও ওপেন সোর্স। স্ক্যাফোল্ড এবং পছন্দের মডেল উভয়ই তাদের মেরুদণ্ড হিসাবে Qwen3.6-27B ব্যবহার করে, যা টিম নোট করেছে খোলা ওজন।
নকআউট টুর্নামেন্ট কিভাবে কাজ করে
একটি চাইল্ড এক্সপেরিমেন্ট তৈরি করে তা কার্যকর করার পরিবর্তে, এজেন্ট একটি অপারেটরকে 15 বার সমান্তরালভাবে প্রয়োগ করে 15টি অকার্যকর প্রার্থী তৈরি করতে। RPM তারপর একটি নকআউট টুর্নামেন্টে তাদের জোড়ায় তুলনা করে, এবং শুধুমাত্র বিজয়ীকে কার্যকর করা হয়। প্রতিটি তুলনা অন্বেষণ করা গাছের একটি প্রশস্ত-প্রথম হাঁটার দ্বারা সংগৃহীত প্রসঙ্গ নোডগুলিতে ভিত্তি করে, প্রতিটি প্রার্থীকে তার পূর্বপুরুষদের বৈধতা স্কোরের পাশাপাশি দেখানো হয়, তাই বিচারক শূন্যতার পরিবর্তে এজেন্টের প্রকৃত অনুসন্ধানের ইতিহাস থেকে কারণগুলি দেখান।
কাগজটি বিভিন্ন গণনা বাজেটের সাথে দুটি রূপ বর্ণনা করে:
- অনুমান-শুধুমাত্র RPM — একজন বিচারক হিসেবে এলএলএম যা প্রার্থীর পরিকল্পনা, কোড এবং অনুসন্ধানের ইতিহাসকে একক পাসে তুলনা করে। এর প্রম্পটটি DSPy ফ্রেমওয়ার্ক থেকে MIPROv2 এর সাথে অপ্টিমাইজ করা হয়েছিল এবং দলটি যাকে একটি প্রধান-তদন্তকারী রুব্রিক বলে তার উপর একত্রিত হয়েছিল: এটি সংশোধনযোগ্য বাগগুলি সহ্য করে, পুরষ্কার প্রসারণযোগ্যতা এবং অপ্রয়োজনীয় গবেষণা নির্দেশাবলীকে শাস্তি দেয়। অফলাইন তুলনা নির্ভুলতা 57.7 থেকে 59.0 শতাংশ পরিমাপ করা হয়েছে।
- এজেন্টিক RPM — একই বিচারক এবং একটি স্যান্ডবক্স যা এজেন্টের পরিবেশকে ক্লোন করে, একটি একক H200 GPU সহ, টুলগুলি পাইথন, ব্যাশ এবং একটি জমা-সমাধান অ্যাকশনের মধ্যে সীমাবদ্ধ। এটি ছোট আকারের পাইলট পরীক্ষা চালায়, তারপর একটি প্রতিক্রিয়া মডেল হয় সবচেয়ে তথ্যপূর্ণ পরবর্তী পরীক্ষার প্রস্তাব দেয় বা লুপ শেষ করে। পাইলটদের 60-সেকেন্ডের থ্রেশহোল্ডের সাথে 30-এ সীমাবদ্ধ করা হয়, এবং অবশিষ্ট সময়ের বাজেট ইচ্ছাকৃতভাবে অতিবৃদ্ধি করা হয় — প্রকৃত 300-এর বিপরীতে 2,700 সেকেন্ড রিপোর্ট করা হয় — তাই এজেন্ট তাড়াতাড়ি অপ্টিমাইজ করা বন্ধ করে না।
একজন বিচারক একজন প্রধান তদন্তকারীর মতো সুর করেছেন
প্রিন্সিপ্যাল-ইনভেস্টিগেটর ফ্রেমিং হল শান্তভাবে আকর্ষণীয় অংশ। সর্বাধিক চিত্তাকর্ষক দেখায় এমন প্রার্থীদের পুরস্কৃত করার পরিবর্তে, অপ্টিমাইজ করা রুব্রিক কীভাবে একজন অভিজ্ঞ গবেষক ধারনাগুলিকে ট্রাইজ করে তা প্রতিফলিত করে: বগি কোড যা ফিক্সড করা যায় বিট পলিশড কোড একটি ডেড এন্ড অনুসরণ করে, এবং যে দিকনির্দেশগুলি বিদ্যমান গাছের নকল করে সেগুলি উপন্যাসের চেয়ে কম মূল্যবান। সেই রুব্রিক, হ্যান্ড-টিউনিংয়ের পরিবর্তে প্রম্পট অপ্টিমাইজেশনের মাধ্যমে শেখা, এটিই উন্নতি বহন করে, দলের অ্যাবলেশনগুলি পরামর্শ দেয়।
AIRS-বেঞ্চে বেঞ্চমার্ক ফলাফল
মূল্যায়ন 20টি পাবলিক টেক্সট এবং টেবুলার টাস্ক কভার করে, প্রতিটি টাস্ক একটি একক H200 এবং 10টি এলোমেলো বীজে 24 ঘন্টা দেওয়া হয়। গুরুত্বপূর্ণভাবে, একই Qwen3.6-27B ব্যাকবোন পরীক্ষা অপারেটর এবং পছন্দ মডেল উভয়কেই চালিত করে, তাই লাভগুলি একটি শক্তিশালী বিচারক মডেলের পরিবর্তে নির্বাচন স্তর থেকে আসে। গড় স্বাভাবিক স্কোর:
- কোন RPM (র্যান্ডম পিক): 0.684
- শুধুমাত্র অনুমান RPM: 0.711
- এজেন্টিক RPM: 0.729
- বৈধকরণ ওরাকল (সিলিং): 0.748
- টেস্ট ওরাকল (সিলিং): 0.759
এলোমেলো নির্বাচনের উপর উন্নতির সম্ভাবনা ছিল 0.5923 শুধুমাত্র অনুমান-ভেরিয়েন্টের জন্য এবং 0.5913 এজেন্টের জন্য, 95 শতাংশ আত্মবিশ্বাসের ব্যবধান 0.5066 এবং 0.5018-এর নিম্ন সীমার সাথে - পরিসংখ্যানগত জন্য 0.5 থ্রেশহোল্ডের উপরে, যদিও দলের তাত্পর্যের তুলনায় সীমার চেয়ে বেশি মার্জিন হতে পারে। রূপান্তরকারী
দক্ষতা হল আরো বাস্তব ফলাফল। অনুমান-শুধুমাত্র RPM 14.88 ঘন্টার মধ্যে 0.684 এর র্যান্ডম বেসলাইনের চূড়ান্ত স্কোরে পৌঁছেছে, একটি 1.61x গতি, যখন এজেন্টিক ভেরিয়েন্টের প্রয়োজন 15.50 ঘন্টা, একটি 1.55x গতি। এমনকি স্ব-হোস্টেড বিচারকের অনুমানের ওভারহেডের জন্য অ্যাকাউন্টিং, সামঞ্জস্যপূর্ণ সংখ্যাগুলি অনুকূল ছিল।
খোলা ওজন এবং সৎ সতর্কতা
দলটি আগেই বলেছে যে RPMগুলি আজকে শুধুমাত্র আংশিকভাবে স্থাপনযোগ্য। উপাদানগুলি উন্মুক্ত — হিমায়িত প্রাক-প্রশিক্ষিত ব্যাকবোনগুলি যাতে কোনও ফাইন-টিউনিং নেই, একটি ওপেন-সোর্স স্ক্যাফোল্ড এবং বেঞ্চমার্ক এবং ওপেন-ওয়েট ব্যাকবোন মডেলগুলি — তবে এজেন্টিক ভেরিয়েন্টের স্যান্ডবক্সের প্রয়োজনীয়তা এবং এর পাইলট-পরীক্ষার ওভারহেড মানে বেশিরভাগ ল্যাব শুধুমাত্র অনুমান-সংস্করণ দিয়ে শুরু হবে। গবেষকরা আরও উল্লেখ করেছেন যে ডিবাগ পদক্ষেপগুলি এজেন্টিক ভেরিয়েন্টে এলোমেলো নির্বাচনে ফিরে আসে কারণ পাইলট সময় এজেন্টের নিজস্ব ঘড়ির সাথে প্রতিযোগিতা করে।
বড় তাৎপর্য দিকনির্দেশক হতে পারে। যেহেতু স্বায়ত্তশাসিত গবেষণা এজেন্টরা ডেমো থেকে শিল্প ল্যাবগুলিতে দৈনন্দিন ব্যবহারের দিকে চলে যায়, দুর্লভ সংস্থান আর ধারণা নয় বরং GPU ঘন্টা এবং পদ্ধতি যা সময়ের সাথে সাথে একটি নির্দিষ্ট গণনা বাজেটের যৌগ থেকে আরও অগ্রগতি করে। দৌড়ানোর আগে র্যাঙ্কিং করা একটি সহজ ধারণা, এবং AIRS-বেঞ্চ নম্বরগুলি পরামর্শ দেয় যে এটি একটি ধারণা যা যথেষ্ট ভালভাবে কাজ করে।
