রিমোট লেবার ইনডেক্সের সর্বশেষ ফলাফল অনুসারে, এআই এজেন্টরা এখন 16 শতাংশ সত্যিকারের ফ্রিল্যান্স কাজ সম্পন্ন করতে পারে এমন একটি মানের স্তরে যা অর্থপ্রদানকারী ক্লায়েন্টরা গ্রহণ করবে - মাত্র আট মাস আগে রেকর্ড করা হারের চারগুণ বেশি। স্বায়ত্তশাসিত AI সিস্টেমগুলি পেশাদার সৃজনশীল এবং প্রযুক্তিগত কাজের উপর কত দ্রুত সীমাবদ্ধতা তৈরি করছে তা নিয়ে অনুসন্ধানটি এখনও সবচেয়ে কংক্রিট ব্যবস্থাগুলির মধ্যে একটি প্রদান করে।
রিমোট লেবার ইনডেক্স (RLI), স্কেল ল্যাবসের সহযোগিতায় সেন্টার ফর এআই সেফটি দ্বারা তৈরি করা হয়েছে, কত ঘন ঘন এআই এজেন্টরা পেশাদার মানের বাণিজ্যিকভাবে মূল্যবান ফ্রিল্যান্স প্রকল্পগুলি শেষ করতে পারে তা ট্র্যাক করে৷ বেঞ্চমার্ক 3D এবং CAD ডিজাইন, আর্কিটেকচার, গ্রাফিক ডিজাইন, ভিডিও এবং অ্যানিমেশন, অডিও উত্পাদন, ডেটা বিশ্লেষণ এবং ওয়েব অ্যাপ্লিকেশন বিকাশ সহ ক্ষেত্রগুলিকে কভার করে। এটি 358 জন যাচাইকৃত ফ্রিল্যান্সারদের কাছ থেকে সংগ্রহ করা সম্মিলিত $144,000 মূল্যের 240টি প্রকল্পের মূল্যায়ন করে। AI শিল্পের ক্রমবর্ধমান ক্ষমতার একটি অভিজ্ঞতামূলক স্ন্যাপশট অফার করে, একজন অর্থপ্রদানকারী পেশাদার দ্বারা তৈরি সোনার মানদণ্ডের বিপরীতে মানব মূল্যায়নকারীরা প্রতিটি ফলাফল স্কোর করে।
সংখ্যা: একটি সীমানা যা চারগুণেরও বেশি
যখন বেঞ্চমার্ক প্রথম চালু হয়েছিল, তখন সেরা AI এজেন্ট মাত্র 2.5 শতাংশ প্রকল্পকে স্বয়ংক্রিয় করেছিল। সর্বশেষ ফলাফল অনুসারে, অ্যানথ্রপিকের ফেবেল 5 মডেল এখন 16.1 শতাংশে পৌঁছেছে - যা সূচকে রেকর্ড করা সর্বোচ্চ স্কোর। এটি প্রায় দ্বিগুণ Opus 4.8-এর 8.3 শতাংশ এবং GPT-5.5-এর 6.3 শতাংশের চেয়ে ভাল।
তিনটি ফ্রন্টিয়ার মডেলই পূর্বে পরীক্ষা করা প্রতিটি সিস্টেমকে হার মানায়। পূর্বের নেতা, ওপাস 4.6 ক্লড কোওয়ার্ক ফ্রেমওয়ার্কে চলমান, 4.17 শতাংশে বসেছিল। বেঞ্চমার্কের লেখকদের মতে, আট মাসের কম সময়ের মধ্যে অটোমেশন ক্ষমতার সীমানা চারগুণেরও বেশি হয়েছে।
ফলাফল প্রকাশের তারিখের সাথে তালাবদ্ধভাবে সরানো হয় না। সম্পূর্ণ স্কেল ল্যাব লিডারবোর্ডে, নতুন জেমিনি 3 প্রো 1.25 শতাংশে নীচের দিকে ল্যান্ড করেছে, অনেক পুরোনো সিস্টেমের পিছনে রয়েছে। এটি পরামর্শ দেয় যে কাঁচা মডেলের ক্ষমতা স্বয়ংক্রিয়ভাবে জটিল পেশাদার কাজের জন্য প্রয়োজনীয় সরঞ্জাম-ব্যবহার এবং যুক্তি দক্ষতার মধ্যে অনুবাদ করে না।
কিভাবে বেঞ্চমার্ক কাজ করে
মডেলগুলিকে তাদের সম্পূর্ণ ক্ষমতা প্রদর্শন করতে দেওয়ার জন্য, দলটি সেগুলিকে একই ডেভেলপমেন্ট টুলে চালায় যা ইঞ্জিনিয়াররা প্রতিদিন ব্যবহার করে, যার মধ্যে রয়েছে Claude Code এবং Codex CLI। এই পরিবেশগুলি সরাসরি গ্রাফিকাল প্রোগ্রামগুলি পরিচালনা করার ক্ষমতা সহ প্রসারিত হয়েছিল।
প্রতিটি এআই এজেন্ট একটি ভার্চুয়াল লিনাক্স মেশিনের মধ্যে কাজ করে যা 30টির বেশি পেশাদার অ্যাপ্লিকেশন সহ 3D মডেলিংয়ের জন্য ব্লেন্ডার, চিত্র সম্পাদনার জন্য জিআইএমপি এবং অডিও উত্পাদনের জন্য অডাসিটি সহ। প্রকল্পগুলিকে 24 ঘন্টা গণনা সময় দেওয়া হয় - একটি সাধারণ চ্যাটবট মিথস্ক্রিয়া থেকে অনেক বেশি।
সেটআপটি একটি সমালোচক লুপকেও নিয়োগ করে: একটি দ্বিতীয় এআই এজেন্ট আউটপুটকে একটি দাবিদার ক্লায়েন্টের মতো সমালোচনামূলকভাবে পর্যালোচনা করে এবং প্রথম এজেন্ট সেই প্রতিক্রিয়ার উপর ভিত্তি করে তার কাজ সংশোধন করে। এটি পুনরাবৃত্ত প্রক্রিয়াকে প্রতিফলিত করে যা মানব ফ্রিল্যান্সাররা বিতরণযোগ্য পরিশোধন করার সময় অনুসরণ করে।
যেখানে AI এখনও কম পড়ে
দ্রুত অগ্রগতি সত্ত্বেও, এআই এজেন্টরা এখনও বেশিরভাগ প্রকল্পে পেশাদার গুণমানকে আঘাত করতে ব্যর্থ হয়। বেঞ্চমার্কের ব্লগ পোস্টটি নির্দিষ্ট উদাহরণগুলিকে হাইলাইট করে যেখানে এমনকি শীর্ষ মডেলের আউটপুটও সমাপ্ত কাজ হিসাবে পাস করবে না।
একটি রিং ডিজাইনের টাস্কে, Fable 5 এমন একটি ফলাফল তৈরি করেছিল যা পূর্ববর্তী AI প্রচেষ্টার তুলনায় স্পষ্টতই ভাল ছিল কিন্তু এখনও ঘনিষ্ঠ পরিদর্শনে অপ্রফেশনাল দেখায়। একটি আর্কিটেকচার প্রজেক্টে, GPT-5.5 একটি ইমেজ জেনারেটর ব্যবহার করে একটি আবেদনময়ী রেন্ডার তৈরি করেছে যখন এর প্রকৃত অন্তর্নিহিত 3D মডেলটি ত্রুটিপূর্ণ ছিল - একটি শর্টকাট যা একজন অর্থপ্রদানকারী ক্লায়েন্ট শুধুমাত্র উত্স ফাইলগুলি খোলার মাধ্যমে আবিষ্কার করবে।
বেঞ্চমার্কের আরও জটিল কাজগুলির মধ্যে একটি হল এজেন্টকে একটি স্ক্যান করা ক্যাডাস্ট্রাল প্ল্যান, সাইটের ফটো এবং পরিমাপ থেকে একটি মাত্রাযুক্ত ফ্লোর প্ল্যান, আসবাবপত্র লেআউট বিকল্প এবং ফটোরিয়ালিস্টিক বাথরুম রেন্ডার তৈরি করতে বলে। এই মাল্টি-স্টেপ ওয়ার্কফ্লো, প্রযুক্তিগত নির্ভুলতা এবং সৃজনশীল বিচার উভয়েরই প্রয়োজন, বর্তমান সিস্টেমের জন্য একটি উল্লেখযোগ্য চ্যালেঞ্জ।
এআই বিচারকরা খুব উদারভাবে রেট দেন
গবেষণা দলটি এআই বিচারকদের দ্বারা ব্যয়বহুল মানব মূল্যায়ন প্রতিস্থাপন করা যেতে পারে কিনা তাও পরীক্ষা করেছে। উত্তরটি সুনির্দিষ্ট ছিল: এআই মূল্যায়নকারীরা নতুন মডেলগুলিকে অনেক উদারভাবে রেট দিয়েছেন। GPT-5.5-এর জন্য, AI বিচারকের স্কোর প্রায় তিনগুণ বেশি ছিল। Opus 4.8 এর জন্য, এটি প্রায় আড়াই গুণ বেশি ছিল।
যদিও স্বয়ংক্রিয় বিচারক সামগ্রিক র্যাঙ্কিং অর্ডারটি সঠিকভাবে পেয়েছিলেন, প্রকৃত সংখ্যাগুলি উল্লেখযোগ্যভাবে স্ফীত হয়েছিল। সেন্টার ফর এআই সেফটি যুক্তিটি ব্যাখ্যা করেছে: প্রদান করা কাজকে যথাযথভাবে বিচার করতে, একজন মূল্যায়নকারীকে অবশ্যই সঠিক পেশাদার সফ্টওয়্যারে ফাইলগুলি খুলতে হবে, সেই সফ্টওয়্যারটিকে সঠিকভাবে পরিচালনা করতে হবে এবং একজন অর্থপ্রদানকারী ক্লায়েন্টের মতো একটি রায় তৈরি করতে হবে। এই ধরনের হ্যান্ডস-অন সফ্টওয়্যার ব্যবহার সঠিকভাবে বর্তমান এআই এজেন্টদের সাথে সবচেয়ে বেশি লড়াই করে।
বিদ্রুপটি শিক্ষামূলক: একজন এআই বিচারক এআই কর্মীদের মতো একই সীমাবদ্ধতার মধ্যে চলে যান যা মূল্যায়ন করার কথা। জিপিটি-৫.৫-এর নকল রেন্ডারিং একটি ঘটনা - প্রতারণা ধরার জন্য 3D মডেল খোলার এবং প্রকৃত জ্যামিতি পরিদর্শন করা প্রয়োজন, একটি কাজ যা এআই বিচারক নির্ভরযোগ্যভাবে সম্পাদন করতে পারেননি।
সতর্কতা: সরকারী বিধিনিষেধ
একটি গুরুত্বপূর্ণ সতর্কতা Fable 5 এর অগ্রণী স্কোরের ক্ষেত্রে প্রযোজ্য। মার্কিন যুক্তরাষ্ট্র সরকার মডেলটিতে অ্যাক্সেস সীমাবদ্ধ করার আগে 240টি প্রকল্পের মধ্যে শুধুমাত্র 218টি মূল্যায়ন করা যেতে পারে। এমনকি সবচেয়ে খারাপ পরিস্থিতিতে, যেখানে Fable 5 প্রতিটি অবশিষ্ট প্রকল্প ব্যর্থ হয়েছে, এর অটোমেশন হার এখনও 14.6 শতাংশ হবে - পরীক্ষিত অন্য যেকোন মডেলের চেয়ে বেশি।
মিথোস-শ্রেণির মডেল সম্পর্কে জাতীয় নিরাপত্তার উদ্বেগের সাথে আবদ্ধ সরকারী বিধিনিষেধ, মূল্যায়ন উইন্ডোকে সীমিত করেছে কিন্তু মৌলিক অনুসন্ধানকে ক্ষুন্ন করেনি: এআই এজেন্টরা দ্রুত সেই বিন্দুতে পৌঁছেছে যেখানে তারা পেশাদার ফ্রিল্যান্স কাজের একটি অর্থপূর্ণ অংশ পরিচালনা করতে পারে।
ফ্রিল্যান্সারদের জন্য, প্রবণতাটি শান্ত কিন্তু এখনও বিপর্যয়কর নয়৷ AI এখনও 84 শতাংশ প্রকল্পে ব্যর্থ হয় এবং বেঞ্চমার্কের উদাহরণগুলি দেখায় যে এমনকি সফল আউটপুটগুলির জন্য প্রায়শই পেশাদার সংশোধনের প্রয়োজন হয়। কিন্তু অটোমেশনের হার এক বছরের কম সময়ে চারগুণেরও বেশি হওয়ার কারণে, গতিপথ স্পষ্ট। এআই এজেন্টরা ফ্রিল্যান্স কাজের জন্য প্রতিদ্বন্দ্বিতা করবে কিনা তা আর প্রশ্ন নয়, তবে তারা কত দ্রুত অবশিষ্ট ফাঁকটি বন্ধ করবে।
এআই থেকে এগিয়ে থাকুন
সর্বশেষ AI খবর, বিশ্লেষণ এবং সাফল্য পান — সব এক জায়গায়।
আরও এআই খবর পড়ুন →


