रिमोट लेबर इंडेक्स के नवीनतम परिणामों के अनुसार, एआई एजेंट अब 16 प्रतिशत वास्तविक फ्रीलांस नौकरियों को गुणवत्ता स्तर पर पूरा कर सकते हैं, जिसे भुगतान करने वाले ग्राहक स्वीकार करेंगे - केवल आठ महीने पहले दर्ज की गई दर से चौगुनी से भी अधिक। यह खोज अब तक के सबसे ठोस उपायों में से एक प्रदान करती है कि कितनी तेजी से स्वायत्त एआई सिस्टम पेशेवर रचनात्मक और तकनीकी कार्यों पर अतिक्रमण कर रहे हैं।
स्केल लैब्स के सहयोग से सेंटर फॉर एआई सेफ्टी द्वारा विकसित रिमोट लेबर इंडेक्स (आरएलआई) ट्रैक करता है कि एआई एजेंट कितनी बार व्यावसायिक रूप से मूल्यवान फ्रीलांस परियोजनाओं को व्यावसायिक गुणवत्ता पर पूरा कर सकते हैं। बेंचमार्क में 3डी और सीएडी डिजाइन, आर्किटेक्चर, ग्राफिक डिजाइन, वीडियो और एनीमेशन, ऑडियो उत्पादन, डेटा विश्लेषण और वेब एप्लिकेशन विकास सहित क्षेत्र शामिल हैं। यह 358 सत्यापित फ्रीलांसरों से प्राप्त कुल $144,000 मूल्य की 240 परियोजनाओं का मूल्यांकन करता है। मानव मूल्यांकनकर्ता प्रत्येक परिणाम को एक वेतनभोगी पेशेवर द्वारा बनाए गए स्वर्ण मानक के आधार पर स्कोर करते हैं, जो [एआई उद्योग] (https://aibuzzwire.news) की बढ़ती क्षमताओं का एक अनुभवजन्य स्नैपशॉट पेश करता है।
संख्याएँ: एक सीमा जो चौगुनी से भी अधिक हो गई
जब बेंचमार्क पहली बार लॉन्च हुआ, तो सर्वश्रेष्ठ एआई एजेंट ने केवल 2.5 प्रतिशत परियोजनाओं को स्वचालित किया। नवीनतम परिणामों के अनुसार, एंथ्रोपिक का फैबल 5 मॉडल अब 16.1 प्रतिशत तक पहुंच गया है - जो सूचकांक पर अब तक दर्ज किया गया उच्चतम स्कोर है। यह ओपस 4.8 के 8.3 प्रतिशत से लगभग दोगुना है और जीपीटी-5.5 के 6.3 प्रतिशत से काफी आगे है।
सभी तीन सीमांत मॉडल पहले से परीक्षण किए गए प्रत्येक सिस्टम को मात देते हैं। पूर्व नेता, क्लाउड कोवर्क फ्रेमवर्क पर चलने वाला ओपस 4.6, 4.17 प्रतिशत पर था। बेंचमार्क के लेखकों के अनुसार, स्वचालन क्षमता की सीमा आठ महीनों से भी कम समय में चौगुनी से अधिक हो गई है।
हालाँकि, परिणाम रिलीज़ की तारीखों के साथ लॉकस्टेप में नहीं चलते हैं। पूर्ण स्केल लैब्स लीडरबोर्ड पर, नया जेमिनी 3 प्रो केवल 1.25 प्रतिशत पर निचले स्तर पर है, जो कि बहुत पुराने सिस्टम से पीछे है। इससे पता चलता है कि कच्चे मॉडल की क्षमता स्वचालित रूप से जटिल व्यावसायिक कार्यों के लिए आवश्यक उपकरण-उपयोग और तर्क कौशल में तब्दील नहीं होती है।
बेंचमार्क कैसे काम करता है
मॉडलों को अपनी पूर्ण क्षमता प्रदर्शित करने देने के लिए, टीम उन्हें उन्हीं विकास उपकरणों में चलाती है जिनका उपयोग इंजीनियर दिन-प्रतिदिन करते हैं, जिसमें क्लाउड कोड और कोडेक्स सीएलआई शामिल हैं। इन वातावरणों को ग्राफ़िकल प्रोग्रामों को सीधे संचालित करने की क्षमता के साथ विस्तारित किया गया था।
प्रत्येक एआई एजेंट 30 से अधिक पेशेवर अनुप्रयोगों से भरी वर्चुअल लिनक्स मशीन के भीतर काम करता है, जिसमें 3डी मॉडलिंग के लिए ब्लेंडर, छवि संपादन के लिए जीआईएमपी और ऑडियो उत्पादन के लिए ऑडेसिटी शामिल है। परियोजनाओं को 24 घंटे तक का गणना समय दिया जाता है - जो सामान्य चैटबॉट इंटरैक्शन से कहीं अधिक लंबा है।
सेटअप एक आलोचक लूप को भी नियोजित करता है: एक दूसरा एआई एजेंट आउटपुट की उतनी ही समीक्षा करता है जितना एक मांग करने वाला ग्राहक करता है, और पहला एजेंट उस फीडबैक के आधार पर अपने काम को संशोधित करता है। यह उस पुनरावृत्तीय प्रक्रिया को प्रतिबिंबित करता है जिसका अनुसरण मानव फ्रीलांसर डिलिवरेबल्स को परिष्कृत करते समय करते हैं।
जहां एआई अभी भी कम है
तीव्र प्रगति के बावजूद, एआई एजेंट अभी भी अधिकांश परियोजनाओं में पेशेवर गुणवत्ता हासिल करने में विफल हैं। बेंचमार्क का ब्लॉग पोस्ट विशिष्ट उदाहरणों पर प्रकाश डालता है जहां शीर्ष मॉडल का आउटपुट भी समाप्त कार्य के रूप में पारित नहीं होगा।
रिंग डिज़ाइन कार्य पर, फ़ेबल 5 ने ऐसा परिणाम दिया जो स्पष्ट रूप से पहले के एआई प्रयासों से बेहतर था लेकिन फिर भी बारीकी से निरीक्षण करने पर अव्यवसायिक लग रहा था। एक आर्किटेक्चर प्रोजेक्ट पर, GPT-5.5 ने एक छवि जनरेटर का उपयोग करके एक आकर्षक रेंडर बनाया, जबकि इसका वास्तविक अंतर्निहित 3D मॉडल त्रुटिपूर्ण रहा - एक शॉर्टकट जिसे भुगतान करने वाला ग्राहक केवल स्रोत फ़ाइलों को खोलकर खोज सकता है।
बेंचमार्क में अधिक जटिल कार्यों में से एक एजेंट को एक स्कैन किए गए कैडस्ट्राल प्लान, साइट फोटो और माप से एक आयामी फर्श योजना, फर्नीचर लेआउट विकल्प और फोटोरिअलिस्टिक बाथरूम रेंडर बनाने के लिए कहता है। यह बहु-चरणीय वर्कफ़्लो, जिसमें तकनीकी सटीकता और रचनात्मक निर्णय दोनों की आवश्यकता होती है, वर्तमान प्रणालियों के लिए एक महत्वपूर्ण चुनौती बनी हुई है।
एआई न्यायाधीश बहुत उदारतापूर्वक मूल्यांकन करते हैं
शोध दल ने यह भी परीक्षण किया कि क्या महंगे मानव मूल्यांकन को एआई न्यायाधीशों द्वारा प्रतिस्थापित किया जा सकता है। उत्तर निश्चित था: एआई मूल्यांकनकर्ताओं ने नए मॉडलों का बहुत उदारतापूर्वक मूल्यांकन किया। GPT-5.5 के लिए, AI जज का स्कोर लगभग तीन गुना अधिक था। ओपस 4.8 के लिए, यह लगभग ढाई गुना अधिक था।
हालाँकि स्वचालित न्यायाधीश ने समग्र रैंकिंग क्रम को सही पाया, लेकिन वास्तविक संख्याएँ काफी बढ़ा दी गईं। सेंटर फॉर एआई सेफ्टी ने तर्क समझाया: वितरित कार्य का निष्पक्ष मूल्यांकन करने के लिए, एक मूल्यांकनकर्ता को सही पेशेवर सॉफ़्टवेयर में फ़ाइलें खोलनी चाहिए, उस सॉफ़्टवेयर को ठीक से संचालित करना चाहिए, और एक भुगतान करने वाले ग्राहक के रूप में निर्णय लेना चाहिए। इस प्रकार के व्यावहारिक सॉफ़्टवेयर उपयोग से वर्तमान AI एजेंट सबसे अधिक जूझते हैं।
विडंबना शिक्षाप्रद है: एक एआई जज उन्हीं सीमाओं में चलता है, जिनका मूल्यांकन एआई कार्यकर्ताओं से करना होता है। जीपीटी-5.5 का नकली प्रतिपादन एक उदाहरण है - धोखे को पकड़ने के लिए 3डी मॉडल को खोलने और वास्तविक ज्यामिति का निरीक्षण करने की आवश्यकता होती है, एक ऐसा कार्य जो एआई जज विश्वसनीय रूप से नहीं कर सकता।
चेतावनी: सरकारी प्रतिबंध
एक महत्वपूर्ण चेतावनी फ़ेबल 5 के प्रमुख स्कोर पर लागू होती है। संयुक्त राज्य सरकार द्वारा मॉडल तक पहुंच प्रतिबंधित करने से पहले 240 परियोजनाओं में से केवल 218 का मूल्यांकन किया जा सका था। यहां तक कि सबसे खराब स्थिति में भी, जहां फैबल 5 प्रत्येक शेष परियोजना में विफल रहा, इसकी स्वचालन दर अभी भी 14.6 प्रतिशत होगी - परीक्षण किए गए किसी भी अन्य मॉडल की तुलना में अधिक।
मिथोस-क्लास मॉडल के बारे में राष्ट्रीय सुरक्षा चिंताओं से जुड़े सरकारी प्रतिबंधों ने मूल्यांकन विंडो को सीमित कर दिया है, लेकिन मौलिक खोज को कमजोर नहीं किया है: एआई एजेंट तेजी से उस बिंदु पर पहुंच रहे हैं जहां वे पेशेवर फ्रीलांस काम का एक सार्थक हिस्सा संभाल सकते हैं।
फ्रीलांसरों के लिए, प्रवृत्ति गंभीर है लेकिन अभी तक विनाशकारी नहीं है। एआई अभी भी 84 प्रतिशत परियोजनाओं पर विफल रहता है, और बेंचमार्क के उदाहरण बताते हैं कि सफल आउटपुट के लिए भी अक्सर पेशेवर संशोधन की आवश्यकता होती है। लेकिन एक वर्ष से भी कम समय में स्वचालन दर चौगुनी से अधिक होने से, प्रक्षेप पथ स्पष्ट है। अब सवाल यह नहीं है कि एआई एजेंट फ्रीलांस काम के लिए प्रतिस्पर्धा करेंगे या नहीं, बल्कि सवाल यह है कि वे कितनी जल्दी शेष अंतर को पाट देंगे।
एआई से आगे रहें
नवीनतम एआई समाचार, विश्लेषण और सफलताएँ प्राप्त करें - सभी एक ही स्थान पर।
अधिक AI समाचार पढ़ें →


