रिमोट लेबर इंडेक्सच्या ताज्या निकालांनुसार, एआय एजंट आता 16 टक्के वास्तविक फ्रीलान्स नोकऱ्या गुणवत्ता पातळीवर पूर्ण करू शकतात जे पैसे देणारे क्लायंट स्वीकारतील - फक्त आठ महिन्यांपूर्वी नोंदवलेल्या दराच्या चौपटीने. स्वायत्त एआय सिस्टीम व्यावसायिक सर्जनशील आणि तांत्रिक कार्यावर किती लवकर अतिक्रमण करत आहेत यावरील सर्वात ठोस उपायांपैकी एक शोध हा शोध प्रदान करतो.
रिमोट लेबर इंडेक्स (RLI), सेंटर फॉर AI सेफ्टी द्वारे स्केल लॅब्सच्या सहकार्याने विकसित केले गेले आहे, AI एजंट व्यावसायिक गुणवत्तेवर व्यावसायिकदृष्ट्या मौल्यवान फ्रीलान्स प्रकल्प किती वेळा पूर्ण करू शकतात याचा मागोवा घेतात. बेंचमार्कमध्ये 3D आणि CAD डिझाइन, आर्किटेक्चर, ग्राफिक डिझाइन, व्हिडिओ आणि ॲनिमेशन, ऑडिओ उत्पादन, डेटा विश्लेषण आणि वेब ऍप्लिकेशन डेव्हलपमेंटसह फील्ड समाविष्ट आहेत. हे एकत्रित $144,000 किमतीच्या 240 प्रकल्पांचे मूल्यमापन करते, जे 358 सत्यापित फ्रीलांसरकडून प्राप्त केले जाते. AI उद्योगाच्या वाढत्या क्षमतांचा अनुभवजन्य स्नॅपशॉट ऑफर करून, सशुल्क व्यावसायिकाने तयार केलेल्या सुवर्ण मानकांनुसार मानवी मूल्यांकनकर्ते प्रत्येक निकाल देतात.
संख्या: चौपट पेक्षा जास्त सीमा
जेव्हा बेंचमार्क प्रथम लॉन्च झाला, तेव्हा सर्वोत्तम AI एजंटने केवळ 2.5 टक्के प्रकल्प स्वयंचलित केले. ताज्या निकालांनुसार, अँथ्रोपिकच्या फेबल 5 मॉडेलने आता 16.1 टक्के गाठले आहे - निर्देशांकावर आतापर्यंतचा सर्वोच्च स्कोअर. ते साधारणपणे Opus 4.8 च्या 8.3 टक्के दुप्पट आहे आणि GPT-5.5 च्या 6.3 टक्क्यांच्या पुढे आहे.
सर्व तीन फ्रंटियर मॉडेल्स पूर्वी चाचणी केलेल्या प्रत्येक प्रणालीवर मात करतात. क्लॉड कॉवर्क फ्रेमवर्कवर चालणारा पूर्वीचा नेता, ओपस 4.6, 4.17 टक्के बसला. बेंचमार्कच्या लेखकांच्या मते ऑटोमेशन क्षमतेची सीमा आठ महिन्यांच्या आत चौपटीने वाढली आहे.
तथापि, रिलीझ तारखांसह परिणाम लॉकस्टेपमध्ये हलत नाहीत. संपूर्ण स्केल लॅब्स लीडरबोर्डवर, नवीन जेमिनी 3 प्रो फक्त 1.25 टक्के तळाशी उतरते, जुन्या सिस्टीमच्या मागे आहे. हे सूचित करते की कच्च्या मॉडेलची क्षमता जटिल व्यावसायिक कार्यांसाठी आवश्यक असलेल्या साधन-वापर आणि तर्क कौशल्यांमध्ये स्वयंचलितपणे अनुवादित होत नाही.
बेंचमार्क कसे कार्य करते
मॉडेल्सना त्यांची पूर्ण क्षमता दाखवता यावी यासाठी, टीम त्यांना त्याच डेव्हलपमेंट टूल्समध्ये चालवते जे अभियंते दैनंदिन वापरतात, ज्यात क्लॉड कोड आणि कोडेक्स CLI यांचा समावेश आहे. हे वातावरण थेट ग्राफिकल प्रोग्राम ऑपरेट करण्याच्या क्षमतेसह विस्तारित केले गेले.
प्रत्येक AI एजंट 3D मॉडेलिंगसाठी ब्लेंडर, इमेज एडिटिंगसाठी GIMP आणि ऑडिओ उत्पादनासाठी ऑडेसिटीसह 30 हून अधिक व्यावसायिक अनुप्रयोगांनी भरलेल्या व्हर्च्युअल लिनक्स मशीनमध्ये काम करतो. प्रकल्पांना 24 तासांची गणना वेळ दिली जाते — सामान्य चॅटबॉट परस्परसंवादापेक्षा खूप जास्त.
सेटअपमध्ये समालोचक लूप देखील वापरला जातो: दुसरा एआय एजंट मागणी करणाऱ्या क्लायंटप्रमाणे आउटपुटचे गंभीरपणे पुनरावलोकन करतो आणि पहिला एजंट त्या अभिप्रायाच्या आधारे त्याचे काम सुधारतो. हे मानवी फ्रीलांसर डिलिव्हरेबल्स रिफाइन करताना फॉलो करत असलेल्या पुनरावृत्ती प्रक्रियेचे प्रतिबिंबित करते.
जिथे AI अजूनही कमी आहे
जलद प्रगती असूनही, एआय एजंट्स अजूनही बहुसंख्य प्रकल्पांवर व्यावसायिक गुणवत्तेवर परिणाम करण्यात अयशस्वी ठरतात. बेंचमार्कचे ब्लॉग पोस्ट विशिष्ट उदाहरणे हायलाइट करते जेथे शीर्ष मॉडेलचे आउटपुट देखील पूर्ण झालेल्या कामाच्या रूपात पास होणार नाही.
रिंग डिझाइन टास्कवर, फेबल 5 ने एक परिणाम दिला जो पूर्वीच्या AI प्रयत्नांपेक्षा स्पष्टपणे चांगला होता परंतु तरीही जवळच्या तपासणीवर तो अव्यावसायिक दिसत होता. आर्किटेक्चर प्रोजेक्टवर, GPT-5.5 ने इमेज जनरेटरचा वापर करून आकर्षक रेंडर बनवले तर त्याचे वास्तविक 3D मॉडेल सदोष राहिले — एक शॉर्टकट जो पैसे देणाऱ्या क्लायंटला फक्त स्त्रोत फाइल्स उघडूनच सापडेल.
बेंचमार्कमधील अधिक जटिल कार्यांपैकी एक एजंटला स्कॅन केलेल्या कॅडस्ट्रल प्लॅन, साइट फोटो आणि मोजमापांमधून एक आकारमान मजला योजना, फर्निचर लेआउट पर्याय आणि फोटोरिअलिस्टिक बाथरूम रेंडर तयार करण्यास सांगते. हा बहु-चरण कार्यप्रवाह, तांत्रिक अचूकता आणि सर्जनशील निर्णय दोन्ही आवश्यक आहे, सध्याच्या प्रणालींसाठी एक महत्त्वपूर्ण आव्हान आहे.
AI न्यायाधीश खूप उदारतेने रेट करतात
संशोधन संघाने एआय न्यायाधीशांद्वारे महागड्या मानवी मूल्यांकनाची जागा घेतली जाऊ शकते का याची चाचणी देखील केली. उत्तर निश्चित होते: एआय मूल्यांकनकर्त्यांनी नवीन मॉडेल्सना खूप उदारतेने रेट केले. GPT-5.5 साठी, AI न्यायाधीशांचा स्कोअर जवळजवळ तीन पट जास्त होता. Opus 4.8 साठी, ते अंदाजे अडीच पट जास्त होते.
स्वयंचलित न्यायाधीशांना एकूण क्रमवारीचा क्रम योग्य मिळाला असला तरी, वास्तविक संख्या लक्षणीयरीत्या वाढलेली होती. सेंटर फॉर AI सेफ्टीने तर्क स्पष्ट केला: वितरित केलेल्या कामाचा योग्य न्याय करण्यासाठी, मूल्यांकनकर्त्याने योग्य व्यावसायिक सॉफ्टवेअरमधील फायली उघडल्या पाहिजेत, ते सॉफ्टवेअर योग्यरित्या ऑपरेट केले पाहिजे आणि पैसे देणाऱ्या क्लायंटप्रमाणे निर्णय तयार केला पाहिजे. अशा प्रकारचे हँड्स-ऑन सॉफ्टवेअर वापर म्हणजे सध्याच्या एआय एजंट्सना सर्वात जास्त त्रास होतो.
विडंबना शिकवणारी आहे: एआय न्यायाधीश ज्या मर्यादांचे मूल्यांकन करणे अपेक्षित आहे त्याच मर्यादेत एआय कामगार असतात. GPT-5.5 चे बनावट रेंडरिंग हे एक प्रकरण आहे — फसवणूक पकडण्यासाठी 3D मॉडेल उघडणे आणि वास्तविक भूमितीची तपासणी करणे आवश्यक आहे, हे कार्य AI न्यायाधीश विश्वसनीयरित्या पार पाडू शकत नाहीत.
चेतावणी: सरकारी निर्बंध
Fable 5 च्या अग्रगण्य स्कोअरवर एक महत्त्वाची सूचना लागू होते. युनायटेड स्टेट्स सरकारने मॉडेलवर प्रवेश प्रतिबंधित करण्यापूर्वी 240 पैकी केवळ 218 प्रकल्पांचे मूल्यांकन केले जाऊ शकते. अगदी वाईट परिस्थितीतही, जेथे Fable 5 प्रत्येक उर्वरित प्रकल्प अयशस्वी झाला, तरीही त्याचा ऑटोमेशन दर 14.6 टक्के असेल - चाचणी केलेल्या इतर कोणत्याही मॉडेलपेक्षा जास्त.
मिथॉस-क्लास मॉडेल्सबद्दल राष्ट्रीय सुरक्षेच्या चिंतेशी संबंधित सरकारी निर्बंधांनी मूल्यांकन विंडो मर्यादित केली परंतु मूलभूत निष्कर्षांना कमी केले नाही: AI एजंट वेगाने अशा टप्प्यावर पोहोचत आहेत जिथे ते व्यावसायिक फ्रीलान्स कामाचा अर्थपूर्ण वाटा हाताळू शकतात.
फ्रीलांसरसाठी, ट्रेंड शांत आहे परंतु अद्याप आपत्तीजनक नाही. एआय अजूनही 84 टक्के प्रकल्पांवर अपयशी ठरते आणि बेंचमार्कची उदाहरणे दाखवतात की यशस्वी आउटपुटसाठी देखील अनेकदा व्यावसायिक पुनरावृत्ती आवश्यक असते. परंतु एका वर्षाखालील ऑटोमेशन दर चौपटीने अधिक असल्याने, मार्ग स्पष्ट आहे. एआय एजंट फ्रीलान्स कामासाठी स्पर्धा करतील की नाही हा प्रश्न यापुढे आहे, परंतु ते उर्वरित अंतर किती लवकर पूर्ण करतील.
AI च्या पुढे रहा
नवीनतम AI बातम्या, विश्लेषण आणि यश मिळवा — सर्व एकाच ठिकाणी.
अधिक एआय बातम्या वाचा →


