ரிமோட் லேபர் இன்டெக்ஸின் சமீபத்திய முடிவுகளின்படி, AI முகவர்கள் இப்போது 16 சதவீத உண்மையான ஃப்ரீலான்ஸ் வேலைகளை, பணம் செலுத்தும் வாடிக்கையாளர்கள் ஏற்றுக்கொள்ளும் தரத்தில் முடிக்க முடியும் - இது எட்டு மாதங்களுக்கு முன்பு பதிவு செய்யப்பட்ட விகிதத்தை விட நான்கு மடங்கு அதிகமாகும். தொழில்முறை ஆக்கப்பூர்வமான மற்றும் தொழில்நுட்ப வேலைகளில் தன்னாட்சி AI அமைப்புகள் எவ்வளவு விரைவாக ஊடுருவுகின்றன என்பதற்கான மிகவும் உறுதியான நடவடிக்கைகளில் ஒன்றை இந்த கண்டுபிடிப்பு வழங்குகிறது.

ரிமோட் லேபர் இன்டெக்ஸ் (RLI), ஸ்கேல் லேப்ஸுடன் இணைந்து AI பாதுகாப்புக்கான மையத்தால் உருவாக்கப்பட்டுள்ளது, AI முகவர்கள் வணிக ரீதியாக மதிப்புமிக்க ஃப்ரீலான்ஸ் திட்டங்களை தொழில்முறை தரத்தில் எவ்வளவு அடிக்கடி முடிக்க முடியும் என்பதைக் கண்காணிக்கிறது. பெஞ்ச்மார்க் 3D மற்றும் CAD வடிவமைப்பு, கட்டிடக்கலை, கிராஃபிக் வடிவமைப்பு, வீடியோ மற்றும் அனிமேஷன், ஆடியோ தயாரிப்பு, தரவு பகுப்பாய்வு மற்றும் இணைய பயன்பாட்டு மேம்பாடு உள்ளிட்ட துறைகளை உள்ளடக்கியது. இது 358 சரிபார்க்கப்பட்ட ஃப்ரீலான்ஸர்களிடமிருந்து பெறப்பட்ட $144,000 மதிப்புள்ள 240 திட்டங்களை மதிப்பிடுகிறது. AI தொழில்துறையின் வளர்ந்து வரும் திறன்களின் அனுபவ ஸ்னாப்ஷாட்டை வழங்கும், பணம் செலுத்தும் நிபுணரால் உருவாக்கப்பட்ட தங்கத் தரத்திற்கு எதிராக மனித மதிப்பீட்டாளர்கள் ஒவ்வொரு முடிவையும் பெறுகிறார்கள்.

எண்கள்: நான்கு மடங்குக்கும் மேலான ஒரு எல்லை

பெஞ்ச்மார்க் முதன்முதலில் தொடங்கப்பட்டபோது, சிறந்த AI முகவர் 2.5 சதவீத திட்டங்களை தானியக்கமாக்கியது. சமீபத்திய முடிவுகளின்படி, ஆந்த்ரோபிக்கின் ஃபேபிள் 5 மாடல் இப்போது 16.1 சதவீதத்தை எட்டியுள்ளது - குறியீட்டில் இதுவரை பதிவுசெய்யப்பட்ட அதிகபட்ச மதிப்பெண். இது ஓபஸ் 4.8 இன் 8.3 சதவிகிதம் மற்றும் GPT-5.5 இன் 6.3 சதவிகிதத்தை விட இரண்டு மடங்கு அதிகமாகும்.

மூன்று எல்லை மாடல்களும் முன்பு சோதிக்கப்பட்ட ஒவ்வொரு அமைப்பையும் முறியடிக்கின்றன. முந்தைய தலைவரான ஓபஸ் 4.6 கிளாட் கோவொர்க் கட்டமைப்பில் இயங்கி 4.17 சதவீதத்தில் அமர்ந்திருந்தது. அளவுகோலின் ஆசிரியர்களின் கூற்றுப்படி, ஆட்டோமேஷன் திறனின் எல்லை எட்டு மாதங்களுக்குள் நான்கு மடங்காக அதிகரித்துள்ளது.

எவ்வாறாயினும், முடிவுகள் வெளியீட்டு தேதிகளுடன் லாக்ஸ்டெப்பில் நகராது. முழு அளவிலான லேப்ஸ் லீடர்போர்டில், புதிய ஜெமினி 3 ப்ரோ 1.25 சதவீதத்திற்கு கீழே உள்ளது, இது மிகவும் பழைய அமைப்புகளுக்குப் பின்னால் உள்ளது. சிக்கலான தொழில்முறை பணிகளுக்குத் தேவையான கருவி-பயன்பாட்டு மற்றும் பகுத்தறியும் திறன் ஆகியவற்றின் மூல மாதிரித் திறன் தானாகவே மொழிபெயர்க்கப்படாது என்று இது அறிவுறுத்துகிறது.

பெஞ்ச்மார்க் எவ்வாறு செயல்படுகிறது

மாடல்கள் தங்கள் முழுத் திறனையும் வெளிப்படுத்த அனுமதிக்க, கிளாட் கோட் மற்றும் கோடெக்ஸ் சிஎல்ஐ உள்ளிட்ட பொறியாளர்கள் நாளுக்கு நாள் பயன்படுத்தும் அதே மேம்பாட்டுக் கருவிகளில் குழு அவற்றை இயக்குகிறது. இந்த சூழல்கள் வரைகலை நிரல்களை நேரடியாக இயக்கும் திறனுடன் நீட்டிக்கப்பட்டது.

3D மாடலிங்கிற்கான பிளெண்டர், பட எடிட்டிங்கிற்கான GIMP மற்றும் ஆடியோ தயாரிப்பிற்கான ஆடாசிட்டி உள்ளிட்ட 30 க்கும் மேற்பட்ட தொழில்முறை பயன்பாடுகளுடன் ஏற்றப்பட்ட மெய்நிகர் லினக்ஸ் இயந்திரத்தில் ஒவ்வொரு AI முகவரும் வேலை செய்கிறார்கள். திட்டப்பணிகளுக்கு 24 மணிநேர கணக்கீடு நேரம் வழங்கப்படுகிறது - வழக்கமான சாட்போட் தொடர்புகளை விட மிக நீண்டது.

இந்த அமைப்பானது ஒரு விமர்சகர் வளையத்தையும் பயன்படுத்துகிறது: இரண்டாவது AI முகவர் வெளியீட்டை கோரும் கிளையண்ட் போலவே விமர்சன ரீதியாக மதிப்பாய்வு செய்கிறது. டெலிவரிகளைச் செம்மைப்படுத்தும்போது மனித ஃப்ரீலான்ஸர்கள் பின்பற்றும் மறுசெயல்முறையை இது பிரதிபலிக்கிறது.

AI இன்னும் குறைவாக இருக்கும் இடத்தில்

விரைவான முன்னேற்றம் இருந்தபோதிலும், AI முகவர்கள் இன்னும் பெரும்பாலான திட்டங்களில் தொழில்முறை தரத்தை அடையத் தவறிவிட்டனர். சிறந்த மாடலின் வெளியீடு கூட முடிக்கப்பட்ட வேலையாக மாறாத குறிப்பிட்ட எடுத்துக்காட்டுகளை பெஞ்ச்மார்க்கின் வலைப்பதிவு இடுகை எடுத்துக்காட்டுகிறது.

ரிங் டிசைன் பணியில், ஃபேபிள் 5 ஆனது முந்தைய AI முயற்சிகளை விட தெளிவாக சிறப்பாக இருந்த ஒரு முடிவைத் தந்தது. ஒரு கட்டிடக்கலை திட்டத்தில், GPT-5.5 ஆனது ஒரு இமேஜ் ஜெனரேட்டரைப் பயன்படுத்தி ஒரு கவர்ச்சியான ரெண்டரை போலியாக உருவாக்கியது, அதே நேரத்தில் அதன் உண்மையான அடிப்படையான 3D மாடல் குறைபாடுடையதாகவே இருந்தது - இது ஒரு கட்டணம் செலுத்தும் கிளையன்ட் மூலக் கோப்புகளைத் திறப்பதன் மூலம் மட்டுமே கண்டறியும்.

அளவுகோலில் உள்ள மிகவும் சிக்கலான பணிகளில் ஒன்று, பரிமாண மாடித் திட்டம், தளபாடங்கள் தளவமைப்பு விருப்பங்கள் மற்றும் ஸ்கேன் செய்யப்பட்ட காடாஸ்ட்ரல் திட்டம், தளப் புகைப்படங்கள் மற்றும் அளவீடுகளிலிருந்து ஒளிமயமான குளியலறை ரெண்டர்களை உருவாக்க முகவரைக் கேட்கிறது. இந்த பல-படி வேலைப்பாய்வு, தொழில்நுட்ப துல்லியம் மற்றும் ஆக்கபூர்வமான தீர்ப்பு இரண்டும் தேவைப்படும், தற்போதைய அமைப்புகளுக்கு ஒரு குறிப்பிடத்தக்க சவாலாக உள்ளது.

AI நீதிபதிகள் மிகவும் தாராளமாக மதிப்பிடுகின்றனர்

விலையுயர்ந்த மனித மதிப்பீட்டை AI நீதிபதிகளால் மாற்ற முடியுமா என்பதையும் ஆராய்ச்சி குழு சோதித்தது. பதில் உறுதியானது: AI மதிப்பீட்டாளர்கள் புதிய மாடல்களை மிகவும் தாராளமாக மதிப்பிட்டனர். GPT-5.5க்கு, AI நீதிபதியின் மதிப்பெண் கிட்டத்தட்ட மூன்று மடங்கு அதிகமாக இருந்தது. ஓபஸ் 4.8க்கு, இது தோராயமாக இரண்டரை மடங்கு அதிகமாக இருந்தது.

தானியங்கு நீதிபதி ஒட்டுமொத்த தரவரிசை ஒழுங்கை சரியாகப் பெற்றாலும், உண்மையான எண்கள் கணிசமாக உயர்த்தப்பட்டன. AI பாதுகாப்பு மையம் இந்த காரணத்தை விளக்கியது: வழங்கப்பட்ட வேலையை நியாயமான முறையில் மதிப்பிட, மதிப்பீட்டாளர் சரியான தொழில்முறை மென்பொருளில் கோப்புகளைத் திறக்க வேண்டும், அந்த மென்பொருளை சரியாக இயக்க வேண்டும் மற்றும் பணம் செலுத்தும் கிளையன்ட் ஒரு தீர்ப்பை உருவாக்க வேண்டும். அந்த வகையான சாப்ட்வேர் பயன்பாடானது துல்லியமாக தற்போதைய AI முகவர்கள் அதிகம் போராடுகிறது.

முரண்பாடானது அறிவுறுத்தலாக உள்ளது: AI நீதிபதி மதிப்பீடு செய்ய வேண்டிய AI பணியாளர்களின் அதே வரம்புகளுக்குள் இயங்குகிறார். GPT-5.5 இன் போலியான ரெண்டரிங் ஒரு உதாரணம் — ஏமாற்றுதலைப் பிடிப்பதற்கு 3D மாதிரியைத் திறந்து உண்மையான வடிவவியலை ஆய்வு செய்ய வேண்டும், AI நீதிபதியால் நம்பத்தகுந்த வகையில் செய்ய முடியவில்லை.

எச்சரிக்கை: அரசாங்க கட்டுப்பாடுகள்

ஃபேபிள் 5 இன் முன்னணி மதிப்பெண்ணுக்கு ஒரு முக்கியமான எச்சரிக்கை பொருந்தும். 240 திட்டங்களில் 218 மட்டுமே மதிப்பீடு செய்ய முடியும், முன் மாதிரிக்கான அணுகலை அமெரிக்க அரசாங்கம் கட்டுப்படுத்தியது. எஞ்சியிருக்கும் ஒவ்வொரு திட்டத்திலும் ஃபேபிள் 5 தோல்வியடைந்த மோசமான சூழ்நிலையில் கூட, அதன் ஆட்டோமேஷன் விகிதம் இன்னும் 14.6 சதவீதமாக இருக்கும் - சோதனை செய்யப்பட்ட மற்ற மாதிரிகளை விட அதிகமாகும்.

Mythos-class மாதிரிகள் பற்றிய தேசியப் பாதுகாப்புக் கவலைகளுடன் பிணைக்கப்பட்ட அரசாங்கக் கட்டுப்பாடுகள், மதிப்பீட்டுச் சாளரத்தை மட்டுப்படுத்தின, ஆனால் அடிப்படைக் கண்டுபிடிப்பைக் குறைமதிப்பிற்கு உட்படுத்தவில்லை: AI முகவர்கள், தொழில்முறை ஃப்ரீலான்ஸ் வேலையின் அர்த்தமுள்ள பங்கைக் கையாளக்கூடிய புள்ளியை விரைவாக அணுகுகிறார்கள்.

ஃப்ரீலான்ஸர்களுக்கு, இந்த போக்கு நிதானமாக இருக்கிறது, ஆனால் இன்னும் பேரழிவை ஏற்படுத்தவில்லை. AI இன்னும் 84 சதவீத திட்டங்களில் தோல்வியடைகிறது, மேலும் வெற்றிகரமான வெளியீடுகளுக்கு கூட பெரும்பாலும் தொழில்முறை மறுசீரமைப்பு தேவைப்படுகிறது என்பதை அளவுகோலின் எடுத்துக்காட்டுகள் காட்டுகின்றன. ஆனால் ஆட்டோமேஷன் விகிதம் ஒரு வருடத்திற்குள் நான்கு மடங்கு அதிகமாக இருப்பதால், பாதை தெளிவாக உள்ளது. AI முகவர்கள் ஃப்ரீலான்ஸ் வேலைக்காக போட்டியிடுவார்களா என்பது இனி கேள்வி அல்ல, ஆனால் மீதமுள்ள இடைவெளியை எவ்வளவு விரைவாக மூடுவார்கள்.

AIக்கு முன்னால் இருங்கள்

சமீபத்திய AI செய்திகள், பகுப்பாய்வு மற்றும் முன்னேற்றங்கள் - அனைத்தையும் ஒரே இடத்தில் பெறுங்கள்.

மேலும் AI செய்திகளைப் படிக்கவும் →