AI தொழில் அறிவியல் திறனை எவ்வாறு அளவிடுகிறது என்பதை ஒரு புதிய அளவுகோல் சவால் செய்கிறது, மேலும் அதன் முதல் முடிவுகள் எல்லைப்புற ஆய்வகங்களுக்கு தாழ்மையானவை. டெர்மினல்-பெஞ்ச்-சயின்ஸ் 0.1, இந்த வாரம் ஸ்டான்ஃபோர்ட் பல்கலைக்கழக ஆராய்ச்சியாளர்களால் தொடங்கப்பட்டது மற்றும் பிரபலமான டெர்மினல்-பெஞ்ச் குறியீட்டு அளவுகோலுக்குப் பின்னால் உள்ள குழு, உழைக்கும் விஞ்ஞானிகளால் பங்களிக்கும் உண்மையான அறிவியல் ஆராய்ச்சி பணிப்பாய்வுகளில் AI முகவர்களை மதிப்பீடு செய்கிறது - மற்றும் சோதனை செய்யப்பட்ட வலுவான மாதிரி, Claude Opus 5, Claude Code மூலம் இயங்கி, வெறும் 30% பணிகளை முடித்தது.
அளவுகோலின் அறிவிப்புப் பக்கம் அதன் வழிகாட்டும் கொள்கையை அப்பட்டமாக விவரிக்கிறது: விஞ்ஞானிகள், மாதிரி உருவாக்குநர்கள் அல்லது தரவு விற்பனையாளர்கள் அல்ல, AI இல் அறிவியல் திறனுக்கான பட்டியை அமைக்க வேண்டும். இந்த திட்டம் உலகெங்கிலும் உள்ள ஆராய்ச்சி நிறுவனங்களின் டொமைன் நிபுணர்களுடன் இணைந்து உருவாக்கப்பட்டது, மேலும் அதன் முதல் வெளியீட்டில் வாழ்க்கை அறிவியல், இயற்பியல், பூமி அறிவியல், கணிதம் மற்றும் பொறியியல் ஆகியவற்றில் 70 பணிகள் உள்ளன.
பாடப்புத்தக வரையறைகளிலிருந்து இது எவ்வாறு வேறுபடுகிறது
பெரும்பாலான அறிவியல் AI மதிப்பீடுகள் அறிவை சோதிக்கின்றன: பல தேர்வு கேள்விகள், பாடப்புத்தக சிக்கல்கள், தரப்படுத்தப்பட்ட பயிற்சிகள். டெர்மினல்-பெஞ்ச்-சயின்ஸ் அதற்குப் பதிலாக, உண்மையான ஆராய்ச்சியாளர்களின் நாட்களை நிரப்பும் தொழில்நுட்ப ரீதியாக தேவைப்படும், நேரத்தைச் செலவழிக்கும் பணிப்பாய்வுகளை முகவர்களால் செயல்படுத்த முடியுமா என்பதை அளவிடுகிறது. பணிகள் யதார்த்தமான சூழல்களில் இயங்குகின்றன, மேலும் தரப்படுத்தல் உறுதியான கலைப்பொருட்களை அடிப்படையாகக் கொண்டது: பகுப்பாய்வுகள், உருவகப்படுத்துதல்கள், சான்றுகள், குறியீடு மற்றும் தரவுத் தயாரிப்புகள், நடுவர் மாதிரிகள் அல்லது பல-தேர்வு மதிப்பெண்களைக் காட்டிலும் மீண்டும் உருவாக்கக்கூடிய பணி சார்ந்த சோதனைகள் மூலம் சரிபார்க்கப்படுகிறது.
AI உதவியாளர்கள் அறிவியலுக்கு என்ன செய்ய வேண்டும் என்ற கோட்பாட்டை அந்த வடிவமைப்பு பிரதிபலிக்கிறது. விஞ்ஞானத் தீர்ப்பை மாற்றுவதற்குப் பதிலாக, சிலிகோவில் சோதனைகளை நடத்துதல், தரவைச் செயலாக்குதல், ஆதாரங்களைச் சரிபார்த்தல் - மனித தீர்ப்பு மிகவும் முக்கியத்துவம் வாய்ந்த ஆராய்ச்சியின் பகுதிகளுக்கு விஞ்ஞானிகளை விடுவித்தல்: கேள்விகளை வரையறுத்தல், கருதுகோள்களை உருவாக்குதல், முடிவுகளைத் தொடர்புகொள்வது மற்றும் முடிவுகளைத் தொடர்புகொள்வது போன்றவற்றை முகவர்கள் செயல்படுத்த வேண்டும் என்று வாதிடுகின்றனர்.
திட்டமானது நகரும் இலக்காகவும் வெளிப்படையாகக் கட்டமைக்கப்பட்டுள்ளது. பல அளவுகோல்கள் ஒரு முறை வெளியிடப்பட்டு கைவிடப்பட்டால் - அறிவிப்பு இதை "வெளியிடுவதற்கான காகிதங்கள்" பிரச்சனை என்று அழைக்கிறது - டெர்மினல்-பெஞ்ச்-அறிவியல் ஒரு தொடர்ச்சியான அளவுகோலாக வடிவமைக்கப்பட்டுள்ளது, இது எல்லைக்கு அருகில் உருவாகிறது, வழக்கமான வெளியீடுகள் மாதிரி முன்னேற்றத்திற்கு முன்னதாக மதிப்பீட்டை வைத்திருக்கவும், மாசுபாடு-உந்துதல் மதிப்பெண் பணவீக்கத்தைத் தடுக்கவும் நோக்கமாக உள்ளன.
முதல் லீடர்போர்டு: நம்பகமான ஒரு நீண்ட வழி
இந்த வாரம் ஹேக்கர் செய்திகளை அடைந்தபோது குறிப்பிடத்தக்க கவனத்தை ஈர்த்த v0.1 லீடர்போர்டு, மேலே இருந்து செங்குத்தான வீழ்ச்சியைக் காட்டுகிறது:
- கிளாட் ஓபஸ் 5 (கிளாட் குறியீடு): 30.0%
- GPT-5.6 சோல் (கோடெக்ஸ்): 22.4%
- கிளாட் ஃபேபிள் 5 (கிளாட் குறியீடு): 21.4%
- கிளாட் ஓபஸ் 4.8 (கிளாட் குறியீடு): 10.5%
- GPT-5.6 டெர்ரா (கோடெக்ஸ்): 8.6%
- GLM 5.3 (கிளாட் குறியீடு): 8.1%
- கிமி கே3 (கிளாட் குறியீடு): 7.1%
- Grok 4.6 (Grok Build): 7.1%
- GPT-5.6 லூனா (கோடெக்ஸ்): 3.3%
மென்பொருள் பொறியியலைக் காட்டிலும் விஞ்ஞானப் பணிப்பாய்வுகள் முகவர்களுக்கு கணிசமாக கடினமாக இருப்பதாக முடிவுகள் தெரிவிக்கின்றன, அங்கு அசல் டெர்மினல்-பெஞ்ச் மற்றும் போட்டி குறியீட்டு அளவுகோல்கள் மதிப்பெண்கள் வேகமாக ஏறுவதைக் கண்டன. கிடைக்கக்கூடிய சிறந்த அமைப்பிற்கான 30% தெளிவுத்திறன் விகிதம் என்பது பத்து உண்மையான ஆராய்ச்சிப் பணிகளில் ஏழு, வலுவான சேனலுடன் இணைக்கப்பட்ட ஒரு உயர்மட்ட முகவர் கூட சரிபார்க்கக்கூடிய சரியான வேலையை உருவாக்கத் தவறிவிடுகிறார்.
மாதிரிக் குடும்பங்களுக்குள் பரவுவதும் அறிவுறுத்துகிறது. கிளாட் ஓபஸ் 5 மற்றும் கிளாட் ஓபஸ் 4.8 இடையே உள்ள இடைவெளி - கிட்டத்தட்ட இருபது புள்ளிகள் - மற்றும் ஜிபிடி-5.6 வகைகளான சோல், டெர்ரா மற்றும் லூனா ஆகியவற்றுக்கு இடையே உள்ள இடைவெளி, மூல மாதிரி நுண்ணறிவு மட்டும் அல்ல, மாடல் மற்றும் ஏஜென்ட் சேனலின் இடையிடையே எவ்வளவு விளைவு தரம் சார்ந்துள்ளது என்பதைக் காட்டுகிறது. ஒவ்வொரு உயர் மதிப்பெண் உள்ளீடும் ஒரு ஏஜென்டிக் குறியீட்டு சேனையைப் பயன்படுத்துகிறது (கிளாட் கோட், கோடெக்ஸ், க்ரோக் பில்ட்), சாரக்கட்டு அடிப்படை எடைகளைப் போலவே தீர்க்கமானது என்ற வளர்ந்து வரும் ஒருமித்த கருத்தை வலுப்படுத்துகிறது.
விஞ்ஞானிகள் ஏன் தங்கள் சொந்த பெஞ்ச்மார்க்கை உருவாக்கினார்கள்
அளவுகோலின் கட்டமைப்பானது நுட்பமான நிறுவன வாதத்தைக் கொண்டுள்ளது. "அறிவியலில் பங்குகள் மிக அதிகமாக உள்ளன, மேலும் அதன் அளவுகோல்கள் வெளிப்புற நலன்களை விட விஞ்ஞான சமூகத்தின் முன்னுரிமைகளை பிரதிபலிக்க வேண்டும்" என்று அறிவிப்பு கூறுகிறது. இந்தத் திட்டம் பணிபுரியும் ஆராய்ச்சியாளர்களுக்கு தானாகத் தேவைப்படும் பணிகளை குறியாக்கம் செய்வதற்கான நேரடி பொறிமுறையை வழங்குகிறது - மேலும் சரிபார்க்கக்கூடிய தரநிலைக்கு எதிராக "விஞ்ஞான கண்டுபிடிப்பை துரிதப்படுத்துதல்" என்ற விற்பனையாளர்களின் கூற்றுக்களை வைத்திருக்கும்.
சந்தைப்படுத்துதலுக்கும் யதார்த்தத்திற்கும் இடையிலான இடைவெளி உண்மையான விளைவுகளை ஏற்படுத்துவதால் அது முக்கியமானது. எல்லைப்புற ஆய்வகங்கள் தங்கள் முகவர்கள் சுயாதீனமாக இருக்கும்போது ஆராய்ச்சியை முடுக்கிவிட முடியும் என்று கூறினால், நிபுணர்களால் வடிவமைக்கப்பட்ட மதிப்பீடுகள் ஒற்றை இலக்கத்திலிருந்து 30% வரையிலான தெளிவுத்திறன் விகிதங்கள், நிதி முடிவுகள், பணியமர்த்தல் திட்டங்கள் மற்றும் அந்த உரிமைகோரல்களில் கட்டமைக்கப்பட்ட ஆய்வகக் கொள்கைகள் ஆகியவை பிழையைப் பெறுகின்றன. தொடர்ச்சியான, சமூகத்திற்குச் சொந்தமான வரையறைகள் ஒரு திருத்தம்: அவை தெளிவற்ற உரிமைகோரல்களை மீண்டும் உருவாக்கக்கூடிய எண்களாக மாற்றுகின்றன.
ஆராய்ச்சி நிறுவனங்களுக்கான ஒரு சமிக்ஞை
பல்கலைக்கழகங்கள், தேசிய ஆய்வகங்கள் மற்றும் R&D குழுக்களுக்கு முகவர்களை எப்போது பயன்படுத்த வேண்டும் என்பதை எடைபோடுவதற்கு, தரநிலையானது விற்பனையாளர் டெமோக்களால் செய்ய முடியாத ஒன்றை வழங்குகிறது: நம்பகத்தன்மை வரிசை உண்மையில் எங்கு அமர்ந்திருக்கிறது என்பதை சமூகம் பராமரிக்கும் அளவீடு. பதின்வயதினர் அல்லது இருபதுகளில் ஒரு தீர்மான விகிதம் என்பது, இந்த அமைப்புகள் இன்று ஆய்வுக் குழாய்களின் தன்னாட்சி செயல்பாட்டாளர்களாக இல்லாமல், மறுஆய்வு தேவைப்படும் உதவியாளர்களாக சிறப்பாகக் கருதப்படுகின்றன. பணிப் பிரிவுகள் - வாழ்க்கை, இயற்பியல், பூமி, கணிதம் மற்றும் பொறியியல் அறிவியல்கள் - பொதுவான வரையறைகளை வழக்கமாகக் கவனிக்காத துறைகளில் இருந்து பணிப்பாய்வுகளை பங்களிப்பதற்கான டெம்ப்ளேட்டை டொமைன் நிபுணர்களுக்கு வழங்குகிறது.
பரந்த தொழில் சூழல் ஏன் நேரம் முக்கியமானது என்பதை வலுப்படுத்துகிறது. எல்லைப்புற AI க்கு அறிவியல் பெரிதும் ஊக்குவிக்கப்பட்ட பயன்பாட்டு நிகழ்வுகளில் ஒன்றாக மாறியுள்ளது, ஆய்வகங்கள் பொருட்களைக் கண்டறிதல், புரத அறிவியல் மற்றும் கணிதம் ஆகியவற்றில் பங்களிப்புகளை வழங்குகின்றன. அந்த உரிமைகோரல்களை தணிக்கை செய்வது கடினம்: விஞ்ஞான வெளியீடு சரிபார்க்க மெதுவாக உள்ளது, மேலும் உற்சாகம் நகலெடுப்பதை விட வேகமாக நகரும். உண்மையான பணிப்பாய்வுகளில் சரிபார்க்கக்கூடிய கலைப்பொருட்களை மதிப்பிடும் ஒரு அளவுகோல், ஆராய்ச்சி நிறுவனங்களுக்கு, டெர்மினல்-பெஞ்ச் முதன்முதலில் அதன் பெயரை உருவாக்கிய மென்பொருள் பொறியியலில் உள்ளதைப் போலவே, அறிவியலில் முகவர் முன்னேற்றம் விரைவாகக் கூடுகிறதா என்பதைக் கண்காணிக்க, வெளியீட்டின் மூலம் வெளிப்படுத்தப்பட்ட திறனை ஆர்ப்பாட்ட அரங்கிலிருந்து பிரிக்க ஒரு வழியை வழங்குகிறது.
AI தொழில்துறையைப் பொறுத்தவரை, v0.1 இன் செய்தி இரட்டை முனைகள் கொண்டது. எல்லைப் பகுதி தெளிவாக முன்னேறி வருகிறது - ஓபஸ் 5 இன் 30% கோபுரங்கள் பழைய ஓபஸ் 4.8 இன் 10.5% - ஆனால் உண்மையான ஆய்வகங்களுக்குத் தேவைப்படும் நம்பகத்தன்மையிலிருந்து உச்சவரம்பு வெகு தொலைவில் உள்ளது. வழக்கமான வெளியீடுகள் அந்த இடைவெளியை எவ்வளவு வேகமாக மூடுகிறது என்பதைத் துல்லியமாகக் கண்காணிக்கும் என்று பெஞ்ச்மார்க்கின் வடிவமைப்பாளர்கள் கூறுகின்றனர். ஏஜென்டிக் ஆராய்ச்சிக் கருவிகளில் [வளர்ந்து வரும் AI போக்குகளை] (https://aibuzzwire.news) பார்க்கும் விஞ்ஞானிகள் இப்போது தாங்களாகவே உருவாக்கிய அளவுகோலைக் கொண்டுள்ளனர்.
---
AIக்கு முன்னால் இருங்கள்சமீபத்திய AI செய்திகள், பகுப்பாய்வு மற்றும் முன்னேற்றங்கள் - அனைத்தையும் ஒரே இடத்தில் பெறுங்கள்.
மேலும் AI செய்திகளைப் படிக்கவும் →