தரப்படுத்தல் நிறுவனமான செயற்கை பகுப்பாய்வு செப்டம்பர் 4, 2026 அன்று அதன் நுண்ணறிவு குறியீட்டின் பதிப்பு 4.2 ஐ வெளியிட்டது, இது எல்லைப்புற AI மாதிரிகள் எவ்வாறு அளவிடப்படுகிறது என்பதை மறுவேலை செய்யும் இடைக்கால புதுப்பிப்பு - மேலும் புதிய லீடர்போர்டின் படி, ஆந்த்ரோபிக்ஸ் கிளாட் ஃபேபிள் 5.1 முதல் இடத்தைப் பிடித்துள்ளது. சோல்.
ஜனவரியில் Index v4 தொடங்கப்பட்ட எட்டு மாதங்களுக்குப் பிறகு இந்த புதுப்பிப்பு வந்துள்ளது, சமீபத்திய எல்லை வெளியீடுகளின் வேகத்திற்கு நிறுவனம் காரணமாகும். "கடந்த வாரங்களில் எல்லைப் பகுதி மிக விரைவாக நகர்வதால், எங்களின் குறியீடு எப்போதும் போலவே பொருத்தமானதாகவும் பயனுள்ளதாகவும் இருப்பதை உறுதிசெய்ய உடனடி இடைக்கால புதுப்பிப்பை வழங்குவது முக்கியம் என்று நாங்கள் கருதுகிறோம்" என்று நிறுவனம் தனது அறிவிப்பில் எழுதியது.
தலைப்பு தரவரிசை
வெளியிடப்பட்ட முடிவுகளின்படி, ஆந்த்ரோபிக்ஸ் கிளாட் ஃபேபிள் 5.1 குறியீட்டில் முன்னணியில் உள்ளது, அதைத் தொடர்ந்து OpenAI இன் GPT-6 அஸ்ட்ரா, GPT-5.6 Sol ஐ விட நான்கு புள்ளிகளை மேம்படுத்தியது. மெட்டா லீடர்போர்டில் மூன்றாவது வலுவான ஆய்வகமாக உள்ளது, அதைத் தொடர்ந்து SpaceXAI, Moonshot/Kimi, Z.AI மற்றும் Google ஆகியவை உள்ளன.
Anthropic மற்றும் OpenAI ஆகியவையும் புதுப்பிக்கப்பட்ட செலவு-திறன் படத்தைப் பகிர்ந்து கொள்கின்றன: இரண்டு நிறுவனங்களும், Meta மற்றும் Z.AI உடன் இணைந்து, குறியீட்டின் "ஒரு பணிக்கான செலவு" Pareto எல்லையை ஆக்கிரமித்துள்ளன.
டோக்கன் செயல்திறனில், செயற்கையான பகுப்பாய்வு GPT-6 அஸ்ட்ராவை "உளவுத்துறை எல்லைக்கு அருகில் உள்ள மற்ற எல்லா மாடல்களையும் விட அதிக டோக்கன் செயல்திறன் கொண்டது" என்று கண்டறிந்தது, Claude Fable 5.1, Grok 4.5 மற்றும் Gemini 3.5 Flash-Lite ஆகியவை வளைவின் இரு முனைகளிலும் அமர்ந்துள்ளன. நிறுவனம் ஒரு துணைப் பகுப்பாய்வில் குறிப்பிட்டது, இருப்பினும், அஸ்ட்ராவின் குறைந்த டோக்கன் பயன்பாடு அதன் அதிக விலையை விட அதிகமாக உள்ளது - இது மூல செயல்திறன் மற்றும் மொத்த செலவு எப்போதும் ஒன்றாக நகராது என்பதை நினைவூட்டுகிறது.
v4.2 இல் என்ன மாறியது
பெஞ்ச்மார்க் கேமிங்கிற்கு எதிரான வேண்டுமென்றே உந்துதல் என்பது மிக முக்கியமான கட்டமைப்பு மாற்றம். AA-Briefcase, AA-Omniscience மற்றும் CritPtக்கான தீர்வுகள் உட்பட - இன்டெக்ஸின் நாற்பது சதவிகிதம் இப்போது தனிப்பட்ட, ஹோல்டு-அவுட் சோதனைத் தொகுப்புகளிலிருந்து வருகிறது. குறியீட்டு v5 இல் இந்த எண்ணிக்கை மேலும் உயரும் என்று நிறுவனம் கூறியது.
இரண்டு புதிய மதிப்பீடுகள் புதுப்பிப்பைத் தொகுத்து வழங்குகின்றன:
- AA-Briefcase, ஒரு தனிப்பட்ட ஹோல்டு-அவுட் சோதனைத் தொகுப்புடன் உள்ள உள்-ஏஜென்டிக் அறிவு வேலை அளவுகோல். மாடல்கள் பல வார தொழில்முறை திட்டங்களில் மதிப்பீடு செய்யப்படுகின்றன, ஒவ்வொன்றும் பல இணைக்கப்பட்ட பணிகள் மற்றும் ஆயிரக்கணக்கான உள்ளீட்டு மூல கோப்புகளுடன், மேலும் சரிபார்க்கக்கூடிய பணி வெற்றி, பகுப்பாய்வுத் தரம் மற்றும் விளக்கக்காட்சி தரம் ஆகியவற்றை உள்ளடக்கிய ரூபிக் ஸ்கோரிங் மற்றும் ஜோடிவரிசை ஒப்பீடு ஆகியவற்றின் மூலம் தரப்படுத்தப்படுகின்றன.
- GDP.pdf, Surge AI ஆல் உருவாக்கப்பட்டது, இது தொழில்முறை ஆவணங்கள் முழுவதும் ஒற்றை-திருப்பு பகுத்தறிவைச் சோதிக்கிறது: 100 PDFகள் பத்து டொமைன்களில் பரவி, 4,592 பக்கங்களில் உரை, அட்டவணைகள், விளக்கப்படங்கள் மற்றும் அடிக்குறிப்புகள் ஆகியவற்றில் ஆதாரங்கள் விநியோகிக்கப்படுகின்றன. 1,275 நிபுணர்கள் எழுதிய அணு அளவுகோல்களுக்கு எதிராக பதில்கள் தரப்படுத்தப்படுகின்றன, மேலும் தலைப்பு ஆல்-பாஸ் ரேட் ஒவ்வொரு நிபந்தனையும் திருப்தி அடைந்தால் மட்டுமே ஒரு பணியை வரவு வைக்கிறது.
ஒரு நீண்ட கால அளவுகோல் வெளியேறும் வழியில் உள்ளது: GPQA டயமண்ட், பட்டதாரி-நிலை அறிவியல் பகுத்தறிவு சோதனையானது, எல்லைப்புற மாதிரிகளால் திறம்பட நிறைவுற்றதால் அகற்றப்பட்டது.
நிறுவனம் அதன் கிரேடிங் உள்கட்டமைப்பை மேம்படுத்தியது, AA-LCR v1.1 ஐ புதிய கிரேடிங் சிஸ்டம் ப்ராம்ட் மற்றும் சரி செய்யப்பட்ட பதில் விசைகளுடன் வெளியிட்டது, GDPval-AA v2 மற்றும் AA-Briefcase ஆகியவற்றிற்கான Elo அளவை மீண்டும் ஆங்கரிங் செய்தது, எனவே புதிய மாடல்கள் வரும்போது மதிப்பீடுகள் நிலையானதாக இருக்காது, மேலும் Scicode-ஐ கடினப்படுத்துகிறது. தோல்வியாகக் கருதப்படுகிறது.
புதிய சோதனைகள் என்ன வெளிப்படுத்துகின்றன
புதிய மதிப்பீடுகளின் முடிவுகள், எல்லைப்புற ஆய்வகங்கள் உண்மையில் எங்கு நிற்கின்றன என்பதற்கான கூடுதல் சித்திரத்தை வழங்குகின்றன.
AA-Briefcase இல், Anthropic's Claude Fable 5.1 மற்றும் Opus 5 முன்னணி, OpenAI இன் GPT-6 Astra மற்றும் Meta's Muse Spark 1.3 ஆகியவற்றைத் தொடர்ந்து. GPT-6 அஸ்ட்ரா அதே மதிப்பீட்டில் GPT-5.6 Sol ஐ விட தோராயமாக 85 Elo புள்ளிகளைப் பெற்றுள்ளது - இது தொடர்ச்சியான OpenAI தலைமுறைகளுக்கு இடையே கணிசமான முன்னேற்றம்.
GDP.pdf இல், படம் புரட்டுகிறது: OpenAI GPT-6 Astra உடன் 33.2% ஆல்-பாஸ் விகிதத்தில் முன்னணியில் உள்ளது, அதைத் தொடர்ந்து GPT-5.6 Sol 28.2% மற்றும் Claude Fable 5.1 26.2%. மானுடவியல் மாதிரிகள் ஒட்டுமொத்த குறியீட்டு மற்றும் முகவர் பணிப் பணிகளில் முன்னணியில் இருந்தாலும், மிகப் பெரிய சூழல்களில் நீண்ட ஆவணத் தொகுப்பு OpenAI இன் புதிய மாடலுக்கான ஒப்பீட்டு பலமாக உள்ளது என்று இந்த வேறுபாடு அறிவுறுத்துகிறது.
ஏன் தனிப்பட்ட சோதனைத் தொகுப்புகள் முக்கியம்
ஹோல்டு-அவுட் மதிப்பீட்டை நோக்கிய மாற்றம் AI தரப்படுத்தலில் ஒரு பரந்த நம்பகத்தன்மை சிக்கலை பிரதிபலிக்கிறது. மாதிரிகள் அதிக பொது சோதனைத் தரவை உள்வாங்கியுள்ளதால், ஆய்வகங்கள் மற்றும் சுயாதீன பார்வையாளர்கள், நன்கு அறியப்பட்ட அளவுகோல்களின் தலைப்பு மதிப்பெண்கள் உண்மையான திறனைக் காட்டிலும் மனப்பாடம் அல்லது இலக்கு பயிற்சியைப் பிரதிபலிக்கின்றன என்பதில் அதிக அக்கறை கொண்டுள்ளனர். அதன் சோதனைத் தொகுப்புகளின் வளர்ந்து வரும் பங்கை தனிப்பட்டதாக வைத்திருப்பதன் மூலமும், அவற்றை அதிக அளவில் எடைபோடுவதன் மூலமும், பொது லீடர்போர்டுகள் இழக்கும் சமிக்ஞையைப் பாதுகாக்க செயற்கை பகுப்பாய்வு முயற்சிக்கிறது.
இன்டெக்ஸ் v5 இன் கூறுகளை "மாதங்களாக" உருவாக்கி வருவதாகவும், சமீபத்திய முக்கிய மாடல் வெளியீடுகளின் மூலம் குறியீட்டை நிலையானதாக வைத்திருக்க வேண்டுமென்றே புதுப்பிப்புகளைத் தடுத்து வருவதாகவும் நிறுவனம் கூறியது. இடைக்கால v4.2 வெளியீட்டிற்கு அப்பால், இது v5 மாற்றத்தை நிறைவு செய்யும் போது, எதிர்காலத்தில் மேலும் அதிகரிக்கும் மேம்படுத்தல்களைத் திட்டமிடுகிறது.
ஃபிரான்டியர் மாடல்களுக்கு இடையே தேர்வு செய்யும் வாங்குபவர்களுக்கு, v4.2 இலிருந்து எடுக்கப்படும் நடைமுறை என்னவென்றால், சந்தையின் மேல் பகுதியானது ஆந்த்ரோபிக் மற்றும் ஓபன்ஏஐ இடையே இரண்டு குதிரைப் பந்தயமாக உள்ளது, மெட்டா இடைவெளியை மூடுகிறது - மேலும் கேமிங்கிற்கு எதிர்ப்புத் தெரிவிக்கும் வகையில் வடிவமைக்கப்பட்ட மதிப்பீடுகள் இப்போது தரவரிசைப் பணிகளை அதிக அளவில் செய்து வருகின்றன. மாதிரித் தேர்வு முடிவுகளைக் கண்காணிக்கும் பயனர்கள், v5 வெளியீடு நெருங்கும்போது சமீபத்திய AI மேம்பாடுகளைப் பின்பற்றலாம்.
AIக்கு முன்னால் இருங்கள்
இது போன்ற பெஞ்ச்மார்க் புதுப்பிப்புகள், தொழில்துறை நீதிபதிகள் எவ்வாறு முன்னேறுகிறார்கள் என்பதை மாற்றியமைக்கிறது. மேலும் AI செய்திகளைப் படிக்கவும் மற்றும் ஒவ்வொரு மாடல் வெளியீட்டிலும் முன்னே இருங்கள்.
மேலும் AI செய்திகளைப் படிக்கவும் →