Anthropic's Claude Opus 5 ஆனது ARC-AGI-3 அளவுகோலில் ஆதிக்கம் செலுத்திய பிறகு OpenAI பின்வாங்குகிறது, அதன் சொந்த GPT-5.6 Sol மாடல் 38.3 சதவிகிதம் வெற்றியைக் காட்டும் முடிவுகளை வெளியிடுகிறது - நீங்கள் அதிகாரப்பூர்வ சோதனைக் கருவியை விட OpenAI இன் விருப்பமான அமைப்புகளைப் பயன்படுத்தினால்.
ஜூலை 30, 2026 அன்று நடந்த சர்ச்சை, AI மதிப்பீட்டில் வளர்ந்து வரும் சிக்கலின் இதயத்தை வெட்டுகிறது: வரையறைகள் இனி ஒரு மாதிரியை மட்டும் அளவிடுவதில்லை, ஆனால் முழு தொழில்நுட்ப சாரக்கட்டுமே அதைச் சுற்றி மூடப்பட்டிருக்கும். சமீபத்திய AI வளர்ச்சிகள் மற்றும் மாடல் வெளியீடுகளின் ஆழமான பகுப்பாய்வுக்காக, AI Buzz Wire கதையைக் கண்காணிக்கிறது.
எண்கள் மற்றும் கேட்ச்
GPT-5.6 Sol ARC-AGI-3 இல் 38.3 சதவீதத்தை எட்டுகிறது என்று OpenAI அறிவித்தது, இது Anthropic's Claude Opus 5 ஐக் கடந்தது, இது 30.2 சதவிகிதம் பெற்றுள்ளது. எச்சரிக்கை குறிப்பிடத்தக்கது: 38.3 சதவீத எண்ணிக்கையானது OpenAI இன் பதில்கள் API இன் இரண்டு குறிப்பிட்ட அம்சங்களைச் சார்ந்துள்ளது.
முதலாவது தக்கவைக்கப்பட்ட பகுத்தறிவு, இது மாதிரியின் சிந்தனைச் சங்கிலியை ஒவ்வொரு செயலுக்கும் பிறகு நிராகரிப்பதற்குப் பதிலாக படிகளுக்கு இடையில் பாதுகாக்கிறது. இரண்டாவது காம்பாக்ஷன், இது பழைய சூழலை துண்டிப்பதற்குப் பதிலாக சுருக்கமாகச் சொல்கிறது, இது மாதிரியானது முந்தைய பகுத்தறிவை இழக்காமல் நீண்ட சிக்கல்களில் தொடர்ந்து செயல்பட அனுமதிக்கிறது.
ARC பரிசின் உத்தியோகபூர்வ தரப்படுத்தப்பட்ட சேணம் மூலம் இயக்கவும் - இது வேண்டுமென்றே வழங்குநர்-குறிப்பிட்ட அமைப்புகளைத் தவிர்த்து, ஆப்பிள்-டு-ஆப்பிள் ஒப்பீடுகளை உறுதிப்படுத்துகிறது - GPT-5.6 Sol வெறும் 7.8 சதவீதத்தை நிர்வகிக்கிறது. காரணம், ஓபன்ஏஐ வாதிடுகிறது, உத்தியோகபூர்வ அமைப்பு ஒவ்வொரு அடியிலும் மாதிரியின் பகுத்தறிவை நிராகரிக்கிறது, நீடித்த பல-படி சிந்தனை தேவைப்படும் பணிகளின் செயல்திறனைக் குறைக்கிறது.
தூய்மைக்காக கட்டப்பட்ட ஒரு அளவுகோல்
ARC-AGI-3 ஆனது François Chollet மற்றும் ARC பரிசுக் குழுவால் வடிவமைக்கப்பட்டது, இது இதுவரை கண்டிராத புதிய பகுத்தறிவு புதிர்களைத் தீர்க்கும் ஒரு மாதிரியின் திறனை ஆராய்வதற்காக வடிவமைக்கப்பட்டது - மனப்பாடம் செய்யப்பட்ட அறிவைக் காட்டிலும் பொது நுண்ணறிவு சோதனை. ஒப்பீடுகளை நியாயமானதாக வைத்திருக்க, அதிகாரப்பூர்வ சேணம் வேண்டுமென்றே வழங்குநர்-குறிப்பிட்ட அம்சங்களை அகற்றி, நடுநிலை சூழலில் மூல மாதிரி திறனை அளவிடுகிறது.
இந்த நடுநிலைமை ஒரு ஊனமாக மாறும் என்பது OpenAI இன் எதிர்வாதம். க்ளாட் ஏபிஐ ஏற்கனவே வழங்கிய திறன்களைக் கொண்டிருக்காத பழைய "ஓப்பன்ஏஐ-ஸ்டைல் கம்ப்ளீஷன்ஸ் ஏபிஐ"யை அதிகாரப்பூர்வ சேணம் நம்பியிருப்பதாக நிறுவனம் வாதிடுகிறது, அசல் ஒப்பீட்டில் ஆந்த்ரோபிக்குடன் ஒப்பிடும்போது ஓபன்ஏஐ ஒரு கட்டமைப்பு பாதகமான நிலையில் திறம்பட வைக்கிறது.
சாராம்சத்தில், OpenAI கூறுகிறது: நீங்கள் எங்கள் மாதிரியை ஒரு கையை பின்னால் கட்டிக்கொண்டு அளந்தீர்கள்.
Chollet இன் பதில்
ARC பரிசு இணை நிறுவனர் François Chollet இரண்டு வகையான சோதனை அமைப்புகளுக்கு இடையே ஒரு தெளிவான கோட்டை வரைந்து பதிலளித்தார். "பெஞ்ச்மார்க்கைத் தீர்க்க தனிப்பயனாக்கப்பட்ட அல்லது பெஞ்ச்மார்க் வடிவமைப்பைப் பற்றிய அறிவைக் கொண்டிருக்கும்" ஹார்னெஸ்கள் வரம்பற்றவை என்று அவர் கூறினார். ஆனால் "ARC-AGI-3க்காக உருவாக்கப்படாத மற்றும் அனைத்து API பயனர்களுக்கும் கிடைக்கும்" பொது-நோக்க API அமைப்புகள் நியாயமான விளையாட்டு.
இதன் விளைவாக, ARC பரிசின் சொந்த GPT-5.6 Sol ஸ்கோர் OpenAIக்கு பாதகத்தை ஏற்படுத்தியது என்று Chollet ஒப்புக்கொண்டார். "OpenAI உடன் தங்கள் மாடல்களை எப்படிச் சிறப்பாகச் சோதிப்பது என்பது பற்றி, குறிப்பாகச் சுருக்கத்தைப் பொறுத்தவரையில்" நிறுவனம் முன்னும் பின்னுமாக பலவற்றைக் கொண்டுள்ளது என்று அவர் குறிப்பிட்டார், மேலும் "பதிலைக் கண்டுபிடிக்கத் தொடங்கும்" நிறுவனத்தை வரவேற்றார்.
Chollet ஒரு மீதமுள்ள கவலையை கொடியிட்டார். வெவ்வேறு அமைப்புகளைப் பயன்படுத்தும் வெவ்வேறு வழங்குநர்கள் "ஒரு சாத்தியமான சமநிலை சிக்கல்" என்று அவர் அழைத்ததை உருவாக்குகிறார்கள் - ஆனால் "அமைப்புகள் மற்றும் செலவு தெளிவாகத் தெரிவிக்கப்படும் வரை" ஏற்றுக்கொள்ளத்தக்கதாக அவர் கருதுகிறார்.
லீடர்போர்டைத் தாண்டி இது ஏன் முக்கியமானது
எபிசோட் ஒரு பதற்றத்தை அடிக்கோடிட்டுக் காட்டுகிறது, இது AI தொழில்துறை எவ்வாறு முன்னேற்றத்தை மதிப்பிடுகிறது என்பதை மறுவடிவமைக்கிறது. மாடல்கள் தனித்த அமைப்புகளாக இல்லாமல் அம்சம் நிறைந்த APIகள் மூலம் அதிகளவில் பயன்படுத்தப்படுவதால், ஒரு மாதிரியின் உள்ளார்ந்த திறன் மற்றும் அதைச் சுற்றியுள்ள பொறியியல் ஆகியவற்றுக்கு இடையேயான கோடு மங்கலாகிறது. சாரக்கட்டுகளைப் புறக்கணிக்கும் ஒரு அளவுகோல் நிஜ-உலக செயல்திறனைக் குறைத்து மதிப்பிடலாம்; அதைத் தழுவிய ஒன்று சோதனையை விளையாடுவதற்கு நிறுவனங்களுக்கு வெகுமதி அளிக்கலாம்.
ARC-AGI-3 விவாதம் கடைசியாக இருக்க வாய்ப்பில்லை. நிறுவப்பட்ட அளவுகோல்களின் உச்சியில் இருக்கும் எல்லை மாதிரிகள், நியாயமான அளவீடாக எதைக் கணக்கிடுகிறது - மற்றும் யாருடைய சேணம் தரநிலையை அமைக்கிறது என்பதில் கருத்து வேறுபாடுகள் தீவிரமடையும்.
AIக்கு முன்னால் இருங்கள்
மாதிரிகள், வரையறைகள் மற்றும் அவற்றை உருவாக்கும் ஆய்வகங்கள் பற்றிய பிரேக்கிங் AI செய்தி ஐப் பின்பற்ற விரும்புகிறீர்களா? AI Buzz Wire உங்களை உள்ளடக்கியுள்ளது.
மேலும் AI செய்திகளைப் படிக்க