ARC பரிசு அறக்கட்டளையால் புதன்கிழமை வெளியிடப்பட்ட முடிவுகளின்படி, OpenAI இன் GPT-6 அஸ்ட்ரா, ARC-AGI-3 இல் அதிநவீன முடிவுகளை வெளியிட்டது. அடித்தளத்தின் ஸ்டாண்டர்ட் சேனலின் கீழ், அளவுகோலின் செமி-பிரைவேட் தொகுப்பில், மாடல் 62.7% மதிப்பெண்களைப் பெற்றது, மேலும் கோரிக்கைகளுக்கு இடையில் மாதிரியின் உள் பகுத்தறிவு நிலையைப் பாதுகாக்கும் வழங்குநர் அடாப்டர் சேணம் மூலம் மதிப்பிடும்போது 99.9% மதிப்பெண்களைப் பெற்றது.

ஒரு புதிய சகாப்தத்தின் தொடக்கமாக நிறுவனம் வடிவமைத்துள்ள முதன்மை மாடலான அஸ்ட்ராவின் வரிசைப்படுத்தப்பட்ட வெளியீட்டை OpenAI தொடங்கிய ஒரு நாள் கழித்து முடிவுகள் வந்தன. ஃபிரான்டியர் லேப்கள் டிரேட் பெஞ்ச்மார்க் அடிக்கும் போது ஸ்கோரை வைத்துக்கொள்ள முயற்சிக்கும் வாசகர்களுக்கு, சமீபத்திய AI மேம்பாடுகள் பக்கம் ஒவ்வொரு முக்கிய வெளியீட்டையும் அது நிகழும்போது கண்காணிக்கும்.

இரண்டு ஹார்னஸ்கள், இரண்டு வித்தியாசமான மதிப்பெண்கள்

அஸ்ட்ராவின் இரண்டு தலைப்பு எண்களுக்கு இடையே உள்ள இடைவெளி அறிக்கையில் மிக முக்கியமான விவரம். ARC பரிசு வெவ்வேறு சாதனங்களின் கீழ் முகவர்களை மதிப்பிடுகிறது, மேலும் ஒவ்வொரு மாதிரியும் அதன் சொந்த சூழலில் என்ன செய்ய அனுமதிக்கப்படுகிறது என்பதை மாற்றுகிறது.

ஸ்டாண்டர்ட் சேனலின் கீழ், ஒரு மாதிரியானது சுற்றுச்சூழலின் மூலம் செயல்படும் போது வைத்திருக்க விரும்பும் குறிப்புகளை முன்னோக்கி கொண்டு செல்ல முடியும். அந்த அமைப்பின் மூலம், அதிகபட்ச பகுத்தறிவு முயற்சியில் அஸ்ட்ரா 62.7% மதிப்பெண்களைப் பெற்றது, மதிப்பீட்டு ஓட்டத்திற்கான மொத்த செலவில் $26,098. எதிர் முனையில், பகுத்தறிவுடன் அதே சேனலை இயக்குவது வெறும் 35.2% மட்டுமே உற்பத்தி செய்தது - $49,791 - அதிக விலை - $49,791 - ஏனெனில் மாடலுக்கு முன்னேற்றம் அடைய இன்னும் பல செயல்கள் தேவைப்பட்டன.

வழங்குநர் அடாப்டர் சேணம் மிகவும் தாராளமானது: இது கோரிக்கைகளுக்கு இடையே மாதிரியின் ஒளிபுகா பகுத்தறிவு நிலையைப் பாதுகாக்கிறது மற்றும் நீண்ட உரையாடல்களுக்கு சுருக்கத்தைப் பயன்படுத்துகிறது, அஸ்ட்ரா முந்தைய வேலையை மீண்டும் பயன்படுத்த அனுமதிக்கிறது. அந்த சேனலின் கீழ், அஸ்ட்ரா $18,817 க்கு அதிக பகுத்தறிவு முயற்சியில் 99.9% மற்றும் அதிகபட்ச முயற்சியில் 98.6% $17,332. குறைந்த பகுத்தறிவு அமைப்பு கூட 96.7% ஐ எட்டியது.

வேறு வார்த்தைகளில் கூறுவதானால், ஒரு பகுதி மதிப்பெண் மற்றும் கிட்டத்தட்ட சரியான ஒன்றுக்கு இடையேயான வேறுபாடு மூலத் திறன் மட்டுமல்ல - இது மாதிரியின் வேலை நிலை படிகளுக்கு இடையில் எவ்வளவு உயிர்வாழும்.

செயல் திறனில் மனிதர்களை அடிப்பது

ARC-AGI-3 நாவல், சுருக்கம், திருப்பு-அடிப்படையிலான விளையாட்டு சூழல்களைச் சுற்றி உருவாக்கப்பட்டுள்ளது. முகவர்கள் அறிவுறுத்தல்கள் இல்லாமல் ஆராய வேண்டும், உலகம் எவ்வாறு செயல்படுகிறது என்பதை ஊகிக்க வேண்டும், அரிதான வெகுமதிகளிலிருந்து இலக்குகளை அடையாளம் காண வேண்டும் மற்றும் பல-படி செயல்களைத் திட்டமிட வேண்டும். சுற்றுச்சூழல்கள் அளவீடு செய்யப்படுகின்றன, இதனால் மனிதர்கள் அவற்றில் 100% தீர்க்க முடியும், இது மனித செயல்திறனை அடிப்படை நடவடிக்கைகளுக்கு எதிரான அடிப்படையாக ஆக்குகிறது.

அஸ்ட்ரா பெரும்பாலான நிலைகளைத் தீர்க்கவில்லை - அது திறமையாக அவற்றைத் தீர்த்தது. ARC பரிசின் படி, 96% நிலைகளில் சராசரியாக சோதிக்கப்பட்ட மனிதனை விட குறைவான செயல்களை இந்த மாதிரி பயன்படுத்தியது, இது செட் முழுவதும் செயல் திறனில் மனித அடிப்படையை மிஞ்சியது.

ஒப்பீட்டின் பொருளாதாரம் அப்பட்டமானது. மனித சோதனையில் பங்கேற்பவர்களுக்கு 90 நிமிட அமர்வுக்கு $115 மற்றும் முடிக்கப்பட்ட ஒரு விளையாட்டுக்கு $5 வழங்கப்பட்டது, முயற்சித்த விளையாட்டிற்கு தோராயமாக $12.78. ஒரு முழு அஸ்ட்ரா மதிப்பீடு ரன், கட்டமைப்பு சார்ந்து ஐந்து புள்ளிவிவரங்கள் செலவாகும். ஆனால் ARC பரிசு ஒரு எதிர்மறையான சுருக்கத்தைக் குறிப்பிட்டது: அதிக பகுத்தறிவு முயற்சி பொதுவாக குறைவாக செலவாகும், ஏனெனில் அஸ்ட்ரா கேம்களை குறைவான செயல்களில் தீர்த்து, ஒரு ஓட்டத்திற்கு எரிக்கப்படும் மொத்த மாதிரி அழைப்புகள் மற்றும் டோக்கன்களின் எண்ணிக்கையைக் குறைத்தது.

அதன் சொந்த மொழியைக் கட்டமைக்கும் ஒரு மாதிரி

மதிப்பெண்களுக்கு அப்பால், குழு கவனித்த ஒரு தரமான நடத்தையை ARC பரிசு முன்னிலைப்படுத்தியது. அஸ்ட்ரா தொடர்ந்து அறிமுகமில்லாத சூழல்களை கச்சிதமான குறியீட்டு உலக மாதிரிகளாக மாற்றியது - விளையாட்டு இயக்கவியலை தருக்க விதிகளாகக் குறிப்பிடுகிறது, மேலும் அதன் சொந்த டொமைன்-குறிப்பிட்ட சுருக்கெழுத்தை உருவாக்கி நிலை மற்றும் செயல்களைத் திட்டமிடுகிறது.

துல்லியமாக ARC-AGI-3 திறன் ஆய்வு செய்ய வடிவமைக்கப்பட்டுள்ளது. முந்தைய தலைமுறையினர் புதுமையான வடிவங்களில் திரவப் பகுத்தறிவைச் சோதித்தபோது, ​​மூன்றாம் தலைமுறை முகவரால் இதுவரை பார்த்திராத சூழலில் ஆய்வு, மாதிரி, இலக்குகளை அமைக்க மற்றும் திட்டங்களைச் செயல்படுத்த முடியுமா என்பதைச் சோதிக்கிறது - ARC பரிசு பட்டியலிடப்பட்ட கூறுகள் ஆய்வு, மாடலிங், இலக்கு அமைத்தல் மற்றும் திட்டமிடல் மற்றும் செயல்படுத்தல்.

ஏஜிஐ-யுகப் பின்னணி

பெஞ்ச்மார்க் முடிவுகள் OpenAI இன் அதிகபட்ச சொல்லாட்சிகளுக்கு மத்தியில் வந்தன. வியாழன் அறிமுகத்திற்கு முன் ஒரு செய்தியாளர் சந்திப்பில், நிறுவனத்தின் தலைவர் கிரெக் ப்ரோக்மேன், "நாம் இப்போது AGI சகாப்தத்தில் இருக்கிறோம் என்று நினைப்பது நியாயமற்றது அல்ல" என்று கூறினார், அதே நேரத்தில் ஒரு முறையான அறிவிப்பை நிறுத்தாமல், தி நியூ ஸ்டாக்கின் வெளியீட்டின் கவரேஜ் படி. அவர் AGI ஐ ஒரு ஒப்பந்தத் தூண்டுதலைக் காட்டிலும் "மிஷன் கருத்து அல்லது ஆன்மீகக் கருத்து" என்று விவரித்தார்.

ஓபன்ஏஐ ஆய்வாளர் ஐடன் கிளார்க் கூறுகையில், அஸ்ட்ரா நிறுவனம் இன்றுவரை நடத்தும் மிகப்பெரிய பயிற்சியாகும் - டெக்சாஸில் உள்ள ஸ்டார்கேட் தளத்தில் 100,000க்கும் மேற்பட்ட ஜிபியுக்களில் முதன்முதலில் முன் பயிற்சியளிக்கப்பட்டது - மேலும் முதல் ஓபன்ஏஐ வெளியீடு, பயிற்சி செயல்முறையை மேற்பார்வை செய்வதில் முந்தைய மாடல்கள் குறிப்பிடத்தக்க பங்கைக் கொண்டிருந்தன. அணுகல் நிலையிலேயே உள்ளது: பிளஸ், ப்ரோ, பிசினஸ் மற்றும் எண்டர்பிரைஸ் கிடைக்கும் மற்றும் ஏபிஐ மற்றும் ஏடபிள்யூஎஸ் அணுகல் வரவிருக்கும் நாட்களில் உறுதியளிக்கப்படும் டேபிரேக் திட்டத்தில் நிறுவன வாடிக்கையாளர்களுடன் வெளியீடு தொடங்குகிறது.

ஸ்கோரில் உள்ள நட்சத்திரம்

பல முனைகளில் எச்சரிக்கை தேவை. அஸ்ட்ராவின் ARC-AGI-3 செயல்திறன், இரண்டு தலைப்பு எண்கள் காட்டுவது போல, சேணம் உள்ளமைவைப் பெரிதும் சார்ந்துள்ளது, மேலும் மாதிரி நிலையைப் பாதுகாக்கும் தனிப்பயன் சேணங்கள் பெஞ்ச்மார்க் தகராறுகளில் தொடர்ச்சியான சர்ச்சைக்குரிய புள்ளியாக உள்ளது. புதிய ஸ்டேக்கின் வெளியீட்டுப் பகுப்பாய்வு, அஸ்ட்ரா "சிறப்புப் பணிகளில் பெரிய ஆதாயங்களைப் பதிவுசெய்கிறது, ஆனால் அது பிரீமியத்தில் வருகிறது மற்றும் குறியீட்டுப் பொதியைத் தெளிவாக வழிநடத்தாது" - முகவர் புதிர் வரையறைகள் மற்றும் அன்றாட வணிகப் பணிச்சுமைகள் வெவ்வேறு விஷயங்களை அளவிடுகின்றன என்பதை நினைவூட்டுகிறது.

ARC பரிசே, தற்போதைய AI மற்றும் AGI க்கு இடையே உள்ள "எஞ்சிய இடைவெளியை" அளவிடும் பயிற்சியை உருவாக்குகிறது, AGI என்பது ஒரு மனிதனால் செய்யக்கூடிய எந்தவொரு திறமையையும், ஒரு மனிதனால் முடிந்தவரை திறமையாகப் பெறும் திறன் என வரையறுக்கிறது. சாதகமான சூழ்நிலையில் கிட்டத்தட்ட சரியான மதிப்பெண் அந்த இடைவெளியை தானாகவே மூடாது. ஒரு மதிப்பீட்டு ஓட்டத்திற்கு $17,000 முதல் $50,000 வரை, இந்த அளவில் சிறந்த ஆதாரம் உள்ள ஆய்வகங்கள் மட்டுமே அளவுகோலை இயக்க முடியும் - இருப்பினும் ARC பரிசின் செலவுத் தரவு சிறந்த பகுத்தறிவு உண்மையில் மசோதாவைக் குறைக்கும் என்பதைக் காட்டுகிறது.

ஏன் இது முக்கியமானது

செயல் திறன் என்பது ஒப்பீட்டின் உண்மையான புதிய அச்சாகும். ஒவ்வொரு நிலையையும் தீர்க்கும் ஆனால் ஆயிரக்கணக்கான அழைப்புகளை வீணடிக்கும் ஒரு மாதிரியானது, இங்கு அஸ்ட்ரா செய்ததைப் போல செயல்படுவதை விட குறைவான பயனுள்ளது - மற்றும் அதிக விலை கொண்டது: வேண்டுமென்றே ஆராய்வது, கற்றுக்கொண்டதை சுருக்கி, அதில் செயல்படுவது. AGI விவாதத்தைப் பற்றி ஒருவர் என்ன முடிவெடுத்தாலும், ARC பரிசுத் தரவு, எல்லைப்புற முகவர்கள் இப்போது மனிதர்களுடன் புதிய பிரச்சனைகளை தீர்க்க முடியுமா என்பதில் மட்டும் அல்ல, ஆனால் பொருளாதார ரீதியாக எப்படித் தீர்க்கிறார்கள் என்பதைப் பற்றிக் காட்டுகிறது.

AIக்கு முன்னால் இருங்கள்

ஒவ்வொரு பெஞ்ச்மார்க் முடிவு, மாதிரி வெளியீடு மற்றும் பாதுகாப்பு விவாதம், அது நிகழும்போது கண்காணிக்கப்படுகிறது — மேலும் AI செய்திகளைப் படிக்க →