OpenAI இன் GPT-6 அஸ்ட்ரா, குறியீட்டு முறையில் பயனர் நம்பிக்கைச் சிக்கல்களுடன் போராடிக்கொண்டிருக்கலாம், ஆனால் புதிய ரோபாட்டிக்ஸ் அளவுகோலில் இது ஒரு தரமான பாய்ச்சலைப் பற்றி ஆராய்ச்சியாளர்கள் பேசும் எண்களை வெளியிடுகிறது. ஸ்டேஷனரி பெஞ்சில், சாதாரண மேசைப் பொருட்களைச் சுற்றி உருவாக்கப்பட்ட சோதனை, அஸ்ட்ரா 100 பணிகளில் 7ஐ முழுமையாக முடித்தது, அதே சமயம் Ai2 இன் MolmoAct2, அது எதிர்த்த மாதிரி பூஜ்ஜியத்தை நிறைவு செய்தது.

தி டீகோடரால் விவரிக்கப்பட்ட அளவுகோல், ஐந்து மேசை-பொருள் பணிகளில் இரண்டு மாடல்களையும் ஒன்றுக்கொன்று எதிராகப் பிரிக்கிறது - மார்க்கரை அவிழ்ப்பது, காகித கிளிப்களை ஊற்றுவது அல்லது இரண்டு ரோபோ கைகளுக்கு இடையில் ஒரு ஆட்சியாளரைக் கடப்பது. இரண்டு மாடல்களும் 200 சோதனைகளில் ஒரே இரட்டை-கை YAM ரோபோக்களைக் கட்டுப்படுத்துகின்றன, இது வன்பொருள் வேறுபாடுகளிலிருந்து மாதிரித் திறனைத் தனிமைப்படுத்துவதாகும். அனைத்து முடிவுகள், வீடியோக்கள் மற்றும் குறியீடு ஆகியவை GitHub இல் வெளியிடப்பட்டுள்ளன. இது போன்ற கூடுதல் ஆராய்ச்சி கவரேஜுக்கு, எங்கள் AI செய்தி மையம் பார்க்கவும்.

ஆராய்ச்சியாளர்களின் கூற்றுப்படி, ஒரு 'படி மாற்றம்'

கார்னெல் மற்றும் கூகுள் டீப் மைண்டில் உள்ள AI ஆராய்ச்சியாளர் யோவ் ஆர்ட்ஸி, அஸ்ட்ராவின் செயல்திறனை "இடஞ்சார்ந்த பகுத்தறிவில் ஒரு படி மாற்றம்" என்று அழைத்தார் - இந்த வகையான மொழி அளவுகோல் முடிவுகள் அரிதாகவே சம்பாதிக்கின்றன. REMAP எனப்படும் இன்னும் வெளியிடப்படாத அளவுகோலில், அஸ்ட்ரா மனித நிலைக்கு நெருக்கமான துல்லியத்தை அடைகிறது, இருப்பினும் "மற்ற சூழ்நிலைகளில் மனிதர்கள் செய்வதை அஸ்ட்ரா கூட பெறவில்லை" என்று ஆர்ட்ஸி குறிப்பிட்டார்.

அஸ்ட்ராவின் சராசரி முன்னேற்ற மதிப்பெண் 100 இல் 46 ஐ எட்டியது, இது MolmoAct2 க்கான 12 உடன் ஒப்பிடும்போது - தலைப்பு நிறைவு எண்கள் குறிப்பிடுவதை விட முக்கியமான ஒரு இடைவெளி. ரோபாட்டிக்ஸ் பணிகள் பகுதி முன்னேற்றம் மற்றும் முழு வெற்றியின் அடிப்படையில் தரப்படுத்தப்படுகின்றன, மேலும் போட்டியாளரின் சராசரி மதிப்பெண்ணை மூன்று மடங்காக அதிகரிப்பது, ஒரு சில சோதனைகளில் அதிர்ஷ்டத்தால் வெற்றி பெறுவதற்குப் பதிலாக, கையாளுதல் வரிசைகள் மூலம் மாடல் தொடர்ந்து முன்னேறி வருவதைக் குறிக்கிறது.

ஏன் ஸ்பேஷியல் ரீசனிங் திடீரென்று முக்கியமானது

அஸ்ட்ரா எவ்வாறு பயிற்றுவிக்கப்பட்டது என்பதை முடிவு சுட்டிக்காட்டுகிறது. 3D பணிகளில் மாடலின் குறிப்பிட்ட வலிமையுடன் வரிசையாக இருக்கும் பிளெண்டர் காட்சிகள் போன்ற பெரிய அளவிலான 3D தரவுகளில் OpenAI மாடலுக்கு பயிற்சி அளித்ததாக Artzi சந்தேகிக்கிறார். அந்த வாசிப்பு சரியாக இருந்தால், செயற்கையான 3D சூழல்கள் - நிஜ உலக தரவு சேகரிப்பை விட மலிவான மற்றும் பாதுகாப்பானவை - உடல்-உலகத் திறனுக்கான சாத்தியமான பாதையாக மாறி வருகின்றன, இது ரோபாட்டிக்ஸில் நீண்டகால இடையூறுகளில் ஒன்றாகும்.

பெஞ்ச்மார்க்கின் வடிவமைப்பு ரோபாட்டிக்ஸ் மதிப்பீடு எங்கு செல்கிறது என்பதைப் பற்றியும் கூறுகிறது. StationeryBench இன் பணிகள் வேண்டுமென்றே சாதாரணமானவை - மார்க்கரை அவிழ்ப்பது, காகிதக் கிளிப்களை ஊற்றுவது, ஆட்சியாளரை ஒப்படைப்பது - ஏனென்றால் அன்றாட கையாளுதல், சினிமா சாதனைகள் அல்ல, ஆய்வக டெமோக்களை பயனுள்ள இயந்திரங்களிலிருந்து பிரிக்கிறது. 200 சோதனைகளில் ஒரே டூயல்-ஆர்ம் YAM வன்பொருளில் இரண்டு மாடல்களையும் கிரேடிங் செய்து, ஒவ்வொரு வீடியோவையும் வெளியிடுவது, எல்லைப்புற ஆய்வகத்தின் முதன்மையை உள்ளடக்கிய திறன் உரிமைகோரலுக்கான வழக்கத்திற்கு மாறாக வெளிப்படையான அமைப்பாகும்.

MolmoAct2, ஆலன் இன்ஸ்டிடியூட் ஃபார் AI (Ai2) இன் ஒப்பீட்டு மாதிரி, எந்தப் பணியையும் முடிக்காமல் இருப்பது அதன் சொந்த வகையான தரவு: பொது-நோக்க எல்லை மாதிரிகள் மற்றும் நோக்கம்-உருவாக்கப்பட்ட ரோபாட்டிக்ஸ் மாதிரிகள் ஆகியவற்றுக்கு இடையேயான இடைவெளி இனி மூடப்படாது, மாறாக தலைகீழாக மாறுகிறது.

இது OpenAI இன் கூறப்பட்ட லட்சியங்களுடனும் பொருந்துகிறது: நிறுவனம் தனது சொந்த நுகர்வோர் ரோபோக்களை உருவாக்க நீண்ட கால திட்டங்களைக் கொண்டுள்ளது என்று தி டிகோடர் மேற்கோள் காட்டியுள்ளது. பொருள்கள், கைகள் மற்றும் பாதைகள் பற்றி நியாயப்படுத்தக்கூடிய ஒரு எல்லை மொழி மாதிரியானது அந்த சுருதியின் பாதி மென்பொருள் ஆகும். வன்பொருள் பாதி தீர்க்கப்படாமல் உள்ளது, ஆனால் StationeryBench போன்ற வரையறைகள் அந்த கதை எவ்வாறு அளவிடப்படுகிறது.

சூழல்: ஒரு சிக்கலான வாரம் கொண்ட மாதிரி

இதன் விளைவாக OpenAIக்கான விசித்திரமான செய்தி சுழற்சியில் இறங்குகிறது. இந்த பெஞ்ச்மார்க்கின் மையத்தில் உள்ள அதே மாதிரியானது, அறிமுகப்படுத்தப்பட்டதில் இருந்து மந்தமாகிவிட்டது என்ற பயனர் புகார்களை எதிர்கொண்டு வாரத்தை கழித்துள்ளது - OpenAI ஆனது கோடெக்ஸ் பயன்பாட்டு வரம்புகளை மீட்டமைக்கும் முன், தவறான திறன்கள் முதல் தவறான சூழல் பரிசோதனை வரை மூன்று பெயரிடப்பட்ட குறைபாடுகளைக் கண்டறிந்தது. ஆய்வகத்தில் படி-மாற்ற முடிவுகளை வெளியிடும் போது உற்பத்தியில் தடுமாறும் ஒரு மாதிரியானது தற்போதைய AI தொழிற்துறையின் துல்லியமாகும்: திறன் மற்றும் நம்பகத்தன்மை வெவ்வேறு கடிகாரங்களில் முன்னேறி வருகின்றன.

OpenAI இன் சொந்த தலைமை இணைந்த பாதுகாப்பு விவாதத்தின் மத்தியில் இது இறங்குகிறது. பெருகிய முறையில் தன்னாட்சி அமைப்புகளின் கட்டுப்பாட்டை எந்த ஆய்வகமும் தீர்க்கவில்லை என்று நிறுவனத்தின் தலைமை விஞ்ஞானி எச்சரித்துள்ளார், மேலும் ஆந்த்ரோபிக்கின் தலைமை நிர்வாக அதிகாரி எல்லைப்புற வளர்ச்சியை முழுவதுமாக மெதுவாக்குமாறு தொழில்துறைக்கு அழைப்பு விடுத்துள்ளார். இயற்பியல் உலகைக் கையாளும் மாதிரிகளைக் காட்டும் அளவுகோல்கள் - உலகம் எழுதுபொருள்களால் மூடப்பட்ட ஒரு மேசையாக இருந்தாலும் கூட - முன்னேற்றத்தின் வேகம் மேற்பார்வைக்கு அப்பாற்பட்டது என்று அவர்கள் வாதிடும்போது, ​​​​இரு நிர்வாகிகளும் மேற்கோள் காட்டியது.

பாட்டம் லைன்

100ல் முழுமையாக முடிக்கப்பட்ட ஏழு பணிகள் நாளை உங்கள் மேசையில் ரோபோவை வைக்காது. ஆனால் போட்டியாளரின் பூஜ்ஜியத்தில் இருந்து ஏழுக்கு செல்வது, சராசரி முன்னேற்ற மதிப்பெண் மூன்று மடங்கு அதிகமாக உள்ளது, இது இரண்டு ஆண்டுகளுக்கு முன்பு மொழி புரிதலில் திறன் அட்டவணையை மாற்றியமைத்த இடைநிறுத்தமாகும். டெவலப்பர்கள் செலுத்தத் தயாராக இருக்கும் விலையில், அதே மாதிரியானது அந்தத் திறனை, தரநிலைக்கு வெளியே நம்பகத்தன்மையுடன் வழங்க முடியுமா என்பது திறந்த கேள்வி.

AIக்கு முன்னால் இருங்கள்

வரையறைகள், முன்னேற்றங்கள் மற்றும் செயல்படும் இயந்திரங்களை நோக்கிய ஓட்டம் - ஒவ்வொரு நாளும் பின்பற்றப்படுகிறது.

மேலும் AI செய்திகளைப் படிக்கவும் →