என்விடியா ஆராய்ச்சியாளர்கள் ஏஜென்ட் சிஸ்டத்தை உருவாக்கியுள்ளனர், இது ஆந்த்ரோபிக்கின் கிளாட் ஓபஸ் 5 ஐ ARC-AGI-3 இல் சரியான 100% மதிப்பெண்ணுக்குத் தள்ளியது, இது AI இல் மிகவும் தேவைப்படும் ஊடாடும் பகுத்தறிவு அளவுகோல்களில் ஒன்றாகும் - அதே மாதிரியைப் பயன்படுத்தி அது சொந்தமாக இயங்கும் போது 30% மதிப்பெண்களைப் பெறுகிறது. என்விடியா தொழில்நுட்ப வலைப்பதிவில் வெள்ளிக்கிழமை வெளியிடப்பட்ட முடிவு, ஒரு எல்லை மாதிரியைச் சுற்றியுள்ள மென்பொருளானது மாதிரியைப் போலவே முக்கியமானது என்பதற்கு இன்னும் வலுவான சான்றாகும். [சமீபத்திய AI மேம்பாடுகளை] (https://aibuzzwire.news) கண்காணிக்கும் எவருக்கும், ஏஜென்டிக் AI இன் போட்டி நன்மைகள் உண்மையில் வாழும் இடத்தின் மாற்றத்தைக் குறிக்கிறது.

இந்த அமைப்பு AVO என அழைக்கப்படுகிறது, இது முகவர் மாறுபாடு ஆபரேட்டர்களுக்கு சுருக்கமானது, மேலும் இது நீண்ட அடிவான தன்னாட்சி முகவர்களுக்கான பொது-நோக்கக் கட்டமைப்பை எடுத்துக்கொண்டது - AI இது ஒரு ப்ராம்ட்க்கு பதிலளிப்பதற்குப் பதிலாக மணிநேரம் அல்லது நாட்கள் பணியில் இருக்க முடியும். ARC-AGI-3 பொதுத் தொகுப்பில், AVO அனைத்து 25 கேம் சூழல்களிலும் 100.00 RHAE மதிப்பெண்ணைப் பதிவுசெய்தது, Claude Opus 5 ஐ அதன் பின்தள மாதிரியாகப் பயன்படுத்தி 6,624 சூழல் செயல்களில் அனைத்து 183 நிலைகளையும் நிறைவு செய்தது.

ARC-AGI-3 உண்மையில் என்ன சோதனை செய்கிறது

ARC-AGI-3 என்பது ARC பரிசு அறக்கட்டளையால் உருவாக்கப்பட்ட ஒரு ஊடாடும் பகுத்தறிவு அளவுகோலாகும். ஒரு ஏஜென்ட் எந்த அறிவுரையும் இல்லாமல், குறிப்பிடப்பட்ட விதிகள் மற்றும் குறிப்பிடப்பட்ட இலக்கு எதுவுமின்றி அறிமுகமில்லாத, விளையாட்டு போன்ற சூழல்களில் கைவிடப்படுகிறார். இது சோதனை மற்றும் பிழை மூலம் ஆராய்ந்து, சூழல் எவ்வாறு செயல்படுகிறது என்பதை ஊகிக்க வேண்டும், "வெற்றி" என்றால் என்ன என்பதைக் கண்டறிந்து, படிப்படியாக கடினமான நிலைகளில் முன்னேறும் அளவுக்கு திறமையாக செயல்பட வேண்டும்.

பெஞ்ச்மார்க்கின் ஸ்கோரிங் மெட்ரிக், ரிலேட்டிவ் ஹ்யூமன் ஆக்ஷன் எஃபிஷியன்சி (RHAE), முதல் முறை மனித வீரர்களுடன் ஒப்பிடும்போது, ​​முகவர் எவ்வளவு சில செயல்களை வீணடிக்கிறார் என்பதோடு, பணியை முடிப்பதை ஒருங்கிணைக்கிறது. இது நீடித்த சுயாட்சியின் மிருகத்தனமான சோதனையாக ஆக்குகிறது: ஏஜென்ட் தான் கற்றுக்கொண்டதை நினைவில் வைத்துக் கொள்ள வேண்டும், தவறுகளிலிருந்து மீண்டு வர வேண்டும், மேலும் அதன் செயல்களை முழு ஓட்டத்திலும் கவனமாக பட்ஜெட் செய்ய வேண்டும்.

என்விடியாவின் தலைப்பு எண் ஒரு ஒப்பீட்டிலிருந்து சூழலைப் பெறுகிறது. க்ளாட் ஓபஸ் 5 ஐப் பயன்படுத்திய முந்தைய நேரடி-இன்டராக்ஷன் சேனலான VISTA, 7,542 சுற்றுச்சூழல் நடவடிக்கைகளில் அதே 183 பொது-தொகுப்பு நிலைகளை நிறைவு செய்தது. என்விடியாவின் வலைப்பதிவு இடுகையின்படி, வேலையை முடிக்க AVO க்கு சுமார் 12% குறைவான செயல்கள் தேவைப்பட்டன.

GPU கர்னல்கள் முதல் தெரியாத கேம்கள் வரை

AVO புதிர்களுக்காக உருவாக்கப்படவில்லை. என்விடியா முதலில் GPU-கர்னல் தேர்வுமுறையின் கட்டமைப்பை நிரூபித்தது, சிறிய குறியீடு மாற்றங்கள் கணிக்க முடியாத வழிகளில் சரியான தன்மை, நினைவக நடத்தை மற்றும் செயல்திறன் ஆகியவற்றை உடைக்கும் டொமைன். ஒரு கவன-கர்னல் ஆய்வில், AVO ஏழு நாட்கள் தொடர்ந்து இயங்கியது, 500 க்கும் மேற்பட்ட தேர்வுமுறை திசைகளை ஆராய்ந்தது மற்றும் 40 கர்னல் பதிப்புகளை உருவாக்கியது. NVIDIA DGX B200 சிஸ்டங்களில், இதன் விளைவாக உருவான மல்டிஹெட் அட்டென்ஷன் கர்னல்கள் cuDNN ஐ 3.5% வரையும், FlashAttention-4 ஐ 10.5% வரையும் விஞ்சியது. ஏஜென்ட் அதன் உருவான கர்னலை சுமார் 30 நிமிட கூடுதல் தன்னாட்சி வேலையில் குழுவான வினவல் கவனத்திற்கு மாற்றியமைத்தார்.

அதே மைய வளையம் - ஆய்வு செய்தல், திட்டமிடுதல், செயல்படுத்துதல், சோதனை செய்தல், மதிப்பீடு செய்தல் - பின்னர் ARC-AGI-3 இல் பணி இடைமுகம் மட்டும் மாற்றப்பட்டது. இரண்டு வழிமுறைகள் மேற்கொள்ளப்பட்டன. முதலாவது நிரந்தர நினைவகம், இது முந்தைய செயலாக்கங்கள், மதிப்பீட்டு முடிவுகள், கம்பைலர் மற்றும் ப்ரொஃபைலர் வெளியீடுகள் மற்றும் திரட்டப்பட்ட பகுத்தறிவு ஆகியவற்றைச் சேமிக்கிறது, எனவே முகவர் புதிதாக சூழலை மீண்டும் உருவாக்குவதற்குப் பதிலாக அதன் தற்போதைய நிலையில் இருந்து தொடரலாம். இரண்டாவதாக ஒரு மேற்பார்வையாளர், இரண்டாவது முகவர் ஒட்டுமொத்தப் பாதையைக் கவனித்து, முன்னேற்றம் தடைபடும்போது தலையிடுகிறார்.

மேற்பார்வையாளர் திருப்புமுனை

TechCrunch, Nvidia இன் Adel El Hallakஐ நேர்காணல் செய்தது, நிறுவனத்தின் AI பிரிவின் துணைத் தலைவர் "ஏஜென்ட் திசையை விட்டு வெளியேறும்போது அல்லது முட்டுக்கட்டைக்கு வழிவகுக்கும் பாதையை ஆராயத் தொடங்கும் போது அல்லது அது முன்பு சென்ற பாதையை மீண்டும் ஆராயத் தொடங்கும் போது, ​​​​இது கிட்டத்தட்ட ஒரு CEO போல் செயல்படுகிறது," என்று எல் ஹல்லக் வெளியீட்டிற்கு தெரிவித்தார்.

செயல்திறன் இடைவெளி அப்பட்டமாக உள்ளது. என்விடியாவின் சோதனையில் Claude Opus 5 ஒரு அதிநவீன சேணம் இல்லாமல் ARC-AGI-3 இல் 30% மதிப்பெண்களை நிர்வகித்தது - சோதனை செய்யப்பட்ட வெற்று மாதிரிகளில் சிறந்த முடிவு, ஆனால் எங்கும் முழு ஓட்டத்திற்கு அருகில் இல்லை. OpenAI இன் மாடல்கள் பெஞ்ச்மார்க்கில் 10% க்கும் குறைவான மதிப்பெண்களைப் பெற்றுள்ளன, மேலும் நிறுவனம் கடந்த மாதம் தனது சொந்த ஆராய்ச்சியை வெளியிட்டது, இரண்டு சேணம் அமைப்புகளை மாற்றுவது அதன் மதிப்பெண்களை மூன்று மடங்காக உயர்த்தியது. AVO அடைந்த 100% க்கு அருகில் எந்த மாதிரி-மட்டும் உள்ளமைவு வரவில்லை.

குறிப்பிடத்தக்க வகையில், AVO உள்ளமைவு ஒரு உரை-மட்டும் முறையில் இயங்கியது: ஒவ்வொரு அவதானிப்பும் சரியான 64x64 உரை கட்டமாக வழங்கப்பட்டது, மாதிரிக்கு படங்கள் அல்லது பட டோக்கன்கள் எதுவும் அனுப்பப்படவில்லை. பகுத்தறியும் சக்தி மாதிரியைச் சுற்றியுள்ள வளையத்திலிருந்து வந்தது, மல்டிமாடல் உணர்விலிருந்து அல்ல.

தொழில் ஏன் பந்தயம் கட்டுகிறது

ஏஜென்ட் உள்கட்டமைப்பு, மூல மாதிரி திறன் அல்ல, தன்னாட்சி AIக்கான தற்போதைய இடையூறாக உள்ளது என்பதற்கான ஆதார அலைகளுக்கு மத்தியில் இந்த கண்டுபிடிப்பு நிலம். டேட்டாபிரிக்ஸ் ஜூலையில் தரப்படுத்தல் ஆராய்ச்சியை வெளியிட்டது, சேணம் செயல்திறன் மற்றும் செலவு இரண்டையும் வியத்தகு முறையில் பாதிக்கிறது என்பதைக் காட்டுகிறது. "நீங்கள் ஒரே மாதிரியை ஆனால் வெவ்வேறு சேணங்களைத் தேர்ந்தெடுக்கலாம், மேலும் நீங்கள் தவறான சேணத்தைப் பயன்படுத்தினால் கணிசமாக அதிக விலை கிடைக்கும்" என்று டேட்டாபிரிக்ஸ் தலைமை நிர்வாக அதிகாரி அலி கோட்சி டெக் க்ரஞ்சிடம் கூறினார். "அதுவே உங்கள் செலவை 2 மடங்கு அதிகரிக்கும்."

எல் ஹல்லாக் என்விடியாவின் பரந்த வாதத்தை திறந்த தன்மையின் அடிப்படையில் வடிவமைத்தார். "ஓப்பன் ஏஜென்ட் ஸ்டாக் வைத்திருப்பதை நாங்கள் நம்புகிறோம் - அங்கு நீங்கள் சேணம் முழுவதும், உள்கட்டமைப்பு முழுவதும், இயக்க நேரம் முழுவதும் கட்டுப்பாட்டைக் கொண்டிருக்கிறீர்கள் - இது சுற்றுச்சூழல் அமைப்பை முன்னோக்கி மற்றும் பாதுகாப்பாக கொண்டு செல்ல எங்களுக்குத் தேவையானது" என்று அவர் கூறினார். என்விடியா அதன் NeMo பிராண்டின் கீழ் திறந்த அளவிலான சேணம் தொழில்நுட்பத்தை கொண்டுள்ளது, மேலும் AVO ஆராய்ச்சி arXiv இல் ஆவணப்படுத்தப்பட்டுள்ளது.

வரலாற்றுடன் ஒரு அளவுகோல்

ARC-AGI-3 எல்லை-ஆய்வகப் போட்டியின் ஃப்ளாஷ் பாயிண்டாக மாறியுள்ளது. OpenAI முன்பு அதன் GPT-5.6 Sol மாடலுக்கு பெஞ்ச்மார்க்கில் வலுவான முடிவுகளைக் கூறியது, பயன்படுத்தப்பட்ட மதிப்பீட்டு அமைப்புகளை ஆய்வு செய்தது. என்விடியாவின் முடிவு அந்த விவாதத்தை ஒரு வகையில் புறக்கணிக்கிறது - இது ஒரு சிறந்த மாடலைக் கோரவில்லை, ஏற்கனவே உள்ள ஒன்றைச் சுற்றியுள்ள சிறந்த-பொறியியல் முகவர் மட்டுமே.

டெவலப்பர்கள் மற்றும் நிறுவனங்களை உருவாக்கும் முகவர் தயாரிப்புகளுக்கான செய்தி நேரடியானது: மாதிரி தேர்வு இன்னும் முக்கியமானது, ஆனால் சிஸ்டம் வடிவமைப்பு இப்போது எல்லை மாதிரியானது எல்லைப்புற முடிவுகளை வழங்குகிறதா என்பதை தீர்மானிக்கிறது. என்விடியா சொல்வது போல், ஒரு மாதிரியை மதிப்பிடுவது ஒரு முகவரை மதிப்பிடுவதைப் போன்றது அல்ல - மேலும் 2026 இன் பெஞ்ச்மார்க் அட்டவணைகள் சாரக்கட்டையை உருவாக்கும் பொறியாளர்களுக்கு பெருகிய முறையில் வெகுமதி அளிக்கின்றன.

AIக்கு முன்னால் இருங்கள்

முகவர் கட்டமைப்புகள் முன்னெப்போதையும் விட வேகமாக நகர்கின்றன, மேலும் ஒரு நல்ல சேணத்திற்கும் கெட்டதற்கும் இடையிலான இடைவெளி இப்போது பெஞ்ச்மார்க் புள்ளிகளிலும் உண்மையான டாலர்களிலும் அளவிடப்படுகிறது. AI Buzz Wire ஐப் பின்தொடரவும் தினசரி, மூல-சரிபார்க்கப்பட்ட AI ஆராய்ச்சி, வரையறைகள் மற்றும் தயாரிப்பு வெளியீடுகளுக்கு.

மேலும் AI ஆராய்ச்சி செய்திகளைப் படிக்கவும் →