Nvidia संशोधकांनी एक एजंट प्रणाली तयार केली आहे ज्याने Anthropic च्या Claude Opus 5 ला ARC-AGI-3 वर परिपूर्ण 100% स्कोअरवर ढकलले, जे AI मधील सर्वात मागणी असलेल्या परस्पर तर्क बेंचमार्कपैकी एक आहे — तेच मॉडेल वापरून जे 30% स्कोअर स्वतः चालवते. Nvidia Technical Blog वर शुक्रवारी प्रकाशित झालेला निकाल हा सर्वात भक्कम पुरावा आहे की फ्रंटियर मॉडेलभोवती गुंडाळलेले सॉफ्टवेअर मॉडेलइतकेच महत्त्वाचे आहे. अद्ययावत AI घडामोडींचा मागोवा घेत असलेल्या प्रत्येकासाठी, एजंटिक AI मधील स्पर्धात्मक फायदा प्रत्यक्षात राहतात त्यामध्ये हे बदल दर्शवते.
एजंटिक व्हेरिएशन ऑपरेटर्ससाठी या सिस्टीमला AVO म्हणतात, आणि दीर्घ-क्षितिज स्वायत्त एजंट्ससाठी Nvidia चा एक सामान्य उद्देश आर्किटेक्चर आहे - AI जे एका प्रॉम्प्टला उत्तर देण्याऐवजी तास किंवा दिवस कामावर राहू शकते. ARC-AGI-3 सार्वजनिक सेटवर, AVO ने सर्व 25 गेम वातावरणात 100.00 RHAE स्कोअर नोंदवला, 6,624 पर्यावरण क्रियांमध्ये क्लॉड ओपस 5 चा बॅकएंड मॉडेल म्हणून सर्व 183 स्तर पूर्ण केले.
ARC-AGI-3 खरोखर काय चाचणी करते
ARC-AGI-3 हा एआरसी प्राइज फाउंडेशनने तयार केलेला परस्पर तर्क बेंचमार्क आहे. एजंटला अपरिचित, खेळासारख्या वातावरणात कोणत्याही सूचना, कोणतेही नमूद केलेले नियम आणि कोणतेही उद्दिष्ट नसताना टाकले जाते. त्याला चाचणी आणि त्रुटीद्वारे एक्सप्लोर करावे लागेल, वातावरण कसे कार्य करते याचा अंदाज लावावा लागेल, "विजय" म्हणजे काय हे शोधून काढावे लागेल आणि नंतर उत्तरोत्तर कठीण स्तरांमधून प्रगती करण्यासाठी पुरेसे कार्यक्षमतेने कार्य करावे लागेल.
बेंचमार्कचे स्कोअरिंग मेट्रिक, रिलेटिव्ह ह्युमन ॲक्शन एफिशिअन्सी (RHAE), प्रथमच मानवी खेळाडूंच्या तुलनेत एजंट किती कमी कृती वाया घालवते यासह कार्य पूर्ण करणे एकत्र करते. यामुळे ती शाश्वत स्वायत्ततेची एक क्रूर चाचणी बनते: एजंटने काय शिकले ते लक्षात ठेवले पाहिजे, चुकांमधून सावरले पाहिजे आणि संपूर्ण धावांमध्ये काळजीपूर्वक त्याच्या कृतींचे बजेट केले पाहिजे.
Nvidia च्या हेडलाइन नंबरला तुलनेतून संदर्भ मिळतो. VISTA, एक पूर्वीचा थेट-इंटरॅक्शन हार्नेस ज्याने क्लॉड ओपस 5 देखील वापरला, 7,542 पर्यावरण क्रियांमध्ये समान 183 सार्वजनिक-सेट स्तर पूर्ण केले. Nvidia च्या ब्लॉग पोस्टनुसार, AVO ला काम पूर्ण करण्यासाठी अंदाजे 12% कमी क्रियांची आवश्यकता आहे.
GPU कर्नल पासून अज्ञात गेम पर्यंत
एव्हीओ कोडींसाठी बांधले गेले नाही. Nvidia ने GPU-कर्नल ऑप्टिमायझेशनवर प्रथम आर्किटेक्चरचे प्रात्यक्षिक केले, एक डोमेन जेथे लहान कोड बदल अचूकता, मेमरी वर्तन आणि थ्रूपुट अप्रत्याशित मार्गांनी खंडित करू शकतात. एका लक्ष-कर्नल अभ्यासात, AVO सात दिवस सतत धावले, 500 हून अधिक ऑप्टिमायझेशन दिशानिर्देश शोधले आणि 40 कर्नल आवृत्त्या तयार केल्या. NVIDIA DGX B200 सिस्टम्सवर, परिणामी मल्टीहेड अटेन्शन कर्नलने cuDNN ला 3.5% आणि FlashAttention-4 10.5% पर्यंत मागे टाकले. त्यानंतर एजंटने त्याच्या विकसित कर्नलला सुमारे 30 मिनिटांच्या अतिरिक्त स्वायत्त कार्यामध्ये गटबद्ध-क्वेरी अटेन्शनमध्ये रुपांतरित केले.
समान कोर लूप — तपासणी, योजना, अंमलबजावणी, चाचणी, मूल्यमापन — नंतर फक्त टास्क इंटरफेस बदलून ARC-AGI-3 वर निर्देशित केले गेले. दोन यंत्रणा पार पाडल्या. पहिली म्हणजे पर्सिस्टंट मेमरी, जी पूर्वीची अंमलबजावणी, मूल्यमापन परिणाम, कंपाइलर आणि प्रोफाइलर आउटपुट आणि संचित तर्क संग्रहित करते, त्यामुळे एजंट सुरवातीपासून संदर्भ पुनर्बांधणी करण्याऐवजी त्याच्या सद्य स्थितीतून पुन्हा सुरू करू शकतो. दुसरा एक पर्यवेक्षक आहे, दुसरा एजंट आहे जो संपूर्ण मार्गावर लक्ष ठेवतो आणि जेव्हा प्रगती थांबते तेव्हा हस्तक्षेप करतो.
पर्यवेक्षक म्हणजे यश
TechCrunch, ज्याने Nvidia चे Adel El Hallak, कंपनीच्या AI युनिटमधील उत्पादनाचे उपाध्यक्ष यांची मुलाखत घेतली, त्यांनी पर्यवेक्षकाला सर्वात महत्त्वाचा घटक म्हणून हायलाइट केले. "जेव्हा एजंट दिशा सोडून जातो किंवा एखाद्या मार्गाचा शोध घेण्यास सुरुवात करतो ज्यामुळे तो शेवटपर्यंत पोहोचू शकतो किंवा ज्या मार्गाने तो पूर्वी मार्गस्थ झाला होता तो मार्ग पुन्हा एक्सप्लोर करतो तेव्हा ते जवळजवळ सीईओसारखे कार्य करते," एल हॅलकने प्रकाशनाला सांगितले.
कामगिरीतील तफावत आहे. Nvidia च्या चाचणीमध्ये असे आढळून आले की क्लॉड ओपस 5 अत्याधुनिक हार्नेसशिवाय ARC-AGI-3 वर 30% स्कोअर व्यवस्थापित करतो — चाचणी केलेल्या बेअर मॉडेल्समधील सर्वोत्तम परिणाम, परंतु पूर्ण धावण्याच्या जवळपास कुठेही नाही. OpenAI च्या मॉडेल्सने बेंचमार्कवर 10% पेक्षा कमी गुण मिळवले आहेत आणि कंपनीने गेल्या महिन्यात स्वतःचे संशोधन प्रकाशित केले आहे हे दर्शविते की फक्त दोन हार्नेस सेटिंग्ज ट्वीक केल्याने त्याचे स्कोअर तिप्पट झाले. कोणतेही मॉडेल-केवळ कॉन्फिगरेशन AVO ने साध्य केलेल्या 100% च्या जवळपास आलेले नाही.
विशेष म्हणजे, AVO कॉन्फिगरेशन केवळ-मजकूर पद्धतीमध्ये चालले: प्रत्येक निरीक्षण अचूक 64x64 मजकूर ग्रिड म्हणून पुरवले गेले, मॉडेलला कोणतीही प्रतिमा किंवा प्रतिमा टोकन पाठवले गेले नाहीत. तर्कशक्ती मॉडेलच्या सभोवतालच्या लूपमधून आली आहे, मल्टीमॉडल समजातून नाही.
उद्योग हार्नेसवर का सट्टा लावत आहेत
एजंट पायाभूत सुविधा, कच्च्या मॉडेलची क्षमता नसून, स्वायत्त एआयसाठी सध्याची अडचण आहे हे पुराव्याच्या लहरी दरम्यान शोधून काढणे. डेटाब्रिक्सने जुलैमध्ये बेंचमार्किंग संशोधन प्रकाशित केले हे दर्शविते की हार्नेस नाटकीयरित्या कार्यप्रदर्शन आणि खर्च दोन्हीवर परिणाम करते. "तुम्ही एकच मॉडेल निवडू शकता परंतु भिन्न हार्नेस घेऊ शकता आणि जर तुम्ही चुकीचा हार्नेस वापरलात तर तुम्हाला लक्षणीय किंमत मिळेल," डेटाब्रिक्सचे सीईओ अली घोडसी यांनी टेकक्रंचला सांगितले. "ते स्वतःच तुमची किंमत 2x करू शकते."
एल हलाकने मोकळेपणाच्या दृष्टीने Nvidia चा व्यापक युक्तिवाद तयार केला. "आम्ही ओपन एजंट स्टॅक असण्यावर विश्वास ठेवतो - जिथे तुमचे संपूर्ण हार्नेसवर, पायाभूत सुविधांवर, रनटाइमवर नियंत्रण असते - आम्हाला इकोसिस्टम पुढे आणि सुरक्षितपणे पुढे नेण्यासाठी आवश्यक आहे," तो म्हणाला. Nvidia कडे त्याच्या NeMo ब्रँड अंतर्गत हार्नेस तंत्रज्ञानाचे खुल्या आकाराचे तुकडे आहेत आणि AVO संशोधन arXiv वरील पेपरमध्ये दस्तऐवजीकरण केले आहे.
इतिहासासह बेंचमार्क
ARC-AGI-3 फ्रंटियर-लॅब प्रतिस्पर्ध्यामध्ये एक फ्लॅशपॉइंट बनले आहे. OpenAI ने पूर्वी वापरलेल्या मूल्यमापन सेटिंग्जची छाननी करून, बेंचमार्कवर त्याच्या GPT-5.6 Sol मॉडेलसाठी मजबूत परिणामांचा दावा केला होता. Nvidia चा निकाल एका अर्थाने वादविवादाला बगल देतो - तो एका हुशार मॉडेलचा दावा करत नाही, फक्त विद्यमान मॉडेलच्या आसपास एक उत्तम-इंजिनियर एजंट आहे.
एजंटिक उत्पादने तयार करणाऱ्या डेव्हलपर्स आणि एंटरप्राइजेससाठी संदेश थेट आहे: मॉडेलची निवड अजूनही महत्त्वाची आहे, परंतु सिस्टीम डिझाइन आता ठरवते की फ्रंटियर मॉडेल फ्रंटियर परिणाम देते की नाही. Nvidia ने सांगितल्याप्रमाणे, मॉडेलचे मूल्यांकन करणे हे एजंटचे मूल्यमापन करण्यासारखे नसते — आणि 2026 चे बेंचमार्क टेबल मचान तयार करणाऱ्या अभियंत्यांना अधिकाधिक बक्षीस देत आहेत.
AI च्या पुढे रहा
एजंट आर्किटेक्चर्स पूर्वीपेक्षा अधिक वेगाने पुढे जात आहेत, आणि एक चांगला हार्नेस आणि एक खराब यांच्यातील अंतर आता बेंचमार्क पॉइंट्स आणि वास्तविक डॉलरमध्ये मोजले जाते. एआय बझ वायरचे अनुसरण करा AI संशोधन, बेंचमार्क आणि उत्पादन लाँचच्या दैनिक, स्त्रोत-सत्यापित कव्हरेजसाठी.
अधिक एआय संशोधन बातम्या वाचा →