एनवीडिया शोधकर्ताओं ने एक एजेंट सिस्टम बनाया है जिसने एंथ्रोपिक के क्लाउड ओपस 5 को एआरसी-एजीआई-3 पर 100% स्कोर तक पहुंचाया है, जो एआई में सबसे अधिक मांग वाले इंटरैक्टिव रीजनिंग बेंचमार्क में से एक है - उसी मॉडल का उपयोग करके जो अपने आप चलने पर 30% स्कोर करता है। एनवीडिया टेक्निकल ब्लॉग पर शुक्रवार को प्रकाशित परिणाम, अब तक का सबसे मजबूत सबूत है कि फ्रंटियर मॉडल के चारों ओर लिपटा सॉफ्टवेयर उतना ही मायने रखता है जितना कि मॉडल। नवीनतम एआई विकास पर नज़र रखने वाले किसी भी व्यक्ति के लिए, यह उस बदलाव का प्रतीक है जहां एजेंटिक एआई में प्रतिस्पर्धात्मक लाभ वास्तव में रहता है।
सिस्टम को एवीओ कहा जाता है, जो एजेंट वेरिएशन ऑपरेटर्स के लिए संक्षिप्त है, और यह एनवीडिया का लंबे-क्षितिज स्वायत्त एजेंटों के लिए एक सामान्य-उद्देश्य वास्तुकला पर आधारित है - एआई जो एक संकेत का जवाब देने के बजाय घंटों या दिनों तक काम पर रह सकता है। एआरसी-एजीआई-3 सार्वजनिक सेट पर, एवीओ ने सभी 25 गेम परिवेशों में 100.00 आरएचएई स्कोर दर्ज किया, अपने बैकएंड मॉडल के रूप में क्लाउड ओपस 5 का उपयोग करके 6,624 पर्यावरण क्रियाओं में सभी 183 स्तरों को पूरा किया।
ARC-AGI-3 वास्तव में क्या परीक्षण करता है
एआरसी-एजीआई-3 एआरसी पुरस्कार फाउंडेशन द्वारा बनाया गया एक इंटरैक्टिव रीजनिंग बेंचमार्क है। एक एजेंट को बिना किसी निर्देश, बिना किसी घोषित नियम और बिना किसी निर्धारित लक्ष्य के अपरिचित, खेल जैसे वातावरण में छोड़ दिया जाता है। इसे परीक्षण और त्रुटि के माध्यम से पता लगाना होगा, यह अनुमान लगाना होगा कि पर्यावरण कैसे काम करता है, यह पता लगाना है कि "जीतने" का क्या मतलब है, और फिर उत्तरोत्तर कठिन स्तरों के माध्यम से प्रगति करने के लिए पर्याप्त कुशलता से कार्य करना है।
बेंचमार्क की स्कोरिंग मीट्रिक, रिलेटिव ह्यूमन एक्शन एफिशिएंसी (आरएचएई), कार्य पूरा करने को इस बात से जोड़ती है कि एजेंट पहली बार के मानव खिलाड़ियों के सापेक्ष कितने कम कार्यों को बर्बाद करता है। यह इसे निरंतर स्वायत्तता की एक क्रूर परीक्षा बनाता है: एजेंट को यह याद रखना चाहिए कि उसने क्या सीखा, गलतियों से उबरना चाहिए, और पूरे दौर में अपने कार्यों का सावधानीपूर्वक बजट बनाना चाहिए।
एनवीडिया की हेडलाइन संख्या तुलना से संदर्भ प्राप्त करती है। VISTA, एक पिछला प्रत्यक्ष-इंटरेक्शन हार्नेस जिसमें क्लाउड ओपस 5 का भी उपयोग किया गया था, ने 7,542 पर्यावरण क्रियाओं में समान 183 सार्वजनिक-निर्धारित स्तर पूरे किए। एनवीडिया के ब्लॉग पोस्ट के अनुसार, एवीओ को काम पूरा करने के लिए लगभग 12% कम कार्रवाइयों की आवश्यकता थी।
GPU कर्नेल से लेकर अज्ञात गेम्स तक
AVO पहेलियों के लिए नहीं बनाया गया था। एनवीडिया ने सबसे पहले जीपीयू-कर्नेल ऑप्टिमाइज़ेशन पर आर्किटेक्चर का प्रदर्शन किया, एक ऐसा डोमेन जहां छोटे कोड परिवर्तन अप्रत्याशित तरीकों से शुद्धता, मेमोरी व्यवहार और थ्रूपुट को तोड़ सकते हैं। एक ध्यान-कर्नेल अध्ययन में, एवीओ सात दिनों तक लगातार चला, 500 से अधिक अनुकूलन दिशाओं का पता लगाया, और 40 कर्नेल संस्करण प्रतिबद्ध किए। NVIDIA DGX B200 सिस्टम पर, परिणामी मल्टीहेड अटेंशन कर्नेल ने cuDNN को 3.5% तक और फ़्लैशअटेंशन-4 को 10.5% तक बेहतर प्रदर्शन किया। इसके बाद एजेंट ने लगभग 30 मिनट के अतिरिक्त स्वायत्त कार्य में इसके विकसित कर्नेल को समूहीकृत-क्वेरी ध्यान में अनुकूलित किया।
उसी कोर लूप - निरीक्षण, योजना, कार्यान्वयन, परीक्षण, मूल्यांकन - को तब एआरसी-एजीआई -3 पर इंगित किया गया था, केवल कार्य इंटरफ़ेस बदल गया था। दो तंत्र आगे बढ़ाए गए। पहली सतत मेमोरी है, जो पूर्व कार्यान्वयन, मूल्यांकन परिणाम, कंपाइलर और प्रोफाइलर आउटपुट और संचित तर्क को संग्रहीत करती है, ताकि एजेंट स्क्रैच से संदर्भ के पुनर्निर्माण के बजाय अपनी वर्तमान स्थिति से फिर से शुरू कर सके। दूसरा एक पर्यवेक्षक है, एक दूसरा एजेंट जो समग्र प्रक्षेपवक्र पर नज़र रखता है और प्रगति रुकने पर हस्तक्षेप करता है।
पर्यवेक्षक निर्णायक है
टेकक्रंच, जिसने कंपनी की एआई इकाई में उत्पाद के उपाध्यक्ष, एनवीडिया के एडेल एल हलाक का साक्षात्कार लिया, ने पर्यवेक्षक को सबसे महत्वपूर्ण घटक के रूप में उजागर किया। एल हॉलक ने प्रकाशन को बताया, "यह लगभग एक सीईओ की तरह काम करता है, जब एजेंट दिशा से भटक जाता है या ऐसे रास्ते की खोज शुरू कर देता है, जो अंत की ओर ले जा सकता है, या उस रास्ते को फिर से तलाशना शुरू कर देता है, जिस पर वह पहले चला था।"
प्रदर्शन का अंतर स्पष्ट है. एनवीडिया के परीक्षण में पाया गया कि बिना किसी परिष्कृत हार्नेस के क्लाउड ओपस 5 ने एआरसी-एजीआई-3 पर 30% स्कोर हासिल किया - परीक्षण किए गए नंगे मॉडलों के बीच सबसे अच्छा परिणाम, लेकिन पूर्ण रन के करीब भी नहीं। OpenAI के मॉडलों ने बेंचमार्क पर 10% से कम स्कोर किया है, और कंपनी ने पिछले महीने अपना स्वयं का शोध प्रकाशित किया था जिसमें दिखाया गया था कि केवल दो हार्नेस सेटिंग्स में बदलाव से उसके स्कोर तीन गुना हो गए। कोई भी मॉडल-केवल कॉन्फ़िगरेशन AVO द्वारा हासिल किए गए 100% के करीब नहीं आया है।
विशेष रूप से, एवीओ कॉन्फ़िगरेशन केवल टेक्स्ट मोडैलिटी में चलता था: प्रत्येक अवलोकन को सटीक 64x64 टेक्स्ट ग्रिड के रूप में आपूर्ति की गई थी, जिसमें मॉडल पर कोई छवि या छवि टोकन नहीं भेजा गया था। तर्क शक्ति मॉडल के चारों ओर लूप से आई, मल्टीमॉडल धारणा से नहीं।
क्यों उद्योग हार्नेस पर दांव लगा रहा है
सबूतों की लहर के बीच यह खोज सामने आई है कि स्वायत्त एआई के लिए वर्तमान बाधा एजेंट बुनियादी ढांचा है, न कि कच्चे मॉडल की क्षमता। डेटाब्रिक्स ने जुलाई में बेंचमार्किंग शोध प्रकाशित किया जिसमें दिखाया गया कि हार्नेस प्रदर्शन और लागत दोनों पर नाटकीय रूप से प्रभाव डालता है। डेटाब्रिक्स के सीईओ अली घोडसी ने टेकक्रंच को बताया, "आप एक ही मॉडल चुन सकते हैं लेकिन अलग-अलग हार्नेस चुन सकते हैं, और यदि आप गलत हार्नेस का उपयोग करते हैं तो आपको काफी अधिक लागत मिलती है।" "यही आपकी लागत को दोगुना कर सकता है।"
एल हालक ने खुलेपन के संदर्भ में एनवीडिया के व्यापक तर्क को तैयार किया। उन्होंने कहा, "हम एक खुले एजेंट स्टैक में विश्वास करते हैं - जहां आपके पास हार्नेस पर, बुनियादी ढांचे पर, रनटाइम पर नियंत्रण होता है - जो पारिस्थितिकी तंत्र को आगे और सुरक्षित रूप से आगे बढ़ाने के लिए हमारे लिए आवश्यक है।" एनवीडिया के पास अपने NeMo ब्रांड के तहत हार्नेस तकनीक के खुले आकार के टुकड़े हैं, और AVO अनुसंधान को arXiv पर एक पेपर में प्रलेखित किया गया है।
इतिहास के साथ एक बेंचमार्क
एआरसी-एजीआई-3 फ्रंटियर-लैब प्रतिद्वंद्विता में एक फ्लैशप्वाइंट बन गया है। OpenAI ने पहले बेंचमार्क पर अपने GPT-5.6 Sol मॉडल के लिए मजबूत परिणामों का दावा किया था, जिसमें उपयोग की गई मूल्यांकन सेटिंग्स की जांच की गई थी। एनवीडिया का परिणाम एक अर्थ में उस बहस को दरकिनार कर देता है - यह एक स्मार्ट मॉडल का दावा नहीं करता है, केवल मौजूदा मॉडल के आसपास एक बेहतर इंजीनियर एजेंट का दावा करता है।
एजेंटिक उत्पाद बनाने वाले डेवलपर्स और उद्यमों के लिए संदेश सीधा है: मॉडल चयन अभी भी मायने रखता है, लेकिन सिस्टम डिज़ाइन अब यह तय करता है कि फ्रंटियर मॉडल फ्रंटियर परिणाम देता है या नहीं। जैसा कि एनवीडिया कहता है, एक मॉडल का मूल्यांकन करना एक एजेंट का मूल्यांकन करने के समान नहीं है - और 2026 की बेंचमार्क तालिकाएं मचान बनाने वाले इंजीनियरों को तेजी से पुरस्कृत कर रही हैं।
एआई से आगे रहें
एजेंट आर्किटेक्चर पहले से कहीं अधिक तेज़ी से आगे बढ़ रहे हैं, और एक अच्छे हार्नेस और एक बुरे हार्नेस के बीच का अंतर अब बेंचमार्क पॉइंट और वास्तविक डॉलर में मापा जाता है। एआई अनुसंधान, बेंचमार्क और उत्पाद लॉन्च के दैनिक, स्रोत-सत्यापित कवरेज के लिए एआई बज़ वायर का अनुसरण करें।
अधिक AI शोध समाचार पढ़ें →