एआरसी प्राइज फाउंडेशन द्वारा बुधवार को प्रकाशित परिणामों के अनुसार, ओपनएआई के जीपीटी-6 एस्ट्रा ने एआरसी-एजीआई-3 पर अत्याधुनिक परिणाम पोस्ट किए हैं, जो एजेंटिक इंटेलिजेंस को मापने के लिए डिज़ाइन किया गया अमूर्त तर्क बेंचमार्क है। मॉडल ने फाउंडेशन के स्टैंडर्ड हार्नेस के तहत बेंचमार्क के सेमी-प्राइवेट सेट पर 62.7% स्कोर किया, और प्रदाता एडाप्टर हार्नेस के साथ मूल्यांकन करने पर 99.9% स्कोर किया, जो अनुरोधों के बीच मॉडल की आंतरिक तर्क स्थिति को संरक्षित करता है।

ओपनएआई द्वारा एस्ट्रा का चरणबद्ध रोलआउट शुरू करने के एक दिन बाद नतीजे आए, कंपनी ने एक नए युग की शुरुआत के रूप में इस प्रमुख मॉडल को तैयार किया है। फ्रंटियर लैब्स ट्रेड बेंचमार्क के अनुसार स्कोर बनाए रखने की कोशिश करने वाले पाठकों के लिए, [नवीनतम एआई विकास] (https://aibuzzwire.news) पेज हर प्रमुख रिलीज को ट्रैक करता है।

दो हार्नेस, दो बहुत अलग स्कोर

एस्ट्रा के दो हेडलाइन नंबरों के बीच का अंतर रिपोर्ट में सबसे महत्वपूर्ण विवरण है। एआरसी पुरस्कार विभिन्न तरीकों के तहत एजेंटों का मूल्यांकन करता है, और प्रत्येक मॉडल को अपने संदर्भ के साथ क्या करने की अनुमति देता है उसे बदलता है।

मानक हार्नेस के तहत, एक मॉडल उन नोट्स को आगे बढ़ा सकता है जिन्हें वह रखना चाहता है क्योंकि वह एक वातावरण में काम करता है। उस सेटअप के साथ, एस्ट्रा ने अधिकतम तर्क प्रयास पर 62.7% स्कोर किया, मूल्यांकन रन के लिए $26,098 की कुल लागत पर। विपरीत छोर पर, तर्क को बंद करके उसी हार्नेस को चलाने से केवल 35.2% उत्पादन हुआ, जबकि लागत अधिक थी - $49,791 - क्योंकि मॉडल को प्रगति करने के लिए कई और कार्यों की आवश्यकता थी।

प्रदाता एडाप्टर हार्नेस अधिक उदार है: यह अनुरोधों के बीच मॉडल की अपारदर्शी तर्क स्थिति को संरक्षित करता है और लंबी बातचीत के लिए कॉम्पैक्शन का उपयोग करता है, जिससे एस्ट्रा को पूर्व कार्य का पुन: उपयोग करने की सुविधा मिलती है। उस हार्नेस के तहत, एस्ट्रा ने $18,817 के लिए उच्च तर्क प्रयास पर 99.9% और $17,332 के लिए अधिकतम प्रयास पर 98.6% स्कोर किया। यहां तक ​​कि न्यूनतम तर्क सेटिंग भी 96.7% तक पहुंच गई।

दूसरे शब्दों में, आंशिक स्कोर और लगभग पूर्ण स्कोर के बीच का अंतर केवल कच्ची क्षमता नहीं है - यह है कि चरणों के बीच मॉडल की कितनी कार्यशील स्थिति बची रहती है।

कार्यकुशलता में मनुष्य को मात देना

ARC-AGI-3 नवीन, अमूर्त, बारी-आधारित गेम वातावरण के आसपास बनाया गया है। एजेंटों को निर्देशों के बिना पता लगाना चाहिए, अनुमान लगाना चाहिए कि दुनिया कैसे काम करती है, विरल पुरस्कारों से लक्ष्यों की पहचान करनी चाहिए और बहु-चरणीय कार्रवाइयों की योजना बनानी चाहिए। वातावरण को कैलिब्रेट किया जाता है ताकि मनुष्य उनमें से 100% को हल कर सके, जो मानव प्रदर्शन को बेंचमार्क उपायों के आधार पर आधार बनाता है।

एस्ट्रा ने अधिकांश स्तरों को न केवल हल किया बल्कि इसने उन्हें कुशलतापूर्वक हल किया। एआरसी पुरस्कार के अनुसार, मॉडल ने 96% स्तरों पर औसत परीक्षण किए गए मानव की तुलना में कम क्रियाओं का उपयोग किया, जो पूरे सेट में कार्य कुशलता में मानव आधार रेखा को पार कर गया।

तुलना का अर्थशास्त्र निराधार है। मानव परीक्षण प्रतिभागियों को प्रति 90 मिनट के सत्र के लिए $115 और प्रति पूर्ण गेम के लिए $5 का भुगतान किया गया था, जो प्रति प्रयास किए गए गेम के लिए लगभग $12.78 था। कॉन्फ़िगरेशन के आधार पर एक पूर्ण एस्ट्रा मूल्यांकन रन की लागत पांच आंकड़े होती है। लेकिन एआरसी पुरस्कार ने एक प्रतिकूल झुर्रियाँ देखीं: उच्च तर्क प्रयास की लागत आम तौर पर कम होती है, क्योंकि एस्ट्रा ने कम क्रियाओं में गेम को हल किया, जिससे प्रति रन जलाए गए मॉडल कॉल और टोकन की कुल संख्या कम हो गई।

एक मॉडल जो अपनी भाषा स्वयं बनाता है

स्कोर से परे, एआरसी पुरस्कार ने टीम द्वारा देखे गए गुणात्मक व्यवहार पर प्रकाश डाला। एस्ट्रा ने लगातार अपरिचित वातावरण को कॉम्पैक्ट प्रतीकात्मक विश्व मॉडल में बदल दिया - खेल यांत्रिकी को तार्किक नियमों के रूप में प्रस्तुत किया, और स्थिति को ट्रैक करने और कार्यों की योजना बनाने के लिए अपने स्वयं के डोमेन-विशिष्ट शॉर्टहैंड विकसित किया।

एआरसी-एजीआई-3 को ठीक इसी कौशल की जांच के लिए डिज़ाइन किया गया था। जहां बेंचमार्क की पिछली पीढ़ियों ने उपन्यास पैटर्न पर तरल तर्क का परीक्षण किया, वहीं तीसरी पीढ़ी परीक्षण करती है कि क्या एक एजेंट उन वातावरणों में अन्वेषण, मॉडल, लक्ष्य निर्धारित कर सकता है और योजनाओं को क्रियान्वित कर सकता है जो उसने कभी नहीं देखा है - एआरसी पुरस्कार के घटकों को अन्वेषण, मॉडलिंग, लक्ष्य-निर्धारण और योजना और निष्पादन के रूप में सूचीबद्ध किया गया है।

एजीआई-युग की पृष्ठभूमि

ओपनएआई की ओर से अधिकतम बयानबाजी के बीच बेंचमार्क नतीजे आए। गुरुवार के लॉन्च से पहले एक प्रेस ब्रीफिंग में, द न्यू स्टैक के लॉन्च के कवरेज के अनुसार, कंपनी के अध्यक्ष ग्रेग ब्रॉकमैन ने औपचारिक घोषणा से बचते हुए कहा, "यह महसूस करना अनुचित नहीं है कि हम अब एजीआई युग में हैं"। उन्होंने एजीआई को एक संविदात्मक ट्रिगर के बजाय एक "मिशन अवधारणा या आध्यात्मिक अवधारणा" के रूप में वर्णित किया।

ओपनएआई के शोधकर्ता एडन क्लार्क ने कहा कि एस्ट्रा कंपनी का अब तक का सबसे बड़ा प्रशिक्षण कार्यक्रम था - टेक्सास में स्टारगेट साइट पर 100,000 से अधिक जीपीयू पर पहला पूर्व-प्रशिक्षित - और पहला ओपनएआई रिलीज जिसमें पहले के मॉडल ने प्रशिक्षण प्रक्रिया की निगरानी में महत्वपूर्ण भूमिका निभाई थी। एक्सेस अभी भी चरणबद्ध है: रोलआउट डेब्रेक प्रोग्राम में एंटरप्राइज़ ग्राहकों के साथ शुरू होता है, प्लस, प्रो, बिजनेस और एंटरप्राइज़ उपलब्धता के साथ-साथ आने वाले दिनों में एपीआई और एडब्ल्यूएस एक्सेस का वादा किया जाता है।

स्कोर पर तारांकन चिह्न

कई मोर्चों पर सावधानी जरूरी है। एस्ट्रा का एआरसी-एजीआई-3 प्रदर्शन हार्नेस कॉन्फ़िगरेशन पर काफी हद तक निर्भर करता है, जैसा कि दो हेडलाइन नंबर दिखाते हैं, और मॉडल स्थिति को संरक्षित करने वाले कस्टम हार्नेस बेंचमार्क विवादों में विवाद का एक आवर्ती बिंदु रहे हैं। लॉन्च के न्यू स्टैक के विश्लेषण में कहा गया है कि एस्ट्रा ने "विशेष कार्यों पर बड़ा लाभ अर्जित किया है, लेकिन यह प्रीमियम पर आता है और स्पष्ट रूप से कोडिंग पैक का नेतृत्व नहीं करता है" - एक अनुस्मारक कि एजेंटिक पहेली बेंचमार्क और रोजमर्रा के वाणिज्यिक कार्यभार अलग-अलग चीजों को मापते हैं।

एआरसी पुरस्कार स्वयं इस अभ्यास को वर्तमान एआई और एजीआई के बीच "अवशिष्ट अंतर" को मापने के रूप में परिभाषित करता है, एजीआई को एक मानव के रूप में किसी भी कौशल को कुशलतापूर्वक प्राप्त करने की क्षमता के रूप में परिभाषित करता है। अनुकूल परिस्थितियों में लगभग पूर्ण स्कोर उस अंतर को अपने आप कम नहीं करता है। और $17,000 से $50,000 प्रति मूल्यांकन रन पर, केवल अच्छी तरह से सुसज्जित प्रयोगशालाएं ही इस पैमाने पर बेंचमार्क चलाने का जोखिम उठा सकती हैं - हालांकि एआरसी पुरस्कार के लागत डेटा से पता चलता है कि बेहतर तर्क वास्तव में बिल को कम कर सकता है।

यह क्यों मायने रखता है

कार्यकुशलता वास्तव में तुलना की एक नई धुरी है। एक मॉडल जो हर स्तर को हल करता है लेकिन हजारों कॉल बर्बाद करता है वह कम उपयोगी है - और अधिक महंगा है - उस मॉडल की तुलना में जो एस्ट्रा की तरह काम करता है: जानबूझकर खोज करना, जो सीखा है उसे संपीड़ित करना और उस पर कार्य करना। एजीआई बहस के बारे में कोई भी निष्कर्ष निकाले, एआरसी पुरस्कार डेटा से पता चलता है कि फ्रंटियर एजेंट अब मनुष्यों से मेल खा रहे हैं, न केवल इस आधार पर कि क्या वे नई समस्याओं को हल कर सकते हैं, बल्कि इस आधार पर भी कि वे उन्हें आर्थिक रूप से कैसे हल करते हैं।

एआई से आगे रहें

प्रत्येक बेंचमार्क परिणाम, मॉडल लॉन्च और सुरक्षा बहस, जैसे भी होता है, ट्रैक किया जाता है - अधिक एआई समाचार पढ़ें →