विकेंद्रीकृत एआई लैब प्राइम इंटेलेक्ट ने एक बड़े पैमाने पर प्रयोग के परिणाम प्रकाशित किए हैं, जिसमें यह परीक्षण किया गया है कि आज के अग्रणी एआई मॉडल स्वायत्त मशीन लर्निंग अनुसंधान कितनी अच्छी तरह कर सकते हैं - और उनमें से सर्वश्रेष्ठ एक प्रसिद्ध सामुदायिक बेंचमार्क पर मानव विश्व रिकॉर्ड से मेल खाने के उल्लेखनीय रूप से करीब आए।
प्रोजेक्ट, जिसे नैनोजीपीटी स्पीडरन फ्रंटियर कहा गया और 22 अगस्त को प्रकाशित किया गया, इसमें नैनोजीपीटी ऑप्टिमाइज़र स्पीडरन का प्रयास करने वाले 18 फ्रंटियर मॉडल में 153 स्वायत्त रन शामिल थे - एक प्रतियोगिता जिसमें शोधकर्ता एक छोटे भाषा मॉडल को एक निश्चित गुणवत्ता लक्ष्य के लिए प्रशिक्षित करने के लिए सबसे कुशल तरीका खोजते हैं। कहानी तेजी से हैकर न्यूज के पहले पन्ने पर चढ़ गई, जहां इस पर दर्जनों टिप्पणियाँ आईं, जिसमें इस बात पर बहस हुई कि परिणाम वास्तविक वैज्ञानिक खोज के लिए एआई की क्षमता के बारे में क्या कहते हैं। For more context on this story, see our ongoing more AI stories.
नैनोजीपीटी स्पीडरन वास्तव में क्या है
बेंचमार्क केलर जॉर्डन द्वारा बनाए गए मॉडेड-नैनोजीपीटी रिपॉजिटरी और सामुदायिक योगदानकर्ताओं की एक लंबी सूची से आता है। यह चुनौती भ्रामक रूप से सरल है: 8 एनवीडिया एच100 जीपीयू का उपयोग करके, एक भाषा मॉडल को प्रशिक्षित करें जो फाइनवेब सत्यापन सेट पर 3.28 क्रॉस-एन्ट्रॉपी हानि तक पहुंचता है - प्रदर्शन स्तर लेडी कारपैथी की मूल जीपीटी -2 प्रतिकृति 45 मिनट के बाद पहुंची - जितनी जल्दी संभव हो।
पिछले दो वर्षों में सैकड़ों सामुदायिक योगदानों के माध्यम से, मानव रिकॉर्ड को 75 सेकंड से कम और 400 मिलियन प्रशिक्षण टोकन से कम कर दिया गया है, जो मूल नुस्खा की तुलना में 30 गुना से अधिक सुधार है। विजेता समाधान आधुनिक एमएल इंजीनियरिंग की एक सूची की तरह पढ़ते हैं: म्यूऑन ऑप्टिमाइज़र, क्यूके-नॉर्म के साथ रोटरी एम्बेडिंग, रेएलयू-स्क्वायर एक्टिवेशन, ध्यान और एमएलपी पास पर एफपी 8 क्वांटाइजेशन, स्लाइडिंग-विंडो पैटर्न के साथ फ्लैश अटेंशन 3, और दर्जनों अन्य तकनीकें एक दूसरे के ऊपर खड़ी हैं।
प्राइम इंटेलेक्ट के परीक्षण में बेंचमार्क के ऑप्टिमाइज़र ट्रैक का उपयोग किया गया, जो - रिपॉजिटरी के दस्तावेज़ीकरण के अनुसार - एक प्रभावी रूप से असीमित वॉल-क्लॉक बजट के साथ, एक निश्चित आर्किटेक्चर, डेटासेट और बैच आकार के अधीन, लक्ष्य हानि को पूरा करने के लिए आवश्यक प्रशिक्षण चरणों की संख्या को कम करता है। यह इसे कच्ची हार्डवेयर गति के बजाय एल्गोरिदम खोज का शुद्ध परीक्षण बनाता है।
प्रयोग कैसे काम किया
18 मॉडलों में से प्रत्येक को स्वायत्त रूप से कार्य दिया गया था: प्रशिक्षण नुस्खा में बदलाव का प्रस्ताव करना, प्रयोग चलाना, परिणामों का निरीक्षण करना और पुनरावृत्त करना - एक निश्चित सत्यापन स्क्रिप्ट और निश्चित यादृच्छिक बीज के साथ यह सुनिश्चित करना कि दावा किया गया सुधार एक भाग्यशाली दौड़ के बजाय वास्तविक है। जैसा कि एक हैकर न्यूज़ टिप्पणीकार ने इसका सारांश दिया, मॉडलों को शोध करने के लिए कहा गया कि एक छोटे मॉडल के प्रशिक्षण को कैसे बेहतर बनाया जाए, बार-बार परिवर्तनों की कोशिश की जाए, उनका परीक्षण किया जाए और परिणामों का उपयोग करके यह तय किया जाए कि आगे क्या प्रयास करना है।
मॉडलों ने विभिन्न प्रकार के एजेंट हार्नेस के माध्यम से काम किया - जिसमें क्लाउड-कोड, ओपनएआई का कोडेक्स, किमी-कोड, ग्रोक-क्ली, क्वेन-कोड और प्राइम इंटेलेक्ट का अपना प्राइम-एजेंट शामिल है - और टीम ने प्रत्येक रन की टोकन खपत, प्रयोग संख्या, टूल कॉल और बीता हुआ एजेंट समय ट्रैक किया। कुल मिलाकर, प्रयोग में प्रति शीर्ष मॉडल में करोड़ों टोकन और पूर्ण ग्रिड में अरबों टोकन खर्च हुए।
लीडरबोर्ड: कल्पित 5 पैक का नेतृत्व करता है
शीर्षक परिणाम: फ़ेबल 5 के रूप में पहचाने जाने वाले मॉडल ने, क्लाउड-कोड हार्नेस के माध्यम से चलते हुए, लीडरबोर्ड के मीट्रिक पर 2,726 के सर्वोत्तम मान्य परिणाम के साथ, बेसलाइन रेसिपी और मानव रिकॉर्ड के बीच 81.7 प्रतिशत अंतर को बंद कर दिया। वहां पहुंचने में 8.7 दिन का संचयी एजेंट समय, लगभग 800 मिलियन टोकन, 811 प्रयोग और लगभग 3,000 टूल कॉल लगे।
पीछा करने वाले पैक का नेतृत्व ओपस 5 ने किया, जिसने 53.6 प्रतिशत अंतर को बंद कर दिया, इसके बाद प्राइम इंटेलेक्ट के प्राइम-एजेंट हार्नेस (और किमी-कोड के माध्यम से 45.8 प्रतिशत) द्वारा संचालित होने पर किमी के 3 ने 52.2 प्रतिशत के अंतर को बंद कर दिया। ओपस 4.8 ने 39.4 प्रतिशत का प्रबंधन किया, कई जीपीटी-5.6 वेरिएंट लगभग 11 और 36 प्रतिशत के बीच उतरे, सॉनेट 5 26.8 प्रतिशत पर बंद हुआ, और ग्रोक 4.5 और क्वेन3.8 मैक्स प्रत्येक लगभग 24.6 प्रतिशत पर पहुंच गए।
और नीचे, डीपसीक वी4 प्रो ने 12.3 प्रतिशत का अंतर बंद कर दिया, जीपीटी-5.5 8.1 प्रतिशत पर पहुंच गया, और पुराना किमी के2.7 7.2 प्रतिशत पर समाप्त हुआ। विशेष रूप से, हाल ही में जारी किया गया एक मॉडल - जीएलएम 5.3 - प्रकाशन के समय अभी भी बिना किसी मान्य रिकॉर्ड के साथ चल रहा था, एक अनुस्मारक कि बेंचमार्क उन मॉडलों को दंडित करता है जो विश्वसनीय रूप से अपने स्वयं के सुधारों को मान्य नहीं कर सकते हैं।
यह क्यों मायने रखती है
इस तरह के बेंचमार्क मायने रखते हैं क्योंकि वे कुछ ऐसा मापते हैं जो कोडिंग लीडरबोर्ड नहीं कर सकते: एक वास्तविक शोध लूप - परिकल्पना, प्रयोग, विश्लेषण, संशोधन - को मिनटों के बजाय दिनों में चलाने की क्षमता। वह क्षमता स्वायत्त एआई अनुसंधान के उभरते क्षेत्र की नींव है, जिसमें एजेंटों को विशिष्ट कोड लिखने का काम नहीं बल्कि उन चीजों की खोज करने का काम सौंपा जाता है जो किसी ने उन्हें नहीं दिखाया है।
परिणामों में फैलाव अपने आप में जानकारीपूर्ण है. प्रोजेक्ट के राइटअप के अनुसार, प्रयोग में लगभग हर मॉडल को समान मूल विजेता विचार मिले - जो सबसे अच्छा रन अलग करता था वह वही था जो एक प्रयोग पीछे छोड़ता है: मजबूत एजेंटों ने शोर परिणामों में कमजोर संकेतों को उन्हें मान्य करने के लिए लंबे समय तक संरक्षित किया, और अपने स्वयं के प्रयोगात्मक डेटा को बेहतर ढंग से समझा।
##समुदाय की ओर से चेतावनियाँ
हैकर न्यूज़ के टिप्पणीकारों ने निष्पक्ष पद्धति संबंधी बिंदु उठाए। प्रयास सेटिंग्स और हार्नेस सभी मॉडलों में भिन्न-भिन्न थे - फ़ेबल 5 उच्च तर्क सेटिंग पर चला जबकि ओपस 5 अधिकतम पर चला - और 18 मॉडलों में 153 रन के अंकगणित का अर्थ है कि कुछ मॉडलों को दूसरों की तुलना में अधिक प्रयास प्राप्त हुए। क्या किसी मॉडल की रैंकिंग उसकी कच्ची शोध क्षमता को दर्शाती है या उसके दोहन की गुणवत्ता को दर्शाती है, यह एक खुला प्रश्न बना हुआ है।
फिर भी यात्रा की दिशा स्पष्ट है. जब सबसे तेज़ मानव हाथों को वर्तमान रिकॉर्ड तक पहुंचने के लिए वर्षों के सामूहिक प्रयास का सामना करना पड़ा, तो सबसे अच्छे स्वायत्त एजेंट अब गणना समय के एक सप्ताह से कुछ अधिक समय में उस अंतर को पूरा कर रहे हैं। अगला प्रश्न - क्या कोई मॉडल शेष 18.3 प्रतिशत को बंद कर सकता है - का उत्तर उम्मीद से पहले दिया जा सकता है।
एआई की सीमा को आकार देने वाले बेंचमार्क और शोध के बारे में अधिक जानकारी के लिए, एआई बज़ वायर के निरंतर कवरेज का अनुसरण करें।
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →