क्या होता है जब एक बड़ा भाषा मॉडल पाँचवीं कक्षा से आगे की सामग्री कभी नहीं देखता है? सात शोधकर्ताओं की एक टीम ने उस प्रश्न का शाब्दिक उत्तर दिया: उन्होंने लिटल लर्नर का निर्माण किया, जो अमेरिकी प्राथमिक-स्कूल पाठ्यक्रम में फ़िल्टर किए गए कॉर्पस पर स्क्रैच से प्रशिक्षित 5 बिलियन-पैरामीटर एलएलएम है, और फिर परीक्षण किया कि क्या कुछ भी - अधिक पैरामीटर, अधिक प्रशिक्षण के बाद, अधिक चतुर संकेत - मॉडल को उसके पूर्व-प्रशिक्षण डेटा द्वारा सिखाई गई बातों से आगे बढ़ा सकता है। वे रिपोर्ट करते हैं कि उत्तर नहीं है।

पेपर, "लिटिल लर्नर: लैंग्वेज मॉडल्स अंडर पेडागोगिकल-कंट्रोल्ड नॉलेज एक्सपोजर", 13 अगस्त को फैनफेई ली, जाना ज़ेलर, मैनुअल प्रादा-कोरल, थडौस विडेमर, प्रसन्ना मयिलवाहनन, रयान कॉटरेल और वीलैंड ब्रेंडेल द्वारा arXiv को प्रस्तुत किया गया था। 16 अगस्त तक यह 200 से अधिक अपवोट्स के साथ तेजी से बढ़ती हैकर न्यूज चर्चा का विषय था, क्योंकि शोधकर्ताओं और चिकित्सकों ने इस बात पर बहस की कि उद्योग की पसंदीदा धारणा के लिए इसका क्या मतलब है - कि प्रशिक्षण के बाद पतली हवा से क्षमताएं आ सकती हैं। यह बिल्कुल उसी तरह का सावधान, विरोधाभासी प्रयोग है जिसे हम अपने [एआई अनुसंधान कवरेज] (https://aibuzzwire.news) में देखते हैं।

ज्ञान सीमा वाला एक सैंडबॉक्स

आधुनिक एलएलएम को अनिवार्य रूप से हर चीज पर प्रशिक्षित किया जाता है, जिससे यह बताना लगभग असंभव हो जाता है कि प्रदर्शित कौशल वास्तव में प्रशिक्षण के दौरान सीखा गया था या केवल सही संकेत द्वारा प्राप्त किया गया था। टीम का समाधान प्रशिक्षण वितरण को ही बाधित करना था। फाइनवेब-एडु से शुरू करके, उन्होंने ग्रेड 5 के माध्यम से किंडरगार्टन के लिए सामान्य कोर मानकों के अनुरूप पांच-चरण फ़िल्टरिंग पाइपलाइन के माध्यम से 88 बिलियन-टोकन कॉर्पस - जिसे लिटिल करिकुलम कहा जाता है - को डिस्टिल किया। ग्रेड 5 से ऊपर पढ़ाए गए अवधारणाओं, तथ्यों और शब्दावली को स्पष्ट रूप से बाहर रखा गया था।

इस कॉर्पस पर उन्होंने स्क्रैच से तीन स्केल (0.6बी, 1.3बी, और 5बी पैरामीटर) पर मॉडलों को प्रशिक्षित किया, प्रत्येक को समान आर्किटेक्चर और टोकन बजट के साथ अनफ़िल्टर्ड डेटा पर प्रशिक्षित एक मिलान नियंत्रण मॉडल के साथ भेजा गया। परिणाम एक ऐसा मॉडल है जो ओपन-एंडेड मूल्यांकन के लिए पर्याप्त रूप से धाराप्रवाह है - आप एक ब्राउज़र में होस्ट किए गए 5बी संस्करण के साथ चैट कर सकते हैं - फिर भी इसमें एक तेज, व्याख्या योग्य ज्ञान सीमा है: यदि यह प्राथमिक पाठ्यक्रम में नहीं था, तो मॉडल ने इसे कभी नहीं देखा।

प्राप्ति नहीं, प्राप्ति

मूल निष्कर्ष स्पष्ट है: मॉडल को अधिक स्मार्ट बनाने के लिए मानक टूलकिट ने लिटिल लर्नर को पहले से ही जो कुछ भी पता था उसे बढ़ाया, लेकिन इसमें से किसी ने भी आउट-ऑफ-स्कोप प्रदर्शन में सार्थक सुधार नहीं किया।

स्केलिंग ने मॉडल के नियंत्रित ज्ञान के भीतर सटीकता में सुधार किया और समान सीखने के प्रक्षेप पथ के साथ मामूली रूप से विस्तार किया, लेकिन ग्रेड -5 सामग्री से परे क्षमताओं की आवश्यकता वाली समस्याओं के लिए बहुत कम किया। प्रशिक्षण के बाद जीआरपीओ के साथ - तर्क-मॉडल बूम के पीछे सुदृढीकरण-सीखने की विधि - इन-स्कोप K-5 क्षमताओं को महत्वपूर्ण रूप से बढ़ाया, फिर भी आउट-ऑफ-स्कोप डेटा के साथ प्रशिक्षित होने पर भी K-5 से आगे की क्षमताओं को पुनर्प्राप्त करने में विफल रहा। और संदर्भ में सीखना, ज्ञान को एक संकेत में भरने का रोजमर्रा का जादू, मॉडल को उसके पास जो कुछ भी था उसका उपयोग करने में मदद करता है लेकिन सीमा से परे नए तर्क को अनलॉक नहीं करता है।

प्रीट्रेनिंग फ़िल्टर, संक्षेप में, प्रभावी क्षमता सीमा निर्धारित करता है। लेखक परिणाम को उस अंतर के प्रमाण के रूप में प्रस्तुत करते हैं जिसे क्षेत्र लगातार धुंधला कर रहा है: प्रशिक्षण के बाद और प्रेरणा प्राप्त करना; पूर्व प्रशिक्षण प्राप्त करता है।

स्वच्छ नियंत्रण, सार्वजनिक चौकियाँ

कार्यप्रणाली ही दावों को ताकत देती है। क्योंकि प्रत्येक लिटिल लर्नर मॉडल एक मिलान किए गए अनफ़िल्टर्ड नियंत्रण के साथ आता है - समान आर्किटेक्चर, समान टोकन गिनती, समान प्रशिक्षण नुस्खा - टीम किसी भी व्यवहारिक अंतर को अकेले पाठ्यक्रम फ़िल्टर के लिए जिम्मेदार ठहरा सकती है। MathCAMPS बेंचमार्क पर प्रशिक्षित गणित विशेषज्ञ शोधकर्ताओं को स्कूल ग्रेड के आधार पर प्रदर्शन को ग्रेड करने देते हैं, जिससे यह पता चलता है कि इन-स्कोप क्षमता कहां समाप्त होती है। और अधिकांश सीमांत पत्रों के विपरीत, सब कुछ सार्वजनिक है: हगिंगफेस पर सभी तीन पैमानों पर कॉर्पस, आधार और पोस्ट-प्रशिक्षित चौकियां, और एक होस्ट किया गया चैट डेमो, ताकि स्वतंत्र टीमें स्वयं सीमा की जांच कर सकें।

वह खुलापन हैकर न्यूज़ बहस को बढ़ावा दे रहा है। टिप्पणीकार अपने ज्ञान के स्तर पर होस्ट किए गए मॉडल के व्यवहार का परीक्षण कर रहे हैं - चाहे वह ग्रेड 5 से आगे धकेलने पर परहेज करता हो, अनुमान लगाता हो, या मतिभ्रम करता हो - और निहितार्थों पर बहस कर रहा है: कुछ लोग परिणामों को तर्क-मॉडल प्रचार के लिए बुरी खबर के रूप में पढ़ते हैं, अन्य बताते हैं कि वेब-स्केल प्रीट्रेनिंग डेटा में प्राथमिक-स्कूल अवधारणाओं की तुलना में कहीं अधिक शामिल है, इसलिए फ्रंटियर मॉडल की छतें तदनुसार ऊंची बैठती हैं। पेपर के लेखक स्वयं इस बिंदु पर सावधान हैं: उनका दावा इस बारे में है कि मानक हस्तक्षेप एक ज्ञात, नियंत्रित शिक्षा वाले मॉडल के लिए क्या नहीं कर सकता है, न कि सीमांत प्रयोगशालाओं के बारे में कोई प्रत्यक्ष भविष्यवाणी।

यह कक्षा से परे क्यों मायने रखता है

यह प्रयोग एआई में लाइव बहस पर सीधे बात करता है। एआई प्रयोगशालाएं इस विचार के आधार पर प्रशिक्षण के बाद के नियमों पर अरबों खर्च करती हैं कि सुदृढीकरण सीखना एक आधार मॉडल को उसकी कच्ची क्षमताओं से कहीं आगे बढ़ा सकता है। लिटिल लर्नर का सुझाव है कि वे लाभ काफी हद तक भीतर रह सकते हैं - और प्रीट्रेनिंग डेटा द्वारा समर्थित - से बंधे हो सकते हैं। यह डेटा क्यूरेशन के बारे में अधिक देखभाल करने और प्रशिक्षण के बाद की "आकस्मिक" क्षमताओं के दावों को संदेह के साथ मानने का एक तर्क है।

यह विज्ञप्ति केवल एक पेपर न होकर एक वास्तविक शोध उपकरण भी है। टीम ने लिटिल करिकुलम और सभी मॉडल चेकपॉइंट्स को खुले तौर पर जारी किया, और प्रोजेक्ट पेज उन प्रयोगों को रेखांकित करता है जो सैंडबॉक्स सक्षम बनाता है: क्या आरएल वास्तव में इसे पुरस्कृत करने के बजाय क्षमता बना सकता है, नमूना-कुशलता से एक मॉडल वास्तव में नई अवधारणा जैसे कि नकारात्मक संख्याओं को पेश करते समय सीखता है, और क्या मशीनों और बच्चों को समान एक्सपोजर की आवश्यकता होती है - या समान गलतियां करते हैं - जब अंश सीखते हैं।

ऐसे क्षेत्र के लिए जिसे शायद ही कभी स्वच्छ नियंत्रण मिलता है, स्पष्ट रूप से निर्दिष्ट शिक्षा वाला एक मॉडल एक दुर्लभ उपहार है। और बाकी सभी के लिए, यह डेस्क के ऊपर पिन करने लायक एक अनुस्मारक है: कोई भी मॉडल - या व्यक्ति - उस चीज़ से बाहर निकलने का तर्क नहीं दे सकता जो उन्हें कभी नहीं सिखाया गया था।

एआई से आगे रहें

एआई को नया आकार देने वाले शोध का सहकर्मी-समीक्षा-ग्रेड कवरेज, प्रतिदिन दिया जाता है। नवीनतम एआई विकास के लिए हमारे हब को बुकमार्क करें।

अधिक AI समाचार पढ़ें →