जेव्हा मोठ्या भाषेचे मॉडेल पाचव्या इयत्तेपेक्षा जास्त सामग्री पाहत नाही तेव्हा काय होते? सात संशोधकांच्या टीमने त्या प्रश्नाचे शब्दशः उत्तर दिले: त्यांनी LittleLearner, यूएस प्राथमिक-शालेय अभ्यासक्रमासाठी फिल्टर केलेल्या कॉर्पसवर सुरवातीपासून प्रशिक्षित 5-अब्ज-पॅरामीटर LLM तयार केले आणि नंतर चाचणी केली - अधिक पॅरामीटर्स, अधिक प्रशिक्षणोत्तर, चतुराईने डेटा प्रॉम्प्ट करणे हे आधीच्या मॉडेलमध्ये काय आहे. उत्तर, ते अहवाल, नाही आहे.
"लिटललर्नर: लँग्वेज मॉडेल्स अंडर पेडॅगॉजिकल-कंट्रोल्ड नॉलेज एक्सपोजर," हा पेपर फॅनफेई ली, जना झेलर, मॅन्युएल प्राडा-कोरल, थॅडॉस विडेमर, प्रसन्ना मेइलवाहनन, रायन कॉटरेल आणि वाईलँड बेरेनडेल यांनी 13 ऑगस्ट रोजी arXiv ला सादर केला होता. 16 ऑगस्टपर्यंत हा 200 हून अधिक अपवोटसह वेगवान हॅकर न्यूज चर्चेचा विषय होता, कारण संशोधक आणि अभ्यासकांनी उद्योगाच्या आवडत्या गृहीतकासाठी याचा अर्थ काय आहे यावर चर्चा केली - प्रशिक्षणानंतरची क्षमता कमी हवेतून बाहेर काढू शकते. आम्ही आमच्या AI संशोधन कव्हरेज मध्ये पाहतो तोच एक प्रकारचा काळजीपूर्वक, विरोधाभासी प्रयोग आहे.
नॉलेज बॉर्डर असलेला सँडबॉक्स
आधुनिक LLM ला मूलत: प्रत्येक गोष्टीवर प्रशिक्षित केले जाते, ज्यामुळे प्रात्यक्षिक केलेले कौशल्य प्रशिक्षणादरम्यान खरोखर शिकले गेले होते की केवळ योग्य प्रॉम्प्टद्वारे प्राप्त होते हे सांगणे जवळजवळ अशक्य होते. प्रशिक्षण वितरणावरच मर्यादा घालणे हा संघाचा उपाय होता. FineWeb-Edu पासून प्रारंभ करून, त्यांनी 88-अब्ज-टोकन कॉर्पस डिस्टिल केले — ज्याला लिटल करिक्युलम डब केले गेले — पाच-स्टेज फिल्टरिंग पाइपलाइनद्वारे किंडरगार्टनच्या सामान्य मुख्य मानकांशी इयत्ता 5 पर्यंत संरेखित केले गेले. संकल्पना, तथ्ये आणि शब्दसंग्रह 5व्या वर्गात वर शिकवले गेले.
या कॉर्पसवर त्यांनी तीन स्केलवर (0.6B, 1.3B आणि 5B पॅरामीटर्स) सुरवातीपासून मॉडेल प्रशिक्षित केले, प्रत्येक समान आर्किटेक्चर आणि टोकन बजेटसह अनफिल्टर्ड डेटावर प्रशिक्षित जुळलेल्या नियंत्रण मॉडेलसह पाठवले. परिणाम म्हणजे एक मॉडेल जे ओपन-एंडेड मूल्यमापनासाठी पुरेसे अस्खलित आहे — तुम्ही ब्राउझरमध्ये होस्ट केलेल्या 5B आवृत्तीशी चॅट करू शकता — तरीही एक तीक्ष्ण, व्याख्या करण्यायोग्य ज्ञान सीमा आहे: जर ते प्राथमिक अभ्यासक्रमात नसेल, तर मॉडेलने ते कधीही पाहिले नाही.
एलिटेशन, अधिग्रहण नाही
मुख्य शोध अस्पष्ट आहे: मॉडेल्सला अधिक स्मार्ट बनवण्याच्या मानक टूलकिटने LittleLearner ला आधीच माहित असलेल्या गोष्टी वाढवल्या, परंतु त्यापैकी काहीही अर्थपूर्णपणे कार्यक्षेत्राबाहेरील कार्यप्रदर्शन सुधारले नाही.
स्केलिंग ने मॉडेलच्या नियंत्रित ज्ञानामध्ये अचूकता सुधारली आणि त्याच शिकण्याच्या मार्गावर माफक प्रमाणात विस्तार केला, परंतु ग्रेड-5 सामग्रीच्या पलीकडे क्षमता आवश्यक असलेल्या समस्यांसाठी फारसे काही केले नाही. GRPO सह प्रशिक्षणोत्तर — तर्क-मॉडेल बूमच्या मागे असलेली मजबुतीकरण-शिक्षण पद्धत — कार्यक्षेत्रातील K-5 क्षमतांना लक्षणीयरीत्या चालना मिळाली, तरीही स्कोप-ऑफ-ऑफ-ऑफ-ऑफ-ऑफ-ऑफ-ऑफ-ऑफ-ऑफ-ऑफ-ऑफ-ऑफ-ऑफ-ऑफ-ऑफ-ऑफ डेटासह प्रशिक्षित असतानाही-K-5 क्षमतांच्या पलीकडे पुनर्प्राप्त करण्यात अयशस्वी. आणि संदर्भातील शिक्षण, ज्ञानाला प्रॉम्प्टमध्ये भरण्याची दैनंदिन जादू, मॉडेलला जे आहे ते वापरण्यास मदत केली परंतु सीमेपलीकडे नवीन तर्क अनलॉक केले नाही.प्रीट्रेनिंग फिल्टर, थोडक्यात, प्रभावी क्षमता कमाल मर्यादा सेट करते. फील्ड सतत अस्पष्ट होत असलेल्या फरकाचा पुरावा म्हणून लेखक निकाल तयार करतात: प्रशिक्षणोत्तर आणि प्रॉम्प्टिंग एलिट; पूर्व प्रशिक्षण प्राप्त होते.
स्वच्छ नियंत्रणे, सार्वजनिक चौक्या
कार्यपद्धती ही दाव्यांना त्यांची ताकद देते. कारण प्रत्येक LittleLearner मॉडेल एका जुळलेल्या अनफिल्टर्ड नियंत्रणासह पाठवते — समान आर्किटेक्चर, समान टोकन संख्या, समान प्रशिक्षण रेसिपी — कार्यसंघ कोणत्याही वर्तणुकीतील फरकाचे श्रेय केवळ अभ्यासक्रम फिल्टरला देऊ शकते. MathCAMPS बेंचमार्कवर प्रशिक्षित झालेले गणित तज्ञ संशोधकांना शालेय श्रेणीनुसार कामगिरी श्रेणीबद्ध करू देतात, कार्यक्षेत्रातील क्षमता नेमकी कुठे संपते हे शोधून काढतात. आणि बऱ्याच फ्रंटियर पेपर्सच्या विपरीत, सर्व काही सार्वजनिक आहे: कॉर्पस, बेस आणि पोस्ट-प्रशिक्षित चेकपॉइंट्स HuggingFace वरील तिन्ही स्केलवर आणि होस्ट केलेला चॅट डेमो, त्यामुळे स्वतंत्र संघ स्वतः सीमा तपासू शकतात.
हा मोकळेपणा हॅकर न्यूजच्या चर्चेला चालना देत आहे. समालोचक होस्ट केलेल्या मॉडेलच्या वर्तनाची त्याच्या ज्ञानाच्या काठावर चाचणी करत आहेत — ते दूर ठेवत आहे, अंदाज लावत आहे किंवा 5 वी पुढे ढकलले आहे तेव्हा भ्रमनिरास करत आहे — आणि परिणामांवर वाद घालत आहेत: काही लोक तर्क-मॉडेल हायपसाठी वाईट बातमी म्हणून निकाल वाचतात, तर काहीजण असे निदर्शनास आणतात की वेब-स्केल प्रीट्रेनिंग डेटामध्ये समोरच्या घटकांपेक्षा कितीतरी जास्त आहे. अनुरुप उच्च. पेपरचे लेखक स्वत: या मुद्द्यावर सावध आहेत: त्यांचा दावा हा आहे की ज्ञात, नियंत्रित शिक्षण असलेल्या मॉडेलसाठी मानक हस्तक्षेप काय करू शकले नाहीत, फ्रंटियर लॅबबद्दल थेट अंदाज नाही.
हे वर्गाच्या पलीकडे का महत्त्वाचे आहे
हा प्रयोग AI मधील थेट वादविवादांशी थेट बोलतो. AI लॅब्स प्रशिक्षणोत्तर पद्धतींवर कोट्यवधी खर्च करतात या कल्पनेवर आधारित की मजबुतीकरण शिक्षण बेस मॉडेलला त्याच्या कच्च्या क्षमतेच्या पलीकडे ढकलू शकते. LittleLearner सुचवितो की ते नफा मोठ्या प्रमाणात प्रीट्रेनिंग डेटा सपोर्ट करते त्यामध्ये राहतात — आणि त्यावर बंधने असू शकतात. डेटा क्युरेशनबद्दल अधिक काळजी घेण्यासाठी आणि "आविर्भावी" पोस्ट-प्रशिक्षण क्षमतांच्या दाव्यांना संशयाने हाताळण्यासाठी हा युक्तिवाद आहे.
प्रकाशन देखील एक अस्सल संशोधन साधन आहे, केवळ एक कागद नाही. टीमने LittleCurriculum आणि सर्व मॉडेल चेकपॉईंट्स उघडपणे रिलीझ केले, आणि प्रकल्प पृष्ठ सँडबॉक्स सक्षम केलेल्या प्रयोगांचे रेखाटन करते: RL हे बक्षीस देण्याऐवजी खरोखर क्षमता निर्माण करू शकते का, नमुना-कार्यक्षमतेने मॉडेल वास्तविकपणे नवीन संकल्पना कसे शिकते जसे की नकारात्मक संख्या सादर केली जाते, आणि मशीन आणि मुलांना समान चुका शिकण्याची आवश्यकता असते का — किंवा शिकत असताना.
क्वचितच स्वच्छ नियंत्रणे मिळविणाऱ्या फील्डसाठी, स्पष्टपणे नमूद केलेले शिक्षण असलेले मॉडेल ही एक दुर्मिळ भेट आहे. आणि इतर प्रत्येकासाठी, हे डेस्कच्या वर पिन करण्यासारखे एक स्मरणपत्र आहे: कोणतेही मॉडेल — किंवा व्यक्ती — त्यांना कधीही शिकवलेल्या गोष्टींपासून मार्ग काढू शकत नाहीत.
AI च्या पुढे रहा
AI चा आकार बदलणाऱ्या संशोधनाचे पीअर-रिव्ह्यू-ग्रेड कव्हरेज, दररोज वितरित केले जाते. नवीनतम AI घडामोडी साठी आमचे केंद्र बुकमार्क करा.
अधिक एआय बातम्या वाचा →