एक नवीन मुक्त-स्रोत प्रकल्प मशीन लर्निंगच्या हट्टी मर्यादांपैकी एक हाताळण्यासाठी लक्ष वेधत आहे: एक भाषा मॉडेल तयार करणे जे कधीही शिकणे थांबवत नाही. mini-AGI म्हटल्या जाणाऱ्या, प्रकल्पाचे वर्णन सतत शिक्षण, बाइट-स्तरीय भाषा मॉडेल जे स्वतःचे आर्किटेक्चर एकत्र करते, 8GB VRAM सह एकाच GPU वर सुरवातीपासून ट्रेन करते आणि ते वाचत असलेल्या प्रत्येक गोष्टीतून शिकत राहते.

हा प्रकल्प आठवड्याच्या शेवटी हॅकर न्यूजवर दिसला, जिथे तो शंभरहून अधिक गुणांवर पोहोचला आणि GitHub वरील त्याचे भांडार MIT परवान्याअंतर्गत प्रसिद्ध झाले. प्रकल्पाच्या README नुसार, डेटाच्या एकाच प्रवाहातून सतत शिकणे — आपत्तीजनक विसरल्याशिवाय — अगदी माफक, ग्राहक-श्रेणीच्या हार्डवेअरवरही शक्य आहे हे दाखवून देणे हे उद्दिष्ट आहे. For more context on this story, see our ongoing AI trends.

डिस्कवरील वजन, VRAM मध्ये नाही

मिनी-एजीआयमागील मध्यवर्ती युक्ती ही एक अपारंपरिक मेमरी व्यवस्थापन योजना आहे. GPU मेमरीमध्ये सर्व मॉडेल पॅरामीटर्स ठेवण्याऐवजी, सिस्टम त्याचे वजन सामान्य फाइल्स म्हणून डिस्कवर ठेवते आणि आवश्यकतेनुसार ग्राफिक्स कार्डवर पृष्ठे ठेवते.

त्या डिझाईन निवडीचा महत्त्वपूर्ण परिणाम होतो: मॉडेलची पॅरामीटर संख्या VRAM ऐवजी मोकळ्या डिस्क स्पेसने बांधलेली असते. README असे सांगते की मॉडेल प्रशिक्षणादरम्यान नवीन क्षमता वाढवू शकते जेव्हा ते कमी होते, आणि क्षमतेची छाटणी करते ज्यासाठी काहीही विचारत नाही. प्रशिक्षण आणि अनुमान तंतोतंत त्याच कोड मार्गावरून चालतात, म्हणून कोणतीही वेगळी फाइन-ट्यूनिंग व्यवस्था नाही आणि कोणतेही गोठलेले बेस मॉडेल नाही — वाचन आणि प्रशिक्षित करणे, प्रकल्पाच्या शब्दात, समान घटना आहेत.

सिस्टम कमीतकमी 8GB VRAM GPU असलेल्या PC किंवा लॅपटॉपवर लक्ष्यित आहे, हार्डवेअर ज्याचे अनेक विकसक आधीपासूनच मालक आहेत.

सतत शिकणे कठीण का आहे

आज उपलब्ध असलेले बहुतेक भाषा मॉडेल समान जीवनचक्राचे अनुसरण करतात: प्रयोगशाळा मॉडेलला प्रशिक्षण देते, ते गोठवते आणि पाठवते. वापरकर्ते कडाभोवती बारीक-ट्यून करू शकतात, परंतु मूळ वजन पुन्हा कधीही बदलत नाही. प्रकल्पाचा प्रेरणा विभाग असा युक्तिवाद करतो की हे प्रत्येक वैयक्तिक मालकीचे मॉडेल बनवते "आपल्याला पातळ थर असलेले दुसऱ्याचे मॉडेल" - जे ते पाठवण्याच्या दिवशी शिकणे थांबवते.

मशिन लर्निंग संशोधनातील अडथळा हा एक सुप्रसिद्ध आहे: आपत्तीजनक विसरणे, नवीन डेटावर प्रशिक्षित असताना पूर्वी शिकलेले ज्ञान ओव्हरराइट करण्याची न्यूरल नेटवर्कची प्रवृत्ती. एक मॉडेल जे माहितीच्या दैनंदिन प्रवाहातून सतत शिकत असते ते सामान्यत: आधी माहित असलेल्या प्रत्येक गोष्टीवर कमी होते.

README डिझाइनला आकार देणाऱ्या मर्यादांची रूपरेषा दर्शवते. मॉडेलला 8GB VRAM वर बसवावे लागेल — क्वांटायझेशनसह नाही, कारण प्रशिक्षणासाठी ग्रेडियंट आणि ऑप्टिमायझर स्थिती आवश्यक आहे जी स्वतः वजनाच्या मेमरीपेक्षा तिप्पट जोडते. आणि मजकुराच्या न संपणाऱ्या प्रवाहातून नवीन साहित्य आत्मसात करताना ते आधीच जे शिकले आहे ते धरून, हे विसरू नये.

एक बाइट-स्तरीय मॉडेल जे स्वतः तयार करते

मिनी-एजीआय टोकनच्या ऐवजी बाइट स्तरावर कार्य करते, वर्णांचा प्रवाह एका वेळी एक भाग वाचतो आणि प्रत्येक भागावर ग्रेडियंट स्टेप घेतो. प्रकल्पात असेही म्हटले आहे की मॉडेल "स्वतःचे आर्किटेक्चर एकत्र करते," ते पारंपारिक मॉडेल्सपेक्षा वेगळे करते ज्याची रचना त्यांच्या निर्मात्यांद्वारे प्रशिक्षण सुरू होण्यापूर्वी निश्चित केली जाते.

दृष्टीकोन मुद्दाम प्रायोगिक आहे. हे प्रशिक्षण पद्धतीचे छोटे-मोठे प्रदर्शन आहे, सीमाप्रणालींना आव्हान नाही.

महत्वाच्या सूचना

प्रकल्पाचे लेखक सिस्टमच्या सद्य स्थितीबद्दल स्पष्टपणे सांगतात. README च्या स्वतःच्या शब्दात, mini-AGI हे "एक लहान खेळण्यांचे-स्तरीय मॉडेल" आहे आणि वाचकांनी सीमा-स्तरीय क्षमतांची अपेक्षा करू नये. अभ्यासाचा मुद्दा हा आहे की आपत्तीजनक विसरल्याशिवाय एकाच डेटा प्रवाहातून सतत शिकणे अजिबात शक्य आहे — आणि जवळजवळ कोणीही प्रवेश करू शकणाऱ्या हार्डवेअरवर शक्य आहे.

मॉडेलचे वजन अद्याप प्रकाशित झालेले नाही. ट्रेनिंग रन अजूनही ज्या कॉर्पसमधून शिकत आहे त्यावरून पहिला पास पूर्ण करत आहे आणि लेखक म्हणतो की तो पास पूर्ण झाल्यावर वजन सोडले जाईल, जे सध्याच्या दराने काही आठवडे दूर आहे. तोपर्यंत, वाचन दरम्यान मॉडेल कसे सुधारले आहे हे पाहण्यासाठी निरीक्षक प्रकल्प पृष्ठावरील प्रशिक्षणाच्या इतिहासातील नमुन्यांची तपासणी करू शकतात.

हे महत्त्वाचे का आहे

मॉडेलचे प्रमाण अधिक सक्षम आकारापर्यंत पोहोचल्यास, ते वेगळ्या प्रकारच्या AI मालकीकडे निर्देश करते: वैयक्तिक मॉडेल जे तुमच्या स्वतःच्या मशीनवर राहतात, तुम्ही त्यांना फीड करत असलेल्या कागदपत्रे आणि डेटावरून शिकत राहा आणि विक्रेत्याच्या प्रकाशन शेड्यूलद्वारे त्यांचे वजन कधीही गोठवले जात नाही.

AI मधील सर्व मनोरंजक काम सीमेवर होत नसल्याची आठवण करून देणारा हा प्रकल्प आहे. एकल ग्राहक GPU, सामान्य डिस्क स्पेस आणि MIT परवान्यासह, mini-AGI एका प्रश्नाचे उत्तर देण्याचा प्रयत्न करीत आहे की मोठ्या प्रयोगशाळेने मोठ्या प्रमाणात बाजूला केले आहे — लोक कसे करतात हे शिकण्यासाठी मॉडेल तयार केले जाऊ शकते का: सतत, पुढे जे काही समोर येईल त्यातून.

कोड आणि दस्तऐवज GitHub वर सुसंगत हार्डवेअर असलेल्या प्रत्येकासाठी उपलब्ध आहेत ज्यांना त्यांचे अनुसरण करायचे आहे, प्रकल्पाचा काटा काढायचा आहे किंवा मॉडेलला योग्य वाटेल तसे प्रशिक्षण देणे सुरू ठेवायचे आहे.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →