एक नया ओपन-सोर्स प्रोजेक्ट मशीन लर्निंग की जिद्दी सीमाओं में से एक से निपटने के लिए ध्यान आकर्षित कर रहा है: एक ऐसा भाषा मॉडल बनाना जो सीखना कभी बंद न करे। मिनी-एजीआई कहा जाने वाला यह प्रोजेक्ट खुद को एक निरंतर सीखने, बाइट-स्तरीय भाषा मॉडल के रूप में वर्णित करता है जो अपने स्वयं के आर्किटेक्चर को इकट्ठा करता है, 8 जीबी वीआरएएम के साथ एक जीपीयू पर स्क्रैच से प्रशिक्षित करता है, और जो कुछ भी पढ़ता है उससे सीखता रहता है।

यह प्रोजेक्ट सप्ताहांत में हैकर न्यूज़ पर दिखाई दिया, जहां यह सौ से अधिक अंक तक चढ़ गया, और GitHub पर इसका भंडार MIT लाइसेंस के तहत जारी किया गया है। परियोजना के रीडमी के अनुसार, लक्ष्य यह प्रदर्शित करना है कि डेटा की एक ही धारा से निरंतर सीखना - बिना किसी विनाशकारी भूल के - मामूली, उपभोक्ता-ग्रेड हार्डवेयर पर भी संभव है। For more context on this story, see our ongoing artificial intelligence updates.

वजन डिस्क पर है, वीआरएएम में नहीं

मिनी-एजीआई के पीछे केंद्रीय चाल एक अपरंपरागत मेमोरी प्रबंधन योजना है। जीपीयू मेमोरी में सभी मॉडल मापदंडों को रखने के बजाय, सिस्टम अपने वजन को डिस्क पर सामान्य फ़ाइलों के रूप में संग्रहीत करता है और उन्हें आवश्यकतानुसार ग्राफिक्स कार्ड पर पेज करता है।

उस डिज़ाइन विकल्प का एक महत्वपूर्ण परिणाम होता है: मॉडल की पैरामीटर गणना वीआरएएम के बजाय मुक्त डिस्क स्थान से बंधी होती है। README में कहा गया है कि मॉडल कम चलने पर प्रशिक्षण के दौरान नई क्षमता विकसित कर सकता है, और ऐसी क्षमता को कम कर सकता है जिसकी किसी को आवश्यकता नहीं होती। प्रशिक्षण और अनुमान बिल्कुल एक ही कोड पथ के माध्यम से चलते हैं, इसलिए कोई अलग फाइन-ट्यूनिंग व्यवस्था नहीं है और कोई जमे हुए आधार मॉडल नहीं है - परियोजना के शब्दों में, पढ़ना और प्रशिक्षित होना एक ही घटना है।

सिस्टम को कम से कम 8 जीबी वीआरएएम जीपीयू वाले पीसी या लैपटॉप पर लक्षित किया गया है, हार्डवेयर जो कई डेवलपर्स के पास पहले से ही है।

लगातार सीखना कठिन क्यों है

आज उपलब्ध अधिकांश भाषा मॉडल एक ही जीवनचक्र का पालन करते हैं: एक प्रयोगशाला एक मॉडल को प्रशिक्षित करती है, उसे फ्रीज करती है और उसे शिप करती है। उपयोगकर्ता किनारों के चारों ओर फाइन-ट्यून कर सकते हैं, लेकिन आधार भार फिर कभी नहीं बदलता। परियोजना के प्रेरणा अनुभाग का तर्क है कि यह प्रत्येक व्यक्तिगत स्वामित्व वाले मॉडल को "किसी और का मॉडल जिसके ऊपर आपकी एक पतली परत होती है" बनाता है - एक ऐसा मॉडल जो जिस दिन शिप होता है उस दिन सीखना बंद कर देता है।

मशीन लर्निंग अनुसंधान में बाधा एक प्रसिद्ध बाधा है: भयावह भूल, नए डेटा पर प्रशिक्षित होने पर पहले से सीखे गए ज्ञान को अधिलेखित करने की तंत्रिका नेटवर्क की प्रवृत्ति। एक मॉडल जो सूचना के दैनिक प्रवाह से लगातार सीखता है, आम तौर पर वह सब कुछ कम कर देता है जो वह पहले जानता था।

README उन बाधाओं को रेखांकित करता है जिन्होंने डिज़ाइन को आकार दिया। मॉडल को 8 जीबी वीआरएएम पर फिट होना है - परिमाणीकरण के साथ नहीं, क्योंकि प्रशिक्षण के लिए ग्रेडिएंट्स और ऑप्टिमाइज़र स्थिति की आवश्यकता होती है जो वज़न की मेमोरी को लगभग तीन गुना जोड़ते हैं। और इसे पाठ की अंतहीन धारा से नई सामग्री को आत्मसात करते हुए जो कुछ भी सीखा है उसे पकड़कर रखना नहीं भूलना चाहिए।

एक बाइट-स्तरीय मॉडल जो स्वयं बनाता है

मिनी-एजीआई टोकन के बजाय बाइट स्तर पर काम करता है, एक समय में वर्णों की एक धारा को पढ़ता है और प्रत्येक टुकड़े पर एक क्रमिक कदम उठाता है। परियोजना यह भी कहती है कि मॉडल "अपनी स्वयं की वास्तुकला को इकट्ठा करता है", इसे पारंपरिक मॉडल से अलग करता है जिनकी संरचना प्रशिक्षण शुरू होने से पहले उनके रचनाकारों द्वारा तय की जाती है।

दृष्टिकोण जानबूझकर प्रयोगात्मक है. यह प्रशिक्षण व्यवस्था का एक छोटे पैमाने का प्रदर्शन है, न कि सीमांत प्रणालियों के लिए कोई चुनौती।

महत्वपूर्ण चेतावनियाँ

प्रोजेक्ट के लेखक सिस्टम की वर्तमान स्थिति के बारे में स्पष्ट हैं। रीडमी के अपने शब्दों में, मिनी-एजीआई "एक छोटा खिलौना-स्तरीय मॉडल" है और पाठकों को सीमांत-स्तरीय क्षमताओं की अपेक्षा नहीं करनी चाहिए। अभ्यास का उद्देश्य यह दिखाना है कि बिना किसी भयावह भूल के एक ही डेटा स्ट्रीम से लगातार सीखना संभव है - और हार्डवेयर पर भी संभव है जिसे लगभग कोई भी एक्सेस कर सकता है।

मॉडल का वजन अभी तक प्रकाशित नहीं किया गया है। प्रशिक्षण दौड़ अभी भी उस कोष पर अपना पहला पास पूरा कर रही है जिससे वह सीख रही है, और लेखक का कहना है कि पास पूरा होने के बाद वजन जारी किया जाएगा, जो वर्तमान दर पर कुछ सप्ताह दूर है। तब तक, पर्यवेक्षक प्रोजेक्ट पेज पर प्रशिक्षण रन के इतिहास से नमूनों का निरीक्षण कर सकते हैं ताकि यह देखा जा सके कि पढ़ने के दौरान मॉडल में कैसे सुधार हुआ है।

यह क्यों मायने रखता है

यदि दृष्टिकोण मॉडल के अधिक सक्षम आकारों तक पहुंचने पर कायम रहता है, तो यह एक अलग प्रकार के एआई स्वामित्व की ओर इशारा करता है: व्यक्तिगत मॉडल जो आपकी मशीन पर रहते हैं, आपके द्वारा उन्हें खिलाए गए दस्तावेज़ों और डेटा से सीखते रहते हैं, और विक्रेता के रिलीज शेड्यूल से उनका वजन कभी नहीं रुकता है।

यह परियोजना यह भी याद दिलाती है कि एआई में सभी दिलचस्प काम सीमा पर नहीं हो रहे हैं। एकल उपभोक्ता जीपीयू, साधारण डिस्क स्थान और एक एमआईटी लाइसेंस के साथ, मिनी-एजीआई एक प्रश्न का उत्तर देने का प्रयास कर रहा है जिसे बड़ी प्रयोगशालाओं ने काफी हद तक नजरअंदाज कर दिया है - क्या लोगों को सीखने के तरीके को सीखने के लिए एक मॉडल बनाया जा सकता है: लगातार, जो कुछ भी इसका सामना होता है उससे।

कोड और दस्तावेज़ीकरण संगत हार्डवेयर वाले किसी भी व्यक्ति के लिए GitHub पर उपलब्ध हैं, जो प्रोजेक्ट का अनुसरण करना चाहते हैं, या मॉडल का प्रशिक्षण जारी रखना चाहते हैं, जैसा उन्हें उचित लगे।

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →