एका ओपन-सोर्स प्रोजेक्टने मायक्रोकंट्रोलरवर 28.9-दशलक्ष-पॅरामीटर लँग्वेज मॉडेल पिळून काढले आहे ज्याची किंमत सुमारे $8 आहे, चिपवर संपूर्णपणे नऊ टोकन प्रति सेकंद या दराने कोणत्याही नेटवर्क कनेक्शनशिवाय मजकूर तयार करतो. GitHub वर प्रकाशित झालेले आणि हॅकर न्यूजच्या पहिल्या पानावर वेगाने चढणारे प्रात्यक्षिक, लहान, स्थानिक AI ची सीमा अगदी कमी वेळात किती पुढे गेली आहे हे दाखवते.

कामाची केंद्रे ESP32-S3 वर आहेत, ही एक स्वस्त एम्बेडेड चिप आहे जी हौशी आणि हार्डवेअर निर्मात्यांमध्ये लोकप्रिय आहे. सिलिकॉनच्या इतक्या लहान तुकड्यावर 28.9-दशलक्ष-पॅरामीटर मॉडेल चालवणे फार पूर्वीच अकल्पनीय वाटले असते आणि हा प्रकल्प ऑन-डिव्हाइस AI कडे असलेल्या व्यापक पुशचे स्पष्ट उदाहरण देतो ज्याचा आम्ही आमच्या दैनंदिन [AI उद्योग कव्हरेज] (https://aibuzzwire.news) मध्ये मागोवा घेतो. जेथे कोणत्याही वास्तविक भाषेच्या मॉडेलसाठी क्लाउडला एकेकाळी अनिवार्य वाटले होते, तेथे वाढत्या सक्षम प्रणाली काठावर घरे शोधत आहेत.

बिल्ड मागे संख्या

प्रकल्प त्याची वैशिष्ट्ये स्पष्टपणे मांडतो. मॉडेल 28.9 दशलक्ष पॅरामीटर्स संचयित करते, त्यापैकी सुमारे 25 दशलक्ष फ्लॅश लुकअप टेबलमध्ये राहतात. हे 512KB जलद SRAM, 8MB PSRAM आणि 16MB फ्लॅश स्टोरेजसह ESP32-S3 चिपवर चालते. प्रॅक्टिसमध्ये ते 9.5 टोकन प्रति सेकंद ते शेवटपर्यंत, किंवा शुद्ध गणनासाठी 9.7 टोकन प्रति सेकंदापर्यंत पोहोचते आणि 4-बिट अचूकतेवर संग्रहित केल्यावर संपूर्ण मॉडेल फक्त 14.9 मेगाबाइट्स व्यापते.

लेखकाने पूर्वी केलेल्या कामाशी केलेली तुलना सर्वात उल्लेखनीय आहे. या वर्गातील चिपवर चालण्यासाठी ज्ञात असलेल्या शेवटच्या भाषेच्या मॉडेलमध्ये फक्त 260,000 पॅरामीटर्स आहेत. नवीन बिल्डमध्ये अंदाजे शंभरपट जास्त आहे, एक उडी जी मोठ्या चिपमधून नाही तर मॉडेलचा डेटा प्रत्यक्षात कोठे राहतो यावर पुनर्विचार केल्याने येते.

Gemma कडून घेतलेली मेमरी ट्रिक

मुख्य समस्या अशी आहे की मायक्रोकंट्रोलरकडे जवळजवळ कोणतीही वेगवान मेमरी नसते. ESP32-S3 फक्त 512KB SRAM ऑफर करते, आणि पारंपारिकपणे संपूर्ण मॉडेल तेथून पोहोचण्यायोग्य असणे आवश्यक आहे, म्हणूनच मागील प्रयत्न काही लाख पॅरामीटर्सवर अडकले होते.

उपाय साध्या निरीक्षणावर अवलंबून आहे. भाषा मॉडेलचे बहुतेक पॅरामीटर्स एम्बेडिंग टेबलमध्ये बसतात, ज्यावरून मॉडेल गणना करण्याऐवजी वाचते. त्यामुळे त्या प्रचंड 25-दशलक्ष-पंक्ती टेबलला दुर्मिळ जलद मेमरीमध्ये भाग पाडण्याऐवजी, प्रकल्प ते स्लो फ्लॅश स्टोरेजमध्ये सोडतो आणि प्रत्येक टोकनला प्रत्यक्षात आवश्यक असलेल्या मूठभर पंक्ती एका वेळी सुमारे 450 बाइट्स खेचतो. वास्तविक गणना करणाऱ्या मॉडेलचा लहान भाग जलद मेमरीमध्ये राहतो, तर मोठ्या प्रमाणात वजन फक्त फ्लॅशमध्ये थांबते, एका वेळी थोडेसे नमुना केले जाते.

ते तंत्र पर-लेयर एम्बेडिंग्स म्हणून ओळखले जाते, आणि ते Google च्या जेम्मा मॉडेल्सपासून उद्भवले, विशेषतः जेम्मा 3n आणि जेम्मा 4, जेथे ते फोन आणि GPU साठी डिझाइन केले गेले होते. प्रकल्पाच्या लेखकाच्या म्हणण्यानुसार, याआधी या लहान चिपवर कोणीही प्रयत्न केला नव्हता.

तो काय करू शकतो आणि काय करू शकत नाही

मॉडेलला TinyStories वर प्रशिक्षित केले गेले होते, साध्या मुलांच्या कथांचा डेटासेट, त्यामुळे त्याची क्षमता जाणूनबुजून संकुचित आहे. हे लहान, मुख्यतः सुसंगत कथा लिहिते, परंतु ते तथ्यात्मक प्रश्नांची उत्तरे देणार नाही, जटिल सूचनांचे पालन करणार नाही, कोड लिहू शकत नाही किंवा जगाविषयी कारण देत नाही. लेखक स्पष्टपणे सांगतात की ही मर्यादा मॉडेलच्या छोट्या तर्कशक्तीच्या भागातून उद्भवली आहे आणि मेमरी युक्ती ते बदलत नाही.

प्रकल्पाला मनोरंजक बनवणारी गोष्ट म्हणजे त्याची आउटपुट गुणवत्ता नाही तर त्याची वास्तुकला. उपलब्धी म्हणजे एवढ्या मोठ्या मॉडेलला या छोट्या चिपवर बसवणे, हे सिद्ध करते की फोन आणि सर्व्हरवर कार्यक्षम मॉडेल्सला उर्जा देणारी तीच तंत्रे सँडविचपेक्षा कमी किंमतीच्या हार्डवेअरपर्यंत खाली ढकलली जाऊ शकतात.

ऑन-डिव्हाइस AI का महत्त्वाचे आहे

परिणाम एक व्यवस्थित तांत्रिक डेमोच्या पलीकडे पोहोचतात. कारण मॉडेल पूर्णपणे चिपवर चालते, सर्व्हरवर काहीही पाठवले जात नाही. याचा अर्थ बांधकामानुसार संपूर्ण गोपनीयता, कोणताही डेटा डिव्हाइस सोडत नाही आणि भरण्यासाठी कोणतेही क्लाउड बिल नाही. दुर्गम भागातील अनुप्रयोगांसाठी, कमी-पॉवर डिव्हाइसेससाठी किंवा कनेक्टिव्हिटी अविश्वसनीय आहे अशा सेटिंग्जसाठी, ते संयोजन खरोखर उपयुक्त आहे.

हे अशा भविष्याकडे देखील निर्देश करते ज्यामध्ये मूठभर विशाल डेटा केंद्रांमध्ये केंद्रित करण्याऐवजी कोट्यवधी स्वस्त एम्बेडेड उपकरणांमध्ये लहान, विशेष मॉडेल वितरित केले जातात. लॅपटॉप आणि फोनवर स्थानिक AI मध्ये स्वारस्य वाढवणारे समान दबाव, म्हणजे कमी विलंबता, कमी किंमत आणि अधिक मजबूत गोपनीयता, मायक्रोकंट्रोलर स्केलवर आणखी जोरदारपणे लागू होते.

टिंकरला खुले आमंत्रण

प्रकल्प अनुज्ञेय MIT परवान्याअंतर्गत जारी करण्यात आला आहे, आणि लेखकाने तपशीलवार दस्तऐवजीकरण आणि बेंचमार्क परिणामांसह संपूर्ण कोड GitHub वर सामायिक केला आहे. त्या मोकळेपणाचा अर्थ असा आहे की इतर हार्डवेअर डेव्हलपर या दृष्टिकोनाचा अभ्यास करू शकतात, ते इतर चिप्सशी जुळवून घेऊ शकतात किंवा पॅरामीटरची संख्या अधिक वाढवू शकतात.

slvDev हँडल अंतर्गत रिलीज केलेले, हे काम विकसक समुदायामध्ये जोरदारपणे प्रतिध्वनित झाले, हॅकर न्यूजवर शेकडो अपव्होट्स एकत्रित केले आणि तंत्र पुढे कुठे जाऊ शकते याबद्दल चर्चा करण्यास प्रवृत्त केले. हा ट्रेंड कायम राहिल्यास, "भाषा मॉडेल" आणि एम्बेडेड सॉफ्टवेअरचा एक सामान्य तुकडा यांच्यातील रेषा मोठ्या प्रमाणात अस्पष्ट होणार आहे.

AI च्या पुढे रहा

$8 चिप्सपासून ते अब्ज डॉलर्सच्या डेटा सेंटर्सपर्यंत, AI कुठे चालते हा प्रश्न AI काय करू शकतो तितकाच महत्त्वाचा बनत आहे. हार्डवेअर स्तर बहुतेक लोकांच्या लक्षात येण्यापेक्षा वेगाने विकसित होत आहे आणि आज जिज्ञासासारखे दिसणारे प्रकल्प बहुतेकदा उद्याच्या मुख्य प्रवाहाची व्याख्या करतात. AI Buzz Wire वर अधिक AI बातम्या वाचा एज कॉम्प्युटिंग, मॉडेल कार्यक्षमता आणि डिव्हाइसवरील बुद्धिमत्तेमधील प्रत्येक प्रगतीचे अनुसरण करण्यासाठी.

एआय हार्डवेअर क्रांतीसोबत रहा — एआय बझ वायरला भेट द्या