Google ने EmbeddingGemma 2 लाँच केले, एक ओपन, लाइटवेट एम्बेडिंग मॉडेल जे मूळपणे मजकूर, प्रतिमा, ऑडिओ आणि व्हिडिओ यांचे संयोजन एकाच युनिफाइड एम्बेडिंग स्पेसमध्ये मॅप करते. 6 ऑक्टोबर 2026 रोजी Google DeepMind संशोधन अभियंता साहिल दुआ आणि Henrique Schechter Vera यांनी पोस्ट केलेली घोषणा, 740-दशलक्ष-पॅरामीटर मॉडेलला ऑन-डिव्हाइस मल्टीमॉडल एम्बेडिंगसाठी सर्वात सक्षम पर्याय म्हणून स्थान देते, जी व्यावसायिकदृष्ट्या परवानगी असलेल्या Apache 2.0 लायसन्स अंतर्गत जारी केली गेली आहे आणि Garchitem4 वर तयार केलेली आहे.

20 दशलक्षाहून अधिक डाउनलोड ऑन-डिव्हाइस शोध साधने आणि गोपनीयता-प्रथम पुनर्प्राप्ती संवर्धित जनरेशन पाइपलाइनसह, पहिल्या एम्बेडिंगगेमाने Google च्या अपेक्षा ओलांडल्या. सीक्वलने तत्काळ विकसकाची आवड निर्माण केली, ज्याने दिवसभरातील सर्वात मोठ्या हॅकर न्यूज चर्चेपैकी एक बनवले कारण बिल्डर्सने स्थानिक AI न्यूज ॲप्स, मीडिया लायब्ररी आणि RAG सिस्टम्ससाठी एक मल्टीमोडल एम्बेडर म्हणजे काय याचे मूल्यांकन केले जे कधीही क्लाउडला स्पर्श करत नाही.

मजकूर, कोड, प्रतिमा, ऑडिओ आणि व्हिडिओसाठी एक मॉडेल

एम्बेडिंगगेमा 2 ची हेडलाइन क्षमता मूळ मल्टीमोडॅलिटी आहे. प्रत्येक मोडॅलिटीसाठी स्वतंत्र एन्कोडर चालवण्याऐवजी आणि परिणाम एकत्र स्टिच करण्याऐवजी, मॉडेल मजकूर, कोड, प्रतिमा, व्हिडिओ आणि ऑडिओचे संयोजन एका सामायिक केलेल्या जागेत एम्बेड करते. Google च्या उदाहरणांमध्ये क्वेरी म्हणून व्हॉइस मेमो वापरून विशिष्ट व्हिडिओ क्लिप शोधणे किंवा मजकूर प्रॉम्प्टसह ऑडिओ रेकॉर्डिंगचे तास शोधणे समाविष्ट आहे, हे सर्व स्थानिक हार्डवेअरवर एकाच मॉडेलद्वारे प्रक्रिया केलेले आहे.

आर्किटेक्चर मॉड्यूलर आहे. केवळ-मजकूर कोरसाठी 270 दशलक्ष पॅरामीटर्स आवश्यक आहेत, ज्यामध्ये पर्यायी दृष्टी (170 दशलक्ष पॅरामीटर्स) आणि ऑडिओ (300 दशलक्ष पॅरामीटर्स) एन्कोडर पूर्ण मल्टीमोडल समर्थन जोडतात. त्यामुळे डेव्हलपर आज कॉम्पॅक्ट टेक्स्ट एम्बेडर तैनात करू शकतात आणि मॉडेल फॅमिली न बदलता संपूर्ण मल्टीमोडल पुनर्प्राप्तीमध्ये वाढू शकतात.

बेंचमार्क परिणाम आणि स्टोरेज कार्यक्षमता

Google अहवाल देतो की एम्बेडिंगजेम्मा 2 ने मजकूर, दृष्टी आणि ऑडिओ टास्कमध्ये अनेक मोठ्या मॉडेल्सशी जुळवून घेताना किंवा मात करताना MTEB (मॅसिव्ह टेक्स्ट एम्बेडिंग बेंचमार्क) कोड आणि MAEB (मॅसिव्ह ऑडिओ एम्बेडिंग बेंचमार्क) सह बेंचमार्कवर सब-1B मल्टीमॉडल एम्बेडर्समध्ये अग्रगण्य स्कोअर प्राप्त केले आहेत. कोडमध्ये सर्वात ठोस फायदा आहे: MTEB कोड कामगिरी 9.92 पॉइंट्सने 68.76 वरून 78.68 वर उडी मारली, जे Google म्हणते की मॉडेल स्थानिक कोडबेस इंडेक्सिंग, सिमेंटिक कोड शोध आणि कोडिंग एजंट पुनर्प्राप्तीसाठी योग्य आहे. प्रतिमा, व्हिडिओ, दस्तऐवज आणि ऑडिओमध्ये, कंपनी सब-1B मॉडेल्ससाठी गुणवत्ता-प्रति-पॅरामीटरमध्ये नवीन मानकाचा दावा करते, असे म्हणते की ती काही विशेषज्ञ मॉडेल्सच्या आकारापेक्षा दुप्पट आहे.

स्टोरेज कार्यक्षमता Matryoshka रिप्रेझेंटेशन लर्निंग (MRL) मधून येते. आउटपुट वेक्टर डायनॅमिकली 768 मितींवरून 512, 256, किंवा 128 मितींपर्यंत कमी केले जाऊ शकतात, स्थानिक वेक्टर डेटाबेस आणि मेमरी वापरासाठी 6x स्टोरेज कपात करतात. फोन किंवा एम्बेडेड हार्डवेअरवर पुनर्प्राप्ती चालवणाऱ्या विकसकांसाठी, हा फरक अनेकदा वैशिष्ट्य शिप करतो की नाही हे निर्धारित करतो.

कठोर हार्डवेअर बजेटसाठी डिझाइन केलेले

ऑन-डिव्हाइस फूटप्रिंट हा मॉडेलचा मूळ विक्री बिंदू आहे. क्वांटायझेशनसह, Google अहवाल देतो की एम्बेडिंगगेमा 2 ला फक्त मजकूर-वेटसाठी 191MB सक्रिय RAM आणि Google Pixel 11 Pro वर संपूर्ण मल्टीमोडल मॉडेलसाठी सुमारे 567MB आवश्यक आहे. संदर्भ विंडो 8,000 टोकन्सपर्यंत वाढली आहे, एम्बेडिंगगेमा 1 पेक्षा चार पट मोठी, 5.5 मिनिटांपर्यंत ऑडिओ, 29 प्रतिमा, किंवा 58 व्हिडिओ फ्रेम्स एका पासमध्ये प्रक्रिया करण्यासाठी पुरेशी आहे, किंवा त्यांचे इंटरलीव्ह कॉम्बिनेशन.

मॉडेलने त्याचा टेक्स्ट टोकनायझर आणि ऑडिओ एन्कोडर Gemma 4 सह शेअर केल्यामुळे, डेव्हलपर एम्बेडिंगGemma 2 Gemma 4 सोबत कमी एकत्रित मेमरी फूटप्रिंटसह युनिफाइड पाइपलाइनमध्ये चालवू शकतात, ऑन-डिव्हाइस RAG सक्षम करते जेथे पुनर्प्राप्ती आणि जनरेशन दोन्ही स्थानिक पातळीवर होतात. Google ने हे त्याच्या AI Edge फोरसाइट ॲपमध्ये दाखवून दिले आहे, Gemma 4 संदर्भित तर्कासह स्थानिक फाइल पुनर्प्राप्ती जोडून.

टूलिंग आणि उपलब्धता

हे मॉडेल गुगलच्या एआय एज टूलिंगद्वारे उपलब्ध आहे. Google AI Edge Gallery ॲप इन्स्टंट मीडिया शोध दर्शविते, जे मजकूर किंवा प्रतिमा क्वेरींमधून अर्थपूर्ण समानतेद्वारे लायब्ररी जुळण्या शोधते आणि मजकूर किंवा ऑडिओ क्वेरी वापरून विशिष्ट दृश्ये शोधणारा व्हिडिओ क्षण शोधक. रिअल-टाइम वर्गीकरण, राउटिंग, आणि भविष्यसूचक वापर प्रकरणे MediaPipe Decision Task API द्वारे उघड केली जातात आणि Google च्या AI Edge ब्लॉग दस्तऐवजात ऑन-डिव्हाइस शोध आणि LiteRT सह RAG प्रणाली कशी तयार करावी. संपूर्ण मूल्यमापन मेट्रिक्स मॉडेल कार्डमध्ये उपलब्ध आहेत.

ऑन-डिव्हाइस एम्बेडिंग का महत्त्वाचे आहे

एम्बेडिंग मॉडेल्स क्वचितच फ्रंटियर चॅट मॉडेल्सप्रमाणे मथळे बनवतात, परंतु ते सर्वात व्यावहारिक AI वैशिष्ट्यांच्या खाली बसतात: शब्दार्थ शोध, शिफारस, डुप्लिकेशन, वर्गीकरण आणि RAG साठी पुनर्प्राप्ती. त्यांना स्थानिक पातळीवर चालवल्याने गोपनीयता आणि विलंबता कॅल्क्युलस पूर्णपणे बदलतो. डेटा कधीही डिव्हाइसमधून बाहेर पडत नाही, क्वेरी ऑफलाइन कार्य करतात आणि प्रति-कॉल API किंमत नसते, जी अब्जावधी एम्बेडेड डिव्हाइसेसच्या प्रमाणात महत्त्वाची असते.

EmbeddingGemma 2 कार्यक्षम ओपन-मॉडेल स्पेसमध्ये देखील स्पर्धा वाढवते, जिथे Google, Meta, Mistral आणि काही लहान लॅब्स हे सिद्ध करण्यासाठी धावत आहेत की उपयुक्त AI डेटा सेंटरशिवाय चालू शकते. फोनवर पाच पद्धती हाताळणारे 740M-पॅरामीटर मॉडेल त्या शर्यतीतील एक उल्लेखनीय चिन्हक आहे. त्याच्या पूर्ववर्ती डाउनलोड मार्गक्रमण कोणतेही संकेत असल्यास, एम्बेडिंगगेमा 2 येत्या काही महिन्यांत मोबाइल आणि एज उत्पादनांच्या विस्तृत श्रेणीमध्ये दर्शविले जाण्याची अपेक्षा करा.

एआय कर्वच्या पुढे रहा

ऑन-डिव्हाइस AI बहुतेक लोकांच्या लक्षात येण्यापेक्षा वेगाने प्रगती करत आहे. aibuzzwire.news वर नवीनतम AI बातम्या वाचा प्रत्येक प्रमुख मॉडेल लॉन्च, बेंचमार्क आणि डेव्हलपर टूल रिलीझच्या कव्हरेजसाठी.

अधिक एआय बातम्या वाचा →