Google ने EmbeddingGemma 2 लॉन्च किया, जो एक खुला, हल्का एम्बेडिंग मॉडल है जो मूल रूप से टेक्स्ट, छवियों, ऑडियो और वीडियो के संयोजन को एक एकीकृत एम्बेडिंग स्थान में मैप करता है। Google डीपमाइंड के अनुसंधान इंजीनियरों साहिल दुआ और हेनरिक शेचटर वेरा द्वारा 6 अक्टूबर, 2026 को पोस्ट की गई घोषणा में 740 मिलियन-पैरामीटर मॉडल को ऑन-डिवाइस मल्टीमॉडल एम्बेडिंग के लिए सबसे सक्षम विकल्प के रूप में रखा गया है, जो व्यावसायिक रूप से अनुमेय अपाचे 2.0 लाइसेंस के तहत जारी किया गया है और जेम्मा 4 आर्किटेक्चर पर बनाया गया है।

पहला एंबेडिंगजेम्मा Google की अपेक्षाओं से अधिक हो गया, 20 मिलियन से अधिक डाउनलोड के साथ ऑन-डिवाइस सर्च टूल और गोपनीयता-प्रथम पुनर्प्राप्ति संवर्धित पीढ़ी पाइपलाइनों को सशक्त बनाया गया। सीक्वेल ने तत्काल डेवलपर रुचि पैदा की, दिन की सबसे बड़ी हैकर समाचार चर्चाओं में से एक को आकर्षित किया क्योंकि बिल्डरों ने मूल्यांकन किया कि स्थानीय [एआई समाचार] (https://aibuzzwire.news) ऐप्स, मीडिया लाइब्रेरी और आरएजी सिस्टम के लिए एकल मल्टीमॉडल एम्बेडर का क्या मतलब है जो कभी भी क्लाउड को नहीं छूते हैं।

टेक्स्ट, कोड, छवियाँ, ऑडियो और वीडियो के लिए एक मॉडल

एंबेडिंगजेम्मा 2 की हेडलाइन क्षमता मूल मल्टीमॉडलिटी है। प्रति तौर-तरीके के अनुसार अलग-अलग एनकोडर चलाने और परिणामों को एक साथ जोड़ने के बजाय, मॉडल टेक्स्ट, कोड, छवियों, वीडियो और ऑडियो के संयोजन को एक साझा स्थान में एम्बेड करता है। Google के उदाहरणों में क्वेरी के रूप में वॉइस मेमो का उपयोग करके एक विशिष्ट वीडियो क्लिप ढूंढना, या टेक्स्ट प्रॉम्प्ट के साथ घंटों की ऑडियो रिकॉर्डिंग खोजना शामिल है, सभी को स्थानीय हार्डवेयर पर एक ही मॉडल द्वारा संसाधित किया जाता है।

आर्किटेक्चर मॉड्यूलर है. टेक्स्ट-ओनली कोर के लिए कम से कम 270 मिलियन पैरामीटर की आवश्यकता होती है, जिसमें वैकल्पिक दृष्टि (170 मिलियन पैरामीटर) और ऑडियो (300 मिलियन पैरामीटर) एनकोडर पूर्ण मल्टीमॉडल समर्थन जोड़ते हैं। इसलिए डेवलपर्स आज एक कॉम्पैक्ट टेक्स्ट एम्बेडर तैनात कर सकते हैं और मॉडल परिवारों को बदले बिना पूर्ण मल्टीमॉडल पुनर्प्राप्ति में विकसित हो सकते हैं।

बेंचमार्क परिणाम और भंडारण क्षमता

Google की रिपोर्ट है कि एंबेडिंगजेम्मा 2 एमटीईबी (मैसिव टेक्स्ट एंबेडिंग बेंचमार्क) कोड और एमएईबी (मैसिव ऑडियो एंबेडिंग बेंचमार्क) सहित बेंचमार्क पर सब-1बी मल्टीमॉडल एंबेडर्स के बीच अग्रणी स्कोर हासिल करता है, जबकि टेक्स्ट, विज़न और ऑडियो कार्यों में कई बड़े मॉडलों से मेल खाता है या उनसे बेहतर प्रदर्शन करता है। सबसे ठोस लाभ कोड में है: एमटीईबी कोड प्रदर्शन 9.92 अंक उछलकर 68.76 से 78.68 हो गया, जिसके बारे में Google का कहना है कि यह मॉडल स्थानीय कोडबेस इंडेक्सिंग, सिमेंटिक कोड खोज और कोडिंग एजेंट पुनर्प्राप्ति के लिए उपयुक्त है। छवि, वीडियो, दस्तावेज़ और ऑडियो में, कंपनी उप-1बी मॉडल के लिए गुणवत्ता-प्रति-पैरामीटर में एक नए मानक का दावा करती है, यह कहते हुए कि यह कुछ विशेषज्ञ मॉडलों को अपने आकार से दोगुने से भी अधिक बेहतर प्रदर्शन करता है।

भंडारण दक्षता मैत्रियोश्का रिप्रेजेंटेशन लर्निंग (एमआरएल) से आती है। आउटपुट वैक्टर को गतिशील रूप से 768 आयामों से 512, 256, या 128 आयामों तक छोटा किया जा सकता है, जिससे स्थानीय वेक्टर डेटाबेस और मेमोरी उपयोग के लिए 6x स्टोरेज में कमी आती है। फोन या एम्बेडेड हार्डवेयर पर पुनर्प्राप्ति चलाने वाले डेवलपर्स के लिए, यह अंतर अक्सर यह निर्धारित करता है कि कोई फीचर शिप करता है या नहीं।

सख्त हार्डवेयर बजट के लिए डिज़ाइन किया गया

ऑन-डिवाइस फ़ुटप्रिंट मॉडल का मुख्य विक्रय बिंदु है। परिमाणीकरण के साथ, Google रिपोर्ट करता है कि EmbeddingGemma 2 को केवल-पाठ भार के लिए लगभग 191MB सक्रिय RAM और Google Pixel 11 Pro पर पूर्ण मल्टीमॉडल मॉडल के लिए लगभग 567MB की आवश्यकता होती है। संदर्भ विंडो भी 8,000 टोकन तक बढ़ गई है, जो एंबेडिंगजेम्मा 1 से चार गुना बड़ी है, जो एक ही पास में 5.5 मिनट के ऑडियो, 29 छवियों, या 58 वीडियो फ़्रेमों या उनके इंटरलीव्ड संयोजनों को संसाधित करने के लिए पर्याप्त है।

क्योंकि मॉडल अपने टेक्स्ट टोकननाइज़र और ऑडियो एनकोडर को जेम्मा 4 के साथ साझा करता है, डेवलपर्स कम संयुक्त मेमोरी फ़ुटप्रिंट के साथ एक एकीकृत पाइपलाइन में जेम्मा 4 के साथ एंबेडिंगजेम्मा 2 चला सकते हैं, जिससे ऑन-डिवाइस आरएजी सक्षम हो जाता है जहां पुनर्प्राप्ति और पीढ़ी दोनों स्थानीय रूप से होती है। Google अपने AI एज फ़ोरसाइट ऐप में इसे प्रदर्शित करता है, स्थानीय फ़ाइल पुनर्प्राप्ति को जेम्मा 4 प्रासंगिक तर्क के साथ जोड़ता है।

टूलींग और उपलब्धता

मॉडल Google के AI Edge टूलिंग के माध्यम से उपलब्ध है। Google AI एज गैलरी ऐप इंस्टेंट मीडिया सर्च दिखाता है, जो टेक्स्ट या छवि क्वेरी से अर्थपूर्ण समानता के आधार पर लाइब्रेरी मिलान ढूंढता है, और एक वीडियो मोमेंट्स फाइंडर जो टेक्स्ट या ऑडियो क्वेरी का उपयोग करके विशिष्ट दृश्यों का पता लगाता है। वास्तविक समय वर्गीकरण, रूटिंग और पूर्वानुमानित उपयोग के मामले मीडियापाइप डिसीजन टास्क एपीआई और Google के एआई एज ब्लॉग दस्तावेज़ों के माध्यम से उजागर होते हैं कि लाइटआरटी के साथ ऑन-डिवाइस खोज और आरएजी सिस्टम कैसे बनाएं। पूर्ण मूल्यांकन मेट्रिक्स मॉडल कार्ड में उपलब्ध हैं।

ऑन-डिवाइस एंबेडिंग क्यों मायने रखती है

एंबेडिंग मॉडल शायद ही कभी फ्रंटियर चैट मॉडल की तरह सुर्खियां बटोरते हैं, लेकिन वे सबसे व्यावहारिक एआई सुविधाओं के नीचे बैठते हैं: आरएजी के लिए सिमेंटिक सर्च, सिफारिश, डिडुप्लीकेशन, वर्गीकरण और पुनर्प्राप्ति। उन्हें स्थानीय स्तर पर चलाने से गोपनीयता और विलंबता गणना पूरी तरह से बदल जाती है। डेटा कभी भी डिवाइस को नहीं छोड़ता है, क्वेरीज़ ऑफ़लाइन काम करती हैं, और कोई प्रति-कॉल एपीआई लागत नहीं है, जो अरबों एम्बेडेड डिवाइसों के पैमाने पर मायने रखती है।

एंबेडिंगजेम्मा 2 कुशल ओपन-मॉडल स्पेस में प्रतिस्पर्धा को भी तेज करता है, जहां Google, मेटा, मिस्ट्रल और छोटी प्रयोगशालाओं का एक समूह यह साबित करने के लिए दौड़ रहा है कि उपयोगी AI डेटा सेंटर के बिना भी चल सकता है। एक फोन पर पांच तौर-तरीकों को संभालने वाला 740एम-पैरामीटर मॉडल उस दौड़ में एक उल्लेखनीय मार्कर है। यदि इसके पूर्ववर्ती का डाउनलोड प्रक्षेपवक्र कोई संकेत है, तो उम्मीद है कि आने वाले महीनों में एंबेडिंगजेम्मा 2 मोबाइल और एज उत्पादों की एक विस्तृत श्रृंखला में दिखाई देगा।

एआई वक्र से आगे रहें

ऑन-डिवाइस AI अधिकांश लोगों की सोच से भी अधिक तेजी से आगे बढ़ रहा है। प्रत्येक प्रमुख मॉडल लॉन्च, बेंचमार्क और डेवलपर टूल रिलीज़ के कवरेज के लिए aibuzzwire.news पर नवीनतम AI समाचार पढ़ें।

अधिक AI समाचार पढ़ें →