Google نے EmbeddingGemma 2 لانچ کیا، ایک کھلا، ہلکا پھلکا سرایت کرنے والا ماڈل جو متن، تصاویر، آڈیو، اور ویڈیو کے امتزاج کو ایک واحد متحد جگہ میں نقشہ بناتا ہے۔ اعلان، 6 اکتوبر 2026 کو گوگل ڈیپ مائنڈ ریسرچ انجینئرز ساحل دعا اور ہنریک شیچٹر ویرا کے ذریعہ پوسٹ کیا گیا، 740 ملین پیرامیٹر ماڈل کو آن ڈیوائس ملٹی موڈل ایمبیڈنگز کے لیے سب سے زیادہ قابل اختیار کے طور پر پیش کیا گیا ہے، جو تجارتی طور پر اجازت یافتہ Apache 2.0 لائسنس کے تحت جاری کیا گیا ہے اور Garchitem4 پر بنایا گیا ہے۔
پہلا EmbeddingGemma گوگل کی توقعات سے تجاوز کر گیا، جس میں 20 ملین سے زیادہ ڈاؤن لوڈز آن ڈیوائس سرچ ٹولز اور پرائیویسی فرسٹ ریکوریول اگمنٹڈ جنریشن پائپ لائنز کے ساتھ ہیں۔ اس سیکوئل نے فوری طور پر ڈویلپر کی دلچسپی پیدا کی، جس میں دن کے سب سے بڑے ہیکر نیوز مباحثوں میں سے ایک کو ڈرایا گیا کیونکہ بلڈرز نے اندازہ کیا کہ مقامی AI نیوز ایپس، میڈیا لائبریریوں، اور RAG سسٹمز کے لیے ایک ملٹی موڈل ایمبیڈر کا کیا مطلب ہے جو کبھی بھی بادل کو نہیں چھوتے۔
متن، کوڈ، امیجز، آڈیو اور ویڈیو کے لیے ایک ماڈل
EmbeddingGemma 2 کی سرخی کی اہلیت مقامی ملٹی موڈیلٹی ہے۔ فی موڈیلٹی الگ الگ انکوڈرز چلانے اور نتائج کو ایک ساتھ سلائی کرنے کے بجائے، ماڈل متن، کوڈ، تصاویر، ویڈیو اور آڈیو کے مجموعوں کو ایک مشترکہ جگہ میں سرایت کرتا ہے۔ گوگل کی مثالوں میں سوال کے طور پر صوتی میمو کا استعمال کرتے ہوئے ایک مخصوص ویڈیو کلپ تلاش کرنا، یا ٹیکسٹ پرامپٹ کے ساتھ آڈیو ریکارڈنگ کے گھنٹے تلاش کرنا شامل ہے، یہ سب مقامی ہارڈویئر پر ایک ہی ماڈل کے ذریعے عمل میں آتا ہے۔
فن تعمیر ماڈیولر ہے۔ صرف ٹیکسٹ کور کو اختیاری وژن (170 ملین پیرامیٹرز) اور آڈیو (300 ملین پیرامیٹرز) انکوڈرز کے ساتھ 270 ملین پیرامیٹرز کی ضرورت ہوتی ہے جس میں مکمل ملٹی موڈل سپورٹ شامل ہوتی ہے۔ اس لیے ڈویلپرز آج ایک کمپیکٹ ٹیکسٹ ایمبیڈر تعینات کر سکتے ہیں اور ماڈل فیملیز کو تبدیل کیے بغیر مکمل ملٹی موڈل بازیافت میں بڑھ سکتے ہیں۔
بینچ مارک کے نتائج اور اسٹوریج کی کارکردگی
گوگل رپورٹ کرتا ہے کہ ایمبیڈنگ جیما 2 بینچ مارکس پر ذیلی 1B ملٹی موڈل ایمبیڈرز کے درمیان نمایاں اسکور حاصل کرتا ہے جس میں MTEB (میسیو ٹیکسٹ ایمبیڈنگ بینچ مارک) کوڈ اور MAEB (بڑے پیمانے پر آڈیو ایمبیڈنگ بینچ مارک) شامل ہیں، جبکہ ٹیکسٹ، ویژن، اور آڈیو ٹاسک میں بہت سے بڑے ماڈلز سے مماثلت یا بہتر کارکردگی کا مظاہرہ کرتے ہوئے سب سے زیادہ ٹھوس فائدہ کوڈ میں ہے: MTEB کوڈ کی کارکردگی 9.92 پوائنٹس چھلانگ لگا کر 68.76 سے 78.68 تک پہنچ گئی، جسے گوگل کا کہنا ہے کہ یہ ماڈل مقامی کوڈ بیس انڈیکسنگ، سیمنٹک کوڈ سرچ، اور کوڈنگ ایجنٹ کی بازیافت کے لیے موزوں ہے۔ تصویر، ویڈیو، دستاویزات اور آڈیو میں، کمپنی ذیلی 1B ماڈلز کے لیے معیار فی پیرامیٹر میں ایک نئے معیار کا دعویٰ کرتی ہے، یہ کہتے ہوئے کہ یہ کچھ ماہر ماڈلز کو اس کے سائز سے دوگنا سے بھی زیادہ پرفارم کرتی ہے۔
سٹوریج کی کارکردگی Matryoshka Representation Learning (MRL) سے آتی ہے۔ آؤٹ پٹ ویکٹرز کو متحرک طور پر 768 ڈائمینشنز سے 512، 256 یا 128 ڈائمینشنز تک چھوٹا کیا جا سکتا ہے، جس سے مقامی ویکٹر ڈیٹا بیس اور میموری کے استعمال کے لیے 6x اسٹوریج کی کمی ہوتی ہے۔ فونز یا ایمبیڈڈ ہارڈویئر پر بازیافت چلانے والے ڈویلپرز کے لیے، یہ فرق اکثر اس بات کا تعین کرتا ہے کہ آیا کوئی خصوصیت بالکل بھی بھیجتی ہے۔
سخت ہارڈ ویئر بجٹ کے لیے ڈیزائن کیا گیا ہے۔
آن ڈیوائس فٹ پرنٹ ماڈل کا بنیادی سیلنگ پوائنٹ ہے۔ کوانٹائزیشن کے ساتھ، گوگل رپورٹ کرتا ہے کہ EmbeddingGemma 2 کو صرف ٹیکسٹ وزن کے لیے تقریباً 191MB فعال RAM اور Google Pixel 11 Pro پر مکمل ملٹی موڈل ماڈل کے لیے تقریباً 567MB کی ضرورت ہوتی ہے۔ سیاق و سباق کی ونڈو بھی 8,000 ٹوکن تک بڑھ گئی ہے، جو EmbeddingGemma 1 سے چار گنا زیادہ ہے، جو کہ 5.5 منٹ تک آڈیو، 29 امیجز، یا 58 ویڈیو فریموں کو ایک ہی پاس میں پروسیس کرنے کے لیے کافی ہے، یا اس کے درمیانی مجموعے ہیں۔
چونکہ ماڈل اپنے ٹیکسٹ ٹوکنائزر اور آڈیو انکوڈر کو Gemma 4 کے ساتھ شیئر کرتا ہے، اس لیے ڈویلپرز EmbeddingGemma 2 کو Gemma 4 کے ساتھ مل کر کم مشترکہ میموری فوٹ پرنٹ کے ساتھ ایک متحد پائپ لائن میں چلا سکتے ہیں، جس سے آن ڈیوائس RAG کو فعال کیا جا سکتا ہے جہاں بازیافت اور جنریشن دونوں مقامی طور پر ہوتے ہیں۔ گوگل اس کا مظاہرہ اپنی AI Edge Foresight ایپ میں کرتا ہے، مقامی فائل کی بازیافت کو Gemma 4 سیاق و سباق سے متعلق استدلال کے ساتھ جوڑتا ہے۔
ٹولنگ اور دستیابی
یہ ماڈل گوگل کے اے آئی ایج ٹولنگ کے ذریعے دستیاب ہے۔ گوگل اے آئی ایج گیلری ایپ انسٹنٹ میڈیا سرچ کی نمائش کرتی ہے، جو ٹیکسٹ یا امیج کے سوالات سے معنوی مماثلت کے ذریعے لائبریری میچز تلاش کرتی ہے، اور ایک ویڈیو مومنٹ فائنڈر جو ٹیکسٹ یا آڈیو سوالات کا استعمال کرتے ہوئے مخصوص مناظر کو تلاش کرتا ہے۔ ریئل ٹائم درجہ بندی، روٹنگ، اور پیشن گوئی کے استعمال کے معاملات MediaPipe Decision Task API کے ذریعے سامنے آتے ہیں، اور Google کے AI Edge بلاگ دستاویزات میں بتایا گیا ہے کہ LiteRT کے ساتھ آن ڈیوائس سرچ اور RAG سسٹم کیسے بنایا جائے۔ مکمل تشخیصی میٹرکس ماڈل کارڈ میں دستیاب ہیں۔
ڈیوائس پر ایمبیڈنگز کیوں اہم ہیں۔
ایمبیڈنگ ماڈل شاذ و نادر ہی سرخیاں بناتے ہیں جس طرح فرنٹیئر چیٹ ماڈلز کرتے ہیں، لیکن وہ سب سے زیادہ عملی AI خصوصیات کے نیچے بیٹھتے ہیں: سیمنٹک تلاش، سفارش، تخفیف، درجہ بندی، اور RAG کے لیے بازیافت۔ انہیں مقامی طور پر چلانے سے رازداری اور تاخیر کا حساب کتاب مکمل طور پر تبدیل ہو جاتا ہے۔ ڈیٹا کبھی بھی ڈیوائس کو نہیں چھوڑتا، سوالات آف لائن کام کرتے ہیں، اور کوئی فی کال API لاگت نہیں ہے، جو اربوں ایمبیڈڈ ڈیوائسز کے پیمانے پر اہمیت رکھتی ہے۔
EmbeddingGemma 2 موثر اوپن ماڈل اسپیس میں بھی مسابقت کو تیز کرتا ہے، جہاں گوگل، میٹا، Mistral، اور چھوٹی لیبز کا ایک گروپ یہ ثابت کرنے کے لیے دوڑ لگا رہا ہے کہ مفید AI ڈیٹا سینٹر کے بغیر چل سکتا ہے۔ فون پر پانچ طریقوں کو سنبھالنے والا 740M-پیرامیٹر ماڈل اس دوڑ میں ایک قابل ذکر نشان ہے۔ اگر اس کے پیشرو کی ڈاؤن لوڈ کی رفتار کوئی اشارہ ہے تو، آنے والے مہینوں میں EmbeddingGemma 2 موبائل اور ایج مصنوعات کی ایک وسیع رینج میں ظاہر ہونے کی توقع کریں۔
AI وکر سے آگے رہیں
ڈیوائس پر موجود AI زیادہ تر لوگوں کے احساس سے زیادہ تیزی سے آگے بڑھ رہا ہے۔ aibuzzwire.news پر تازہ ترین AI خبریں پڑھیں ہر بڑے ماڈل کے لانچ، بینچ مارک، اور ڈویلپر ٹول کی ریلیز کی کوریج کے لیے۔
مزید AI خبریں پڑھیں →