گوگل EmbeddingGemma 2 را راهاندازی کرد، یک مدل تعبیهشده باز و سبک وزن که ترکیبی از متن، تصاویر، صدا و ویدئو را بهطور بومی در یک فضای جاسازی واحد نقشهبرداری میکند. این اعلامیه که در 6 اکتبر 2026 توسط مهندسان محقق Google DeepMind، Sahil Dua و Henrique Schechter Vera ارسال شد، مدل 740 میلیون پارامتری را به عنوان تواناترین گزینه برای تعبیههای چندوجهی روی دستگاه قرار میدهد که تحت مجوز تجاری Apache 2.0 و بر اساس معماری Gem ساخته شده است.
اولین EmbeddingGemma فراتر از انتظارات گوگل بود، با بیش از 20 میلیون بارگیری که به ابزارهای جستجوی روی دستگاه و خطوط لوله نسل افزوده برای اولین بار بازیابی حریم خصوصی کمک کرد. عاقبت بلافاصله مورد توجه توسعهدهندگان قرار گرفت و یکی از بزرگترین بحثهای روز Hacker News را به خود جلب کرد، زیرا سازندگان ارزیابی کردند که یک جاسازی چندوجهی برای برنامههای محلی [اخبار هوش مصنوعی] (https://aibuzzwire.news)، کتابخانههای رسانه، و سیستمهای RAG که هرگز ابر را لمس نمیکنند، چیست.
یک مدل برای متن، کد، تصاویر، صدا و ویدئو
قابلیت عنوان EmbeddingGemma 2 چندوجهی بومی است. این مدل به جای اجرای رمزگذارهای جداگانه در هر حالت و دوخت نتایج با هم، ترکیبی از متن، کد، تصاویر، ویدئو و صدا را در یک فضای مشترک جاسازی میکند. نمونههای Google شامل یافتن یک کلیپ ویدیویی خاص با استفاده از یادداشت صوتی بهعنوان پرس و جو، یا جستجوی ساعتهای ضبط صدا با یک پیام متنی است که همه توسط یک مدل واحد روی سختافزار محلی پردازش شدهاند.
معماری مدولار است. هسته فقط متنی به 270 میلیون پارامتر نیاز دارد و رمزگذارهای دید اختیاری (170 میلیون پارامتر) و رمزگذارهای صوتی (300 میلیون پارامتر) پشتیبانی کامل چندوجهی را اضافه میکنند. بنابراین، توسعهدهندگان میتوانند امروز یک جاسازی متن فشرده را مستقر کنند و بدون تغییر خانوادههای مدل، به بازیابی کامل چندوجهی تبدیل شوند.
نتایج معیار و کارایی ذخیره سازی
گوگل گزارش می دهد که EmbeddingGemma 2 در معیارهایی از جمله کد MTEB (معیار جاسازی متن عظیم) و MAEB (معیار جاسازی صوتی عظیم) امتیازات برتر را در بین جاسازیکنندههای چندوجهی زیر 1B به دست میآورد، در حالی که با بسیاری از مدلهای بزرگتر در کارهای متنی، بینایی، و صوتی مطابقت دارد یا عملکرد بهتری دارد. ملموسترین دستاورد در کد است: عملکرد کد MTEB 9.92 امتیاز افزایش یافت، از 68.76 به 78.68، که گوگل میگوید این مدل را برای نمایهسازی پایگاه کد محلی، جستجوی کد معنایی و بازیابی عامل کدگذاری مناسب میکند. در سراسر تصویر، ویدئو، اسناد و صدا، این شرکت ادعا میکند که استاندارد جدیدی در کیفیت در هر پارامتر برای مدلهای زیر 1B دارد و میگوید که این استاندارد حتی از برخی مدلهای تخصصی بیش از دو برابر اندازه خود بهتر است.
بهره وری ذخیره سازی از آموزش نمایندگی ماتریوشکا (MRL) ناشی می شود. بردارهای خروجی را می توان به صورت پویا از 768 بعد به ابعاد 512، 256 یا 128 برش داد و تا 6 برابر کاهش ذخیره سازی را برای پایگاه های داده برداری محلی و استفاده از حافظه ارائه داد. برای توسعهدهندگانی که بازیابی را روی تلفنها یا سختافزار تعبیهشده اجرا میکنند، این تفاوت اغلب تعیین میکند که آیا یک ویژگی اصلاً ارسال میشود یا خیر.
برای بودجه های سخت افزاری فشرده طراحی شده است
ردپای روی دستگاه نقطه اصلی فروش مدل است. با کوانتیزاسیون، گوگل گزارش می دهد که EmbeddingGemma 2 به 191 مگابایت رم فعال برای وزن های متنی و حدود 567 مگابایت برای مدل کامل چند وجهی در گوگل پیکسل 11 پرو نیاز دارد. پنجره زمینه همچنین به 8000 توکن افزایش یافته است، چهار برابر بزرگتر از EmbeddingGemma 1، که برای پردازش حداکثر 5.5 دقیقه صدا، 29 تصویر، یا 58 فریم ویدئو در یک پاس، یا ترکیبات در هم آمیخته از آنها کافی است.
از آنجایی که این مدل توکنایزر متن و رمزگذار صوتی خود را با Gemma 4 به اشتراک می گذارد، توسعه دهندگان می توانند EmbeddingGemma 2 را در کنار Gemma 4 در یک خط لوله یکپارچه با ردپای حافظه ترکیبی کمتری اجرا کنند، و RAG روی دستگاه را فعال می کند که در آن بازیابی و تولید هر دو به صورت محلی انجام می شود. گوگل این را در برنامه AI Edge Foresight خود نشان می دهد و بازیابی فایل محلی را با استدلال زمینه ای Gemma 4 جفت می کند.
ابزار و در دسترس بودن
این مدل از طریق ابزار AI Edge گوگل در دسترس است. برنامه Google AI Edge Gallery Instant Media Search را به نمایش میگذارد که مطابقتهای کتابخانه را بر اساس شباهت معنایی جستجوهای متن یا تصویر پیدا میکند و یک Video Moments Finder که صحنههای خاصی را با استفاده از عبارتهای متنی یا صوتی مکانیابی میکند. دستهبندی، مسیریابی و موارد استفاده پیشگویانه در زمان واقعی از طریق MediaPipe Decision Task API و وبلاگ AI Edge Google نحوه ساخت سیستمهای جستجوی روی دستگاه و RAG را با LiteRT مستند میکند. معیارهای ارزیابی کامل در کارت مدل موجود است.
چرا جاسازی روی دستگاه مهم است
مدلهای جاسازی شده به ندرت مانند مدلهای چت مرزی تیتر یک میشوند، اما در زیر اکثر ویژگیهای کاربردی هوش مصنوعی قرار میگیرند: جستجوی معنایی، توصیه، تکرار، طبقهبندی و بازیابی برای RAG. اجرای محلی آنها محاسبات حریم خصوصی و تأخیر را به طور کامل تغییر می دهد. داده ها هرگز از دستگاه خارج نمی شوند، پرس و جوها به صورت آفلاین کار می کنند، و هیچ هزینه API برای هر تماس وجود ندارد، که در مقیاس میلیاردها دستگاه جاسازی شده اهمیت دارد.
EmbeddingGemma 2 همچنین رقابت را در فضای کارآمد مدل باز تشدید می کند، جایی که گوگل، متا، میسترال و گروهی از آزمایشگاه های کوچکتر در حال رقابت برای اثبات این موضوع هستند که هوش مصنوعی مفید می تواند بدون مرکز داده اجرا شود. یک مدل با پارامتر 740M که پنج حالت را روی یک تلفن انجام میدهد، یک نشانگر قابل توجه در این مسابقه است. اگر مسیر دانلود نسخه قبلی خود نشانه ای باشد، انتظار داشته باشید که EmbeddingGemma 2 در طی ماه های آینده در طیف گسترده ای از محصولات موبایل و لبه ظاهر شود.
از منحنی هوش مصنوعی جلوتر بمانید
هوش مصنوعی روی دستگاه سریعتر از آن چیزی که بیشتر مردم تصور می کنند پیشرفت می کند. [آخرین اخبار هوش مصنوعی را در aibuzzwire.news بخوانید] (https://aibuzzwire.news) برای پوشش هر مدل اصلی راه اندازی، معیار، و انتشار ابزار توسعه دهنده.
اخبار هوش مصنوعی را بیشتر بخوانید →