گوگل EmbeddingGemma 2 را راه‌اندازی کرد، یک مدل تعبیه‌شده باز و سبک وزن که ترکیبی از متن، تصاویر، صدا و ویدئو را به‌طور بومی در یک فضای جاسازی واحد نقشه‌برداری می‌کند. این اعلامیه که در 6 اکتبر 2026 توسط مهندسان محقق Google DeepMind، Sahil Dua و Henrique Schechter Vera ارسال شد، مدل 740 میلیون پارامتری را به عنوان تواناترین گزینه برای تعبیه‌های چندوجهی روی دستگاه قرار می‌دهد که تحت مجوز تجاری Apache 2.0 و بر اساس معماری Gem ساخته شده است.

اولین EmbeddingGemma فراتر از انتظارات گوگل بود، با بیش از 20 میلیون بارگیری که به ابزارهای جستجوی روی دستگاه و خطوط لوله نسل افزوده برای اولین بار بازیابی حریم خصوصی کمک کرد. عاقبت بلافاصله مورد توجه توسعه‌دهندگان قرار گرفت و یکی از بزرگ‌ترین بحث‌های روز Hacker News را به خود جلب کرد، زیرا سازندگان ارزیابی کردند که یک جاسازی چندوجهی برای برنامه‌های محلی [اخبار هوش مصنوعی] (https://aibuzzwire.news)، کتابخانه‌های رسانه، و سیستم‌های RAG که هرگز ابر را لمس نمی‌کنند، چیست.

یک مدل برای متن، کد، تصاویر، صدا و ویدئو

قابلیت عنوان EmbeddingGemma 2 چندوجهی بومی است. این مدل به جای اجرای رمزگذارهای جداگانه در هر حالت و دوخت نتایج با هم، ترکیبی از متن، کد، تصاویر، ویدئو و صدا را در یک فضای مشترک جاسازی می‌کند. نمونه‌های Google شامل یافتن یک کلیپ ویدیویی خاص با استفاده از یادداشت صوتی به‌عنوان پرس و جو، یا جستجوی ساعت‌های ضبط صدا با یک پیام متنی است که همه توسط یک مدل واحد روی سخت‌افزار محلی پردازش شده‌اند.

معماری مدولار است. هسته فقط متنی به 270 میلیون پارامتر نیاز دارد و رمزگذارهای دید اختیاری (170 میلیون پارامتر) و رمزگذارهای صوتی (300 میلیون پارامتر) پشتیبانی کامل چندوجهی را اضافه می‌کنند. بنابراین، توسعه‌دهندگان می‌توانند امروز یک جاسازی متن فشرده را مستقر کنند و بدون تغییر خانواده‌های مدل، به بازیابی کامل چندوجهی تبدیل شوند.

نتایج معیار و کارایی ذخیره سازی

گوگل گزارش می دهد که EmbeddingGemma 2 در معیارهایی از جمله کد MTEB (معیار جاسازی متن عظیم) و MAEB (معیار جاسازی صوتی عظیم) امتیازات برتر را در بین جاسازی‌کننده‌های چندوجهی زیر 1B به دست می‌آورد، در حالی که با بسیاری از مدل‌های بزرگ‌تر در کارهای متنی، بینایی، و صوتی مطابقت دارد یا عملکرد بهتری دارد. ملموس‌ترین دستاورد در کد است: عملکرد کد MTEB 9.92 امتیاز افزایش یافت، از 68.76 به 78.68، که گوگل می‌گوید این مدل را برای نمایه‌سازی پایگاه کد محلی، جستجوی کد معنایی و بازیابی عامل کدگذاری مناسب می‌کند. در سراسر تصویر، ویدئو، اسناد و صدا، این شرکت ادعا می‌کند که استاندارد جدیدی در کیفیت در هر پارامتر برای مدل‌های زیر 1B دارد و می‌گوید که این استاندارد حتی از برخی مدل‌های تخصصی بیش از دو برابر اندازه خود بهتر است.

بهره وری ذخیره سازی از آموزش نمایندگی ماتریوشکا (MRL) ناشی می شود. بردارهای خروجی را می توان به صورت پویا از 768 بعد به ابعاد 512، 256 یا 128 برش داد و تا 6 برابر کاهش ذخیره سازی را برای پایگاه های داده برداری محلی و استفاده از حافظه ارائه داد. برای توسعه‌دهندگانی که بازیابی را روی تلفن‌ها یا سخت‌افزار تعبیه‌شده اجرا می‌کنند، این تفاوت اغلب تعیین می‌کند که آیا یک ویژگی اصلاً ارسال می‌شود یا خیر.

برای بودجه های سخت افزاری فشرده طراحی شده است

ردپای روی دستگاه نقطه اصلی فروش مدل است. با کوانتیزاسیون، گوگل گزارش می دهد که EmbeddingGemma 2 به 191 مگابایت رم فعال برای وزن های متنی و حدود 567 مگابایت برای مدل کامل چند وجهی در گوگل پیکسل 11 پرو نیاز دارد. پنجره زمینه همچنین به 8000 توکن افزایش یافته است، چهار برابر بزرگتر از EmbeddingGemma 1، که برای پردازش حداکثر 5.5 دقیقه صدا، 29 تصویر، یا 58 فریم ویدئو در یک پاس، یا ترکیبات در هم آمیخته از آنها کافی است.

از آنجایی که این مدل توکنایزر متن و رمزگذار صوتی خود را با Gemma 4 به اشتراک می گذارد، توسعه دهندگان می توانند EmbeddingGemma 2 را در کنار Gemma 4 در یک خط لوله یکپارچه با ردپای حافظه ترکیبی کمتری اجرا کنند، و RAG روی دستگاه را فعال می کند که در آن بازیابی و تولید هر دو به صورت محلی انجام می شود. گوگل این را در برنامه AI Edge Foresight خود نشان می دهد و بازیابی فایل محلی را با استدلال زمینه ای Gemma 4 جفت می کند.

ابزار و در دسترس بودن

این مدل از طریق ابزار AI Edge گوگل در دسترس است. برنامه Google AI Edge Gallery Instant Media Search را به نمایش می‌گذارد که مطابقتهای کتابخانه را بر اساس شباهت معنایی جستجوهای متن یا تصویر پیدا می‌کند و یک Video Moments Finder که صحنه‌های خاصی را با استفاده از عبارت‌های متنی یا صوتی مکان‌یابی می‌کند. دسته‌بندی، مسیریابی و موارد استفاده پیش‌گویانه در زمان واقعی از طریق MediaPipe Decision Task API و وبلاگ AI Edge Google نحوه ساخت سیستم‌های جستجوی روی دستگاه و RAG را با LiteRT مستند می‌کند. معیارهای ارزیابی کامل در کارت مدل موجود است.

چرا جاسازی روی دستگاه مهم است

مدل‌های جاسازی شده به ندرت مانند مدل‌های چت مرزی تیتر یک می‌شوند، اما در زیر اکثر ویژگی‌های کاربردی هوش مصنوعی قرار می‌گیرند: جستجوی معنایی، توصیه، تکرار، طبقه‌بندی و بازیابی برای RAG. اجرای محلی آنها محاسبات حریم خصوصی و تأخیر را به طور کامل تغییر می دهد. داده ها هرگز از دستگاه خارج نمی شوند، پرس و جوها به صورت آفلاین کار می کنند، و هیچ هزینه API برای هر تماس وجود ندارد، که در مقیاس میلیاردها دستگاه جاسازی شده اهمیت دارد.

EmbeddingGemma 2 همچنین رقابت را در فضای کارآمد مدل باز تشدید می کند، جایی که گوگل، متا، میسترال و گروهی از آزمایشگاه های کوچکتر در حال رقابت برای اثبات این موضوع هستند که هوش مصنوعی مفید می تواند بدون مرکز داده اجرا شود. یک مدل با پارامتر 740M که پنج حالت را روی یک تلفن انجام می‌دهد، یک نشانگر قابل توجه در این مسابقه است. اگر مسیر دانلود نسخه قبلی خود نشانه ای باشد، انتظار داشته باشید که EmbeddingGemma 2 در طی ماه های آینده در طیف گسترده ای از محصولات موبایل و لبه ظاهر شود.

از منحنی هوش مصنوعی جلوتر بمانید

هوش مصنوعی روی دستگاه سریعتر از آن چیزی که بیشتر مردم تصور می کنند پیشرفت می کند. [آخرین اخبار هوش مصنوعی را در aibuzzwire.news بخوانید] (https://aibuzzwire.news) برای پوشش هر مدل اصلی راه اندازی، معیار، و انتشار ابزار توسعه دهنده.

اخبار هوش مصنوعی را بیشتر بخوانید →