أطلقت Google EmbeddingGemma 2، وهو نموذج تضمين مفتوح وخفيف الوزن يقوم أصلاً بتعيين مجموعات من النصوص والصور والصوت والفيديو في مساحة تضمين واحدة موحدة. الإعلان، الذي نشره في 6 أكتوبر 2026 مهندسا الأبحاث في Google DeepMind Sahil Dua وHenrique Schechter Vera، يضع النموذج المكون من 740 مليون معلمة باعتباره الخيار الأكثر قدرة للتضمين متعدد الوسائط على الجهاز، والذي تم إصداره بموجب ترخيص Apache 2.0 المسموح به تجاريًا والمبني على بنية Gemma 4.

لقد تجاوز الإصدار الأول من EmbeddingGemma توقعات Google، مع أكثر من 20 مليون عملية تنزيل تعمل على تشغيل أدوات البحث على الجهاز وخطوط الجيل المعزز لاسترجاع الخصوصية أولاً. أثار الجزء الثاني اهتمامًا فوريًا من المطورين، واجتذب واحدة من أكبر مناقشات Hacker News اليوم حيث قام المنشئون بتقييم ما يعنيه جهاز تضمين واحد متعدد الوسائط لتطبيقات أخبار الذكاء الاصطناعي المحلية ومكتبات الوسائط وأنظمة RAG التي لا تمس السحابة أبدًا.

نموذج واحد للنص والرمز والصور والصوت والفيديو

القدرة الرئيسية لـ EmbeddingGemma 2 هي الوسائط المتعددة الأصلية. بدلاً من تشغيل برامج تشفير منفصلة لكل طريقة ودمج النتائج معًا، يقوم النموذج بتضمين مجموعات من النص والتعليمات البرمجية والصور والفيديو والصوت في مساحة مشتركة واحدة. تتضمن أمثلة Google العثور على مقطع فيديو محدد باستخدام مذكرة صوتية كاستعلام، أو البحث عن ساعات من التسجيلات الصوتية مع مطالبة نصية، وتتم معالجة كل ذلك بواسطة نموذج واحد على جهاز محلي.

الهندسة المعمارية وحدات. يتطلب جوهر النص فقط ما لا يقل عن 270 مليون معلمة، مع رؤية اختيارية (170 مليون معلمة) وأجهزة تشفير الصوت (300 مليون معلمة) تضيف دعمًا كاملاً متعدد الوسائط. وبالتالي يمكن للمطورين نشر أداة تضمين نص مضغوطة اليوم والتطور إلى استرجاع كامل متعدد الوسائط دون تغيير مجموعات النماذج.

النتائج المعيارية وكفاءة التخزين

تشير Google إلى أن EmbeddingGemma 2 يحقق درجات رائدة بين أدوات تضمين الوسائط المتعددة دون المستوى 1B في المعايير بما في ذلك رمز MTEB (معيار تضمين النص الضخم) وMAEB (معيار تضمين الصوت الضخم)، بينما يطابق أو يتفوق على العديد من النماذج الأكبر عبر مهام النص والرؤية والصوت. المكسب الأكثر وضوحًا هو في الكود: قفز أداء كود MTEB بمقدار 9.92 نقطة، من 68.76 إلى 78.68، وهو ما تقول Google إنه يجعل النموذج مناسبًا تمامًا لفهرسة قاعدة التعليمات البرمجية المحلية، والبحث عن الكود الدلالي، واسترجاع وكيل التشفير. عبر الصور والفيديو والمستندات والصوت، تطالب الشركة بمعيار جديد في الجودة لكل معلمة للنماذج الفرعية 1B، قائلة إنها تتفوق حتى على بعض النماذج المتخصصة بأكثر من ضعف حجمها.

تأتي كفاءة التخزين من تعلم تمثيل ماتريوشكا (MRL). يمكن اقتطاع متجهات الإخراج ديناميكيًا من 768 بُعدًا إلى 512 أو 256 أو 128 بُعدًا، مما يوفر ما يصل إلى تقليل تخزين 6x لقواعد بيانات المتجهات المحلية واستخدام الذاكرة. بالنسبة للمطورين الذين يقومون باسترجاع البيانات على الهواتف أو الأجهزة المضمنة، غالبًا ما يحدد هذا الاختلاف ما إذا كانت الميزة ستتوفر على الإطلاق أم لا.

مصممة لميزانيات الأجهزة المحدودة

تعد البصمة الموجودة على الجهاز هي نقطة البيع الأساسية للنموذج. مع القياس الكمي، تفيد Google أن EmbeddingGemma 2 يتطلب ما يصل إلى 191 ميجابايت تقريبًا من ذاكرة الوصول العشوائي النشطة لأوزان النص فقط وحوالي 567 ميجابايت للنموذج متعدد الوسائط الكامل على Google Pixel 11 Pro. نمت نافذة السياق أيضًا إلى 8000 رمز، أي أكبر بأربع مرات من EmbeddingGemma 1، وهو ما يكفي لمعالجة ما يصل إلى 5.5 دقيقة من الصوت، أو 29 صورة، أو 58 إطار فيديو في تمريرة واحدة، أو مجموعات متداخلة منها.

نظرًا لأن النموذج يشترك في رمز النص وبرنامج تشفير الصوت مع Gemma 4، يمكن للمطورين تشغيل EmbeddingGemma 2 جنبًا إلى جنب مع Gemma 4 في مسار موحد مع مساحة ذاكرة مدمجة أقل، مما يتيح RAG على الجهاز حيث يحدث الاسترجاع والتوليد محليًا. توضح Google ذلك في تطبيق AI Edge Foresight الخاص بها، حيث يقرن استرجاع الملفات المحلية مع المنطق السياقي لـ Gemma 4.

الأدوات والتوافر

النموذج متاح من خلال أدوات AI Edge من Google. يعرض تطبيق Google AI Edge Gallery البحث الفوري عن الوسائط، والذي يبحث عن تطابقات المكتبة من خلال التشابه الدلالي من استعلامات النص أو الصور، وأداة Video Moments Finder التي تحدد موقع مشاهد محددة باستخدام استعلامات نصية أو صوتية. يتم عرض حالات التصنيف والتوجيه والاستخدام التنبؤي في الوقت الفعلي من خلال واجهة برمجة تطبيقات MediaPipe Decision Task API، وتوثق مدونة AI Edge من Google كيفية إنشاء أنظمة البحث وRAG على الجهاز باستخدام LiteRT. تتوفر مقاييس التقييم الكاملة في بطاقة النموذج.

أهمية عمليات التضمين على الجهاز

نادرًا ما تتصدر نماذج التضمين العناوين الرئيسية كما تفعل نماذج الدردشة الحدودية، ولكنها تقع تحت معظم ميزات الذكاء الاصطناعي العملية: البحث الدلالي، والتوصية، وإلغاء البيانات المكررة، والتصنيف، والاسترجاع لـ RAG. يؤدي تشغيلها محليًا إلى تغيير حساب الخصوصية وزمن الوصول بالكامل. لا تترك البيانات الجهاز أبدًا، وتعمل الاستعلامات دون اتصال بالإنترنت، ولا توجد تكلفة لواجهة برمجة التطبيقات لكل مكالمة، وهو أمر مهم على نطاق مليارات الأجهزة المضمنة.

يعمل EmbeddingGemma 2 أيضًا على تكثيف المنافسة في مجال النموذج المفتوح الفعال، حيث تتسابق Google وMeta وMistral ومجموعة من المعامل الأصغر لإثبات أن الذكاء الاصطناعي المفيد يمكن تشغيله بدون مركز بيانات. يعد النموذج ذو المعلمة 740M الذي يتعامل مع خمس طرائق على الهاتف علامة بارزة في هذا السباق. إذا كان مسار التنزيل لسابقه يشير إلى أي شيء، فتوقع ظهور EmbeddingGemma 2 في مجموعة واسعة من منتجات الأجهزة المحمولة والحافة خلال الأشهر المقبلة.

البقاء في صدارة منحنى الذكاء الاصطناعي

يتقدم الذكاء الاصطناعي الموجود على الجهاز بشكل أسرع مما يدركه معظم الناس. اقرأ آخر أخبار الذكاء الاصطناعي على aibuzzwire.news لتغطية كل عملية إطلاق رئيسية للنماذج والمقاييس المعيارية وإصدارات أدوات المطورين.

اقرأ المزيد من أخبار الذكاء الاصطناعي →