גוגל השיקה את EmbeddingGemma 2, מודל הטמעה פתוח וקל משקל הממפה באופן טבעי שילובים של טקסט, תמונות, אודיו ווידאו לתוך חלל הטמעה אחד מאוחד. ההכרזה, שפורסמה ב-6 באוקטובר 2026 על ידי מהנדסי המחקר של Google DeepMind Sahil Dua והנריק שכטר ורה, מציבה את המודל של 740 מיליון פרמטרים כאופציה המסוגלת ביותר להטמעות מולטי-מודאליות במכשיר, ששוחררה תחת רישיון Apache 2.0 מתירני מסחרית ובנוי על ארכיטקטורת Gemma 4.

ה-EmbeddingGemma הראשונה עלתה על הציפיות של גוגל, עם יותר מ-20 מיליון הורדות המניעות כלי חיפוש במכשיר וצינורות דור מוגדלים של אחזור פרטיות ראשון. סרט ההמשך עורר עניין מיידי של מפתחים, וגרר את אחד הדיונים הגדולים ביותר של האקר ניוז ביום, כאשר בונים העריכו את המשמעות של הטמעה רב-מודאלית אחת עבור אפליקציות מקומיות AI news, ספריות מדיה ומערכות RAG שלעולם לא נוגעות בענן.

דגם אחד עבור טקסט, קוד, תמונות, אודיו ווידאו

יכולת הכותרות של EmbeddingGemma 2 היא מולטי-מודאליות מקורית. במקום להריץ מקודדים נפרדים לכל אופן ותוצאות תפירה יחד, המודל מטמיע שילובים של טקסט, קוד, תמונות, וידאו ואודיו במרחב משותף אחד. הדוגמאות של גוגל כוללות מציאת וידאו קליפ ספציפי באמצעות תזכיר קולי בתור השאילתה, או חיפוש שעות של הקלטות אודיו עם הנחית טקסט, הכל מעובד על ידי דגם יחיד בחומרה מקומית.

הארכיטקטורה היא מודולרית. הליבה לטקסט בלבד דורשת רק 270 מיליון פרמטרים, עם מקודדי ראייה אופציונליים (170 מיליון פרמטרים) ואודיו (300 מיליון פרמטרים) שמוסיפים תמיכה רב-מודאלית מלאה. מפתחים יכולים לפיכך לפרוס מטמיעת טקסט קומפקטית היום ולגדול לאחזור מולטי-מודאלי מלא מבלי לשנות משפחות מודלים.

תוצאות בנצ'מרק ויעילות אחסון

גוגל מדווחת כי EmbeddingGemma 2 משיגה ציונים מובילים בקרב מטמיעים מולטי-מודאליים תת-1B במדדים כולל קוד MTEB (Massive Text Embedding Benchmark) ו-MAEB (Massive Audio Embedding Benchmark), תוך התאמה או ביצועים טובים יותר של דגמים גדולים יותר במשימות טקסט, חזון ואודיו. הרווח הקונקרטי ביותר הוא בקוד: ביצועי קוד MTEB קפצו ב-9.92 נקודות, מ-68.76 ל-78.68, מה שלדברי גוגל הופך את המודל למתאים היטב לאינדקס של בסיס קוד מקומי, חיפוש קוד סמנטי ואחזור סוכן קידוד. בכל הקשור לתמונה, וידאו, מסמכים ואודיו, החברה טוענת לסטנדרט חדש באיכות פרמטר עבור דגמי תת-1B, ואומרת שהיא אפילו מתעלה על כמה דגמים מתמחים יותר מפי שניים מגודלו.

יעילות האחסון מגיעה מלימוד ייצוג Matryoshka (MRL). ניתן לקצץ באופן דינמי את וקטורי הפלט מ-768 ממדים ל-512, 256 או 128 ממדים, המספקים עד פי 6 הפחתה באחסון עבור מסדי נתונים וקטוריים מקומיים ושימוש בזיכרון. עבור מפתחים המריצים אחזור בטלפונים או בחומרה משובצת, ההבדל הזה קובע לעתים קרובות אם תכונה נשלחת בכלל.

עוצב עבור תקציבי חומרה מצומצמים

טביעת הרגל במכשיר היא נקודת המכירה המרכזית של הדגם. עם קוונטיזציה, גוגל מדווחת ש-EmbeddingGemma 2 דורש מעט כמו בערך 191MB של זיכרון RAM פעיל למשקולות טקסט בלבד וכ-567MB עבור הדגם הרב-מודאלי המלא ב-Google Pixel 11 Pro. חלון ההקשר גדל גם ל-8,000 אסימונים, גדול פי ארבעה מ-EmbeddingGemma 1, מספיק כדי לעבד עד 5.5 דקות של אודיו, 29 תמונות או 58 פריימים של וידאו במעבר אחד, או שילובים משולבים ביניהם.

מכיוון שהדגם חולק את אסימון הטקסט ומקודד האודיו שלו עם Gemma 4, מפתחים יכולים להריץ את EmbeddingGemma 2 לצד Gemma 4 בצנרת מאוחדת עם טביעת זיכרון משולבת נמוכה יותר, מה שמאפשר RAG במכשיר שבו האחזור והיצירה מתרחשים שניהם באופן מקומי. גוגל מדגימה זאת באפליקציית AI Edge Foresight שלה, תוך שילוב של אחזור קבצים מקומיים עם חשיבה הקשרית של Gemma 4.

כלי עבודה וזמינות

הדגם זמין דרך כלי ה-AI Edge של גוגל. אפליקציית Google AI Edge Gallery מציגה חיפוש מדיה מיידי, שמוצא התאמות ספרייה לפי דמיון סמנטי משאילתות טקסט או תמונה, ו-Video Moments Finder שמאתר סצנות ספציפיות באמצעות שאילתות טקסט או שמע. מקרי סיווג, ניתוב ושימוש חזוי בזמן אמת נחשפים דרך ה-API של MediaPipe Decision Task, והבלוג AI Edge של גוגל מתעד כיצד לבנות מערכות חיפוש ו-RAG במכשיר עם LiteRT. מדדי הערכה מלאים זמינים בכרטיס הדגם.

למה חשובות הטבעות במכשיר

מודלים של הטבעה כמעט ולא מגיעים לכותרות כפי שעושים מודלים של צ'אט גבוליים, אבל הם נמצאים מתחת לתכונות ה-AI המעשיות ביותר: חיפוש סמנטי, המלצה, ביטול כפילות, סיווג ושליפה עבור RAG. הפעלתם באופן מקומי משנה לחלוטין את חישוב הפרטיות והשהייה. נתונים לעולם אינם עוזבים את המכשיר, השאילתות פועלות במצב לא מקוון, ואין עלות API לכל קריאה, שחשובה בקנה מידה של מיליארדי מכשירים משובצים.

EmbeddingGemma 2 גם מגבירה את התחרות במרחב המודל הפתוח היעיל, שבו גוגל, מטה, מיסטרל וקבוצה של מעבדות קטנות יותר דוהרות כדי להוכיח שבינה מלאכותית שימושית יכולה לפעול ללא מרכז נתונים. דגם של 740M פרמטרים המטפל בחמישה אופנים בטלפון הוא סמן בולט במרוץ הזה. אם מסלול ההורדה של קודמו הוא אינדיקציה כלשהי, צפו ש- EmbeddingGemma 2 יופיע במגוון רחב של מוצרי סלולר ומוצרי קצה במהלך החודשים הקרובים.

הישאר לפני עקומת הבינה המלאכותית

AI במכשיר מתקדם מהר יותר ממה שרוב האנשים מבינים. קרא את החדשות האחרונות בתחום הבינה המלאכותית ב-aibuzzwire.news לסיקור של כל השקת דגמים מרכזיים, בנצ'מרק וכלי מפתחים.

קרא עוד חדשות AI →