Google lanserade EmbeddingGemma 2, en öppen, lätt inbäddningsmodell som kartlägger kombinationer av text, bilder, ljud och video till ett enda enhetligt inbäddningsutrymme. Tillkännagivandet, publicerat den 6 oktober 2026 av Google DeepMinds forskningsingenjörer Sahil Dua och Henrique Schechter Vera, positionerar modellen med 740 miljoner parametrar som det mest kapabla alternativet för multimodala inbäddningar på enheten, släppt under en kommersiellt tillåtande Apache 2.0-licens och byggd på Gemma 4-arkitekturen.

Den första EmbeddingGemma överträffade Googles förväntningar, med mer än 20 miljoner nedladdningar som driver sökverktyg på enheten och pipelines för utökad generation av sekretess-först hämtning. Uppföljaren skapade omedelbart utvecklarintresse och drog till sig en av dagens största Hacker News-diskussioner när byggare utvärderade vad en enda multimodal inbäddning betyder för lokala AI-nyheter appar, mediebibliotek och RAG-system som aldrig rör molnet.

En modell för text, kod, bilder, ljud och video

EmbeddingGemma 2:s rubrikkapacitet är inbyggd multimodalitet. Istället för att köra separata kodare per modalitet och sammanfogningsresultat, bäddar modellen in kombinationer av text, kod, bilder, video och ljud i ett delat utrymme. Googles exempel inkluderar att hitta ett specifikt videoklipp med hjälp av ett röstmemo som sökfråga, eller att söka timmar av ljudinspelningar med en textuppmaning, allt bearbetat av en enda modell på lokal hårdvara.

Arkitekturen är modulär. Kärnan endast för text kräver så lite som 270 miljoner parametrar, med valfria vision (170 miljoner parametrar) och ljudkodare (300 miljoner parametrar) som lägger till fullt multimodalt stöd. Utvecklare kan därför distribuera en kompakt textinbäddning idag och växa till full multimodal hämtning utan att ändra modellfamiljer.

Benchmark-resultat och lagringseffektivitet

Google rapporterar att EmbeddingGemma 2 uppnår ledande poäng bland multimodala inbäddningsenheter under 1B på benchmarks inklusive MTEB (Massive Text Embedding Benchmark) Code och MAEB (Massive Audio Embedding Benchmark), samtidigt som de matchar eller överträffar många större modeller för text-, vision- och ljuduppgifter. Den mest konkreta vinsten finns i kod: MTEB-kodprestanda hoppade med 9,92 poäng, från 68,76 till 78,68, vilket enligt Google gör modellen väl lämpad för lokal kodbasindexering, semantisk kodsökning och hämtning av kodningsagenter. När det gäller bild, video, dokument och ljud hävdar företaget en ny standard för kvalitet-per-parameter för sub-1B-modeller, och säger att den till och med överträffar vissa specialistmodeller mer än dubbelt så stor.

Lagringseffektivitet kommer från Matryoshka Representation Learning (MRL). Utdatavektorer kan trunkeras dynamiskt från 768 dimensioner ner till 512, 256 eller 128 dimensioner, vilket ger upp till 6x lagringsminskning för lokala vektordatabaser och minnesanvändning. För utvecklare som kör hämtning på telefoner eller inbäddad hårdvara avgör den skillnaden ofta om en funktion levereras överhuvudtaget.

Designad för snäva hårdvarubudgetar

Fotavtrycket på enheten är modellens viktigaste försäljningsargument. Med kvantisering rapporterar Google att EmbeddingGemma 2 kräver så lite som ungefär 191 MB aktivt RAM-minne för enbart textvikter och ungefär 567 MB för den fullständiga multimodala modellen på en Google Pixel 11 Pro. Kontextfönstret har också vuxit till 8 000 tokens, fyra gånger större än EmbeddingGemma 1, tillräckligt för att bearbeta upp till 5,5 minuter av ljud, 29 bilder eller 58 videobilder i ett enda pass, eller interfolierade kombinationer därav.

Eftersom modellen delar sin texttokenizer och ljudkodare med Gemma 4, kan utvecklare köra EmbeddingGemma 2 tillsammans med Gemma 4 i en enhetlig pipeline med ett lägre kombinerat minnesfotavtryck, vilket möjliggör RAG på enheten där både hämtning och generering sker lokalt. Google visar detta i sin AI Edge Foresight-app, och kopplar ihop lokal filhämtning med Gemma 4 kontextuella resonemang.

Verktyg och tillgänglighet

Modellen är tillgänglig via Googles AI Edge-verktyg. Google AI Edge Gallery-appen visar Instant Media Search, som hittar biblioteksmatchningar genom semantisk likhet från text- eller bildfrågor, och en Video Moments Finder som lokaliserar specifika scener med hjälp av text- eller ljudfrågor. Realtidsklassificering, routing och prediktiv användning exponeras genom MediaPipe Decision Task API, och Googles AI Edge-blogg dokumenterar hur man bygger sök- och RAG-system på enheten med LiteRT. Fullständiga utvärderingsmått finns på modellkortet.

Varför inbäddningar på enheten är viktiga

Inbäddningsmodeller skapar sällan rubriker som frontierchattmodeller gör, men de sitter under de flesta praktiska AI-funktionerna: semantisk sökning, rekommendation, deduplicering, klassificering och hämtning för RAG. Att köra dem lokalt ändrar integritets- och latenskalkylen helt. Data lämnar aldrig enheten, förfrågningar fungerar offline och det finns ingen API-kostnad per samtal, vilket är viktigt i en skala av miljarder inbäddade enheter.

EmbeddingGemma 2 intensifierar också konkurrensen i det effektiva utrymmet med öppen modell, där Google, Meta, Mistral och en kohort av mindre labb tävlar för att bevisa att användbar AI kan köras utan ett datacenter. En 740M-parametermodell som hanterar fem modaliteter på en telefon är en anmärkningsvärd markör i det loppet. Om nedladdningsbanan för dess föregångare är någon indikation, förvänta dig att EmbeddingGemma 2 kommer att dyka upp i ett brett utbud av mobil- och kantprodukter under de kommande månaderna.

Ligg före AI-kurvan

AI på enheten avancerar snabbare än de flesta inser. Läs de senaste AI-nyheterna på aibuzzwire.news för täckning av varje större modelllansering, benchmark och utgivning av utvecklarverktyg.

Läs mer AI-nyheter →