Google heeft EmbeddingGemma 2 gelanceerd, een open, lichtgewicht inbeddingsmodel dat combinaties van tekst, afbeeldingen, audio en video in één enkele, uniforme inbeddingsruimte in kaart brengt. De aankondiging, geplaatst op 6 oktober 2026 door Google DeepMind-onderzoeksingenieurs Sahil Dua en Henrique Schechter Vera, positioneert het model met 740 miljoen parameters als de meest capabele optie voor multimodale inbedding op het apparaat, uitgebracht onder een commercieel toegestane Apache 2.0-licentie en gebouwd op de Gemma 4-architectuur.
De eerste EmbeddingGemma overtrof de verwachtingen van Google, met meer dan 20 miljoen downloads die zoekhulpmiddelen op het apparaat mogelijk maken en pijplijnen voor het ophalen van privacy. Het vervolg genereerde onmiddellijke interesse van ontwikkelaars en trok een van de grootste Hacker News-discussies van de dag, terwijl bouwers evalueerden wat een enkele multimodale embedder betekent voor lokale AI news apps, mediabibliotheken en RAG-systemen die nooit in de cloud komen.
Eén model voor tekst, code, afbeeldingen, audio en video
Het belangrijkste vermogen van Gemma 2 is native multimodaliteit. In plaats van afzonderlijke encoders per modaliteit uit te voeren en de resultaten aan elkaar te koppelen, integreert het model combinaties van tekst, code, afbeeldingen, video en audio in één gedeelde ruimte. Voorbeelden van Google zijn onder meer het vinden van een specifieke videoclip met behulp van een spraakmemo als zoekopdracht, of het doorzoeken van uren aan audio-opnamen met een tekstprompt, allemaal verwerkt door één enkel model op lokale hardware.
De architectuur is modulair. De kern met alleen tekst vereist slechts 270 miljoen parameters, waarbij optionele vision- (170 miljoen parameters) en audio- (300 miljoen parameters) encoders volledige multimodale ondersteuning toevoegen. Ontwikkelaars kunnen daarom vandaag de dag een compacte tekstembedder inzetten en uitgroeien tot volledig multimodaal ophalen zonder de modelfamilies te hoeven veranderen.
Benchmarkresultaten en opslagefficiëntie
Google meldt dat EmbeddingGemma 2 toonaangevende scores behaalt onder sub-1B multimodale inbedders op benchmarks, waaronder MTEB (Massive Text Embedding Benchmark) Code en MAEB (Massive Audio Embedding Benchmark), terwijl het veel grotere modellen op het gebied van tekst-, beeld- en audiotaken evenaart of beter presteert. De meest concrete winst zit in de code: de MTEB-codeprestaties zijn met 9,92 punten gestegen, van 68,76 naar 78,68, wat volgens Google het model zeer geschikt maakt voor lokale codebase-indexering, het zoeken naar semantische code en het ophalen van codeeragenten. Op het gebied van beeld, video, documenten en audio claimt het bedrijf een nieuwe standaard in kwaliteit per parameter voor sub-1B-modellen, waarbij het zegt dat het zelfs meer dan tweemaal zo groot presteert als sommige gespecialiseerde modellen.
De efficiëntie van opslag komt voort uit Matryoshka Representation Learning (MRL). Uitvoervectoren kunnen dynamisch worden ingekort van 768 dimensies tot 512, 256 of 128 dimensies, wat een opslagreductie tot wel 6x oplevert voor lokale vectordatabases en geheugengebruik. Voor ontwikkelaars die retrieval uitvoeren op telefoons of embedded hardware, bepaalt dat verschil vaak of een functie überhaupt wordt geleverd.
Ontworpen voor krappe hardwarebudgetten
De voetafdruk op het apparaat is het belangrijkste verkoopargument van het model. Met kwantisering meldt Google dat EmbeddingGemma 2 slechts ongeveer 191 MB actief RAM nodig heeft voor alleen tekstgewichten en ongeveer 567 MB voor het volledige multimodale model op een Google Pixel 11 Pro. Het contextvenster is ook gegroeid tot 8.000 tokens, vier keer groter dan EmbeddingGemma 1, genoeg om tot 5,5 minuten audio, 29 afbeeldingen of 58 videoframes in één keer te verwerken, of interleaved combinaties daarvan.
Omdat het model zijn teksttokenizer en audio-encoder deelt met Gemma 4, kunnen ontwikkelaars EmbeddingGemma 2 naast Gemma 4 uitvoeren in een uniforme pijplijn met een lagere gecombineerde geheugenvoetafdruk, waardoor RAG op het apparaat mogelijk wordt waarbij het ophalen en genereren beide lokaal gebeurt. Google demonstreert dit in zijn AI Edge Foresight-app, waarbij het ophalen van lokale bestanden wordt gecombineerd met contextueel redeneren in Gemma 4.
Gereedschap en beschikbaarheid
Het model is beschikbaar via de AI Edge-tooling van Google. De Google AI Edge Gallery-app toont Instant Media Search, dat bibliotheekmatches vindt op basis van semantische gelijkenis uit tekst- of afbeeldingsquery's, en een Video Moments Finder die specifieke scènes lokaliseert met behulp van tekst- of audioquery's. Real-time classificatie, routering en voorspellende gebruiksscenario's worden zichtbaar via de MediaPipe Decision Task API, en Google's AI Edge-blog documenteert hoe zoek- en RAG-systemen op apparaten kunnen worden gebouwd met LiRT. Volledige evaluatiestatistieken zijn beschikbaar op de modelkaart.
Waarom insluitingen op het apparaat belangrijk zijn
Het insluiten van modellen haalt zelden de krantenkoppen zoals frontier-chat-modellen, maar ze zitten onder de meeste praktische AI-functies: semantisch zoeken, aanbevelingen, deduplicatie, classificatie en ophalen voor RAG. Door ze lokaal uit te voeren, verandert de privacy- en latentiecalculus volledig. Gegevens verlaten het apparaat nooit, zoekopdrachten werken offline en er zijn geen API-kosten per oproep, wat van belang is op de schaal van miljarden ingebedde apparaten.
Het insluiten van Gemma 2 intensiveert ook de concurrentie in de efficiënte open-modelruimte, waar Google, Meta, Mistral en een cohort kleinere laboratoria racen om te bewijzen dat nuttige AI kan draaien zonder een datacenter. Een model met 740M-parameters dat vijf modaliteiten op een telefoon verwerkt, is een opmerkelijke mijlpaal in die race. Als het downloadtraject van zijn voorganger een indicatie is, kun je verwachten dat EmbeddingGemma 2 de komende maanden in een breed scala aan mobiele en edge-producten zal verschijnen.
Blijf de AI-curve een stap voor
On-device AI ontwikkelt zich sneller dan de meeste mensen zich realiseren. Lees het laatste AI-nieuws op aibuzzwire.news voor berichtgeving over elke belangrijke modellancering, benchmark en release van ontwikkelaarstools.
Lees meer AI-nieuws →