Google hat EmbeddingGemma 2 auf den Markt gebracht, ein offenes, leichtes Einbettungsmodell, das Kombinationen aus Text, Bildern, Audio und Video nativ in einem einzigen einheitlichen Einbettungsraum zuordnet. Die Ankündigung, die am 6. Oktober 2026 von den Google DeepMind-Forschungsingenieuren Sahil Dua und Henrique Schechter Vera veröffentlicht wurde, positioniert das 740-Millionen-Parameter-Modell als die leistungsfähigste Option für multimodale Einbettungen auf dem Gerät, veröffentlicht unter einer kommerziell freizügigen Apache 2.0-Lizenz und basierend auf der Gemma 4-Architektur.
Das erste EmbeddingGemma übertraf die Erwartungen von Google mit mehr als 20 Millionen Downloads, die geräteinterne Suchtools und Pipelines der erweiterten Generierung für den Datenschutz-First-Retrieval nutzen. Die Fortsetzung erweckte sofort das Interesse der Entwickler und löste eine der größten Hacker-News-Diskussionen des Tages aus, als die Entwickler bewerteten, was ein einzelner multimodaler Embedder für lokale KI-Nachrichten Apps, Medienbibliotheken und RAG-Systeme bedeutet, die nie mit der Cloud in Berührung kommen.
Ein Modell für Text, Code, Bilder, Audio und Video
Die Hauptfunktion von EmbeddingGemma 2 ist die native Multimodalität. Anstatt separate Encoder pro Modalität auszuführen und die Ergebnisse zusammenzufügen, bettet das Modell Kombinationen aus Text, Code, Bildern, Video und Audio in einen gemeinsamen Raum ein. Zu den Beispielen von Google gehört die Suche nach einem bestimmten Videoclip mithilfe einer Sprachnotiz als Abfrage oder die Suche nach stundenlangen Audioaufnahmen mit einer Textaufforderung, alles verarbeitet von einem einzigen Modell auf lokaler Hardware.
Die Architektur ist modular. Der Nur-Text-Kern erfordert nur 270 Millionen Parameter, wobei optionale Vision- (170 Millionen Parameter) und Audio-Encoder (300 Millionen Parameter) vollständige multimodale Unterstützung bieten. Entwickler können daher heute einen kompakten Text-Embedder einsetzen und zur vollständigen multimodalen Abfrage übergehen, ohne die Modellfamilien zu ändern.
Benchmark-Ergebnisse und Speichereffizienz
Google berichtet, dass EmbeddingGemma 2 bei Benchmarks wie MTEB (Massive Text Embedding Benchmark) Code und MAEB (Massive Audio Embedding Benchmark) unter den multimodalen Einbettern unter 1 Milliarde führende Ergebnisse erzielt und gleichzeitig viele größere Modelle bei Text-, Bild- und Audioaufgaben erreicht oder übertrifft. Der konkreteste Gewinn ist im Code zu verzeichnen: Die Leistung des MTEB-Codes stieg um 9,92 Punkte von 68,76 auf 78,68, wodurch sich das Modell laut Google gut für die Indizierung lokaler Codebasis, die Suche nach semantischem Code und den Abruf von Codierungsagenten eignet. Bei Bildern, Videos, Dokumenten und Audio setzt das Unternehmen neue Maßstäbe bei der Qualität pro Parameter für Sub-1-Milliarden-Modelle und übertrifft einige Spezialmodelle sogar um mehr als das Doppelte seiner Größe.
Die Speichereffizienz ergibt sich aus Matryoshka Representation Learning (MRL). Ausgabevektoren können dynamisch von 768 Dimensionen auf 512, 256 oder 128 Dimensionen gekürzt werden, was zu einer bis zu sechsfachen Speicherreduzierung für lokale Vektordatenbanken und Speichernutzung führt. Für Entwickler, die den Abruf auf Telefonen oder eingebetteter Hardware ausführen, bestimmt dieser Unterschied oft, ob eine Funktion überhaupt ausgeliefert wird.
Entwickelt für knappe Hardwarebudgets
Der Fußabdruck auf dem Gerät ist das Hauptverkaufsargument des Modells. Google berichtet, dass EmbeddingGemma 2 mit Quantisierung nur etwa 191 MB aktiven RAM für Nur-Text-Gewichte und etwa 567 MB für das vollständige multimodale Modell auf einem Google Pixel 11 Pro benötigt. Das Kontextfenster ist außerdem auf 8.000 Token angewachsen, viermal größer als EmbeddingGemma 1, genug, um bis zu 5,5 Minuten Audio, 29 Bilder oder 58 Videobilder in einem einzigen Durchgang oder verschachtelte Kombinationen davon zu verarbeiten.
Da das Modell seinen Text-Tokenizer und Audio-Encoder mit Gemma 4 teilt, können Entwickler EmbeddingGemma 2 zusammen mit Gemma 4 in einer einheitlichen Pipeline mit einem geringeren kombinierten Speicherbedarf ausführen und so RAG auf dem Gerät ermöglichen, bei dem sowohl Abruf als auch Generierung lokal erfolgen. Google demonstriert dies in seiner AI Edge Foresight-App, indem es den lokalen Dateiabruf mit der kontextbezogenen Argumentation von Gemma 4 kombiniert.
Werkzeuge und Verfügbarkeit
Das Modell ist über die AI Edge-Tools von Google verfügbar. Die Google AI Edge Gallery-App bietet Instant Media Search, das Bibliotheksübereinstimmungen anhand semantischer Ähnlichkeit aus Text- oder Bildabfragen findet, und einen Video Moments Finder, der bestimmte Szenen mithilfe von Text- oder Audioabfragen findet. Echtzeitklassifizierung, Routing und prädiktive Anwendungsfälle werden über die MediaPipe Decision Task API bereitgestellt, und im AI Edge-Blog von Google wird dokumentiert, wie man mit LiteRT On-Device-Such- und RAG-Systeme erstellt. Vollständige Bewertungsmetriken sind in der Modellkarte verfügbar.
Warum Einbettungen auf dem Gerät wichtig sind
Einbettungsmodelle machen selten Schlagzeilen wie Frontier-Chat-Modelle, aber sie liegen den meisten praktischen KI-Funktionen zugrunde: semantische Suche, Empfehlung, Deduplizierung, Klassifizierung und Abruf für RAG. Wenn Sie sie lokal ausführen, ändert sich die Datenschutz- und Latenzberechnung vollständig. Daten verlassen nie das Gerät, Abfragen funktionieren offline und es fallen keine API-Kosten pro Aufruf an, was bei der Größenordnung von Milliarden eingebetteter Geräte von Bedeutung ist.
EmbeddingGemma 2 intensiviert auch den Wettbewerb im effizienten Open-Model-Bereich, wo Google, Meta, Mistral und eine Kohorte kleinerer Labore darum wetteifern, zu beweisen, dass nützliche KI auch ohne Rechenzentrum laufen kann. Ein 740-M-Parameter-Modell, das fünf Modalitäten auf einem Telefon verwaltet, ist ein bemerkenswerter Marker in diesem Rennen. Wenn der Download-Verlauf des Vorgängers ein Hinweis ist, können Sie damit rechnen, dass EmbeddingGemma 2 in den kommenden Monaten in einer breiten Palette von Mobil- und Edge-Produkten auftauchen wird.
Bleiben Sie der KI-Kurve einen Schritt voraus
Die On-Device-KI schreitet schneller voran, als den meisten Menschen bewusst ist. Lesen Sie die neuesten KI-Nachrichten auf aibuzzwire.news für die Berichterstattung über alle wichtigen Modelleinführungen, Benchmarks und Entwicklertool-Releases.
Weitere KI-Neuigkeiten lesen →