Google spustil EmbeddingGemma 2, otevřený, lehký model pro vkládání, který nativně mapuje kombinace textu, obrázků, zvuku a videa do jediného jednotného prostoru pro vkládání. Oznámení, které zveřejnili 6. října 2026 výzkumní inženýři Google DeepMind Sahil Dua a Henrique Schechter Vera, staví model se 740 miliony parametrů jako nejschopnější možnost pro multimodální zabudování na zařízení, vydaný pod komerčně povolenou licencí Apache 2.0 a postavený na architektuře Gemma 4.
První EmbeddingGemma překonala očekávání společnosti Google s více než 20 miliony stažení pohánějících vyhledávací nástroje na zařízení a kanály rozšířené generace pro získávání soukromí. Pokračování vyvolalo okamžitý zájem vývojářů a vyvolalo jednu z největších diskusí dne Hacker News, když stavitelé hodnotili, co znamená jeden multimodální embedder pro místní aplikace AI news, knihovny médií a systémy RAG, které se nikdy nedotknou cloudu.
Jeden model pro text, kód, obrázky, zvuk a video
Hlavní schopností EmbeddingGemma 2 je nativní multimodalita. Namísto spouštění samostatných kodérů pro každou modalitu a spojování výsledků dohromady model vkládá kombinace textu, kódu, obrázků, videa a zvuku do jednoho sdíleného prostoru. Příklady Google zahrnují vyhledání konkrétního videoklipu pomocí hlasové poznámky jako dotazu nebo prohledávání hodin zvukových nahrávek pomocí textové výzvy, vše zpracované jediným modelem na místním hardwaru.
Architektura je modulární. Pouze textové jádro vyžaduje pouhých 270 milionů parametrů, přičemž volitelné kodéry pro vidění (170 milionů parametrů) a audio (300 milionů parametrů) přidávají plnou multimodální podporu. Vývojáři proto mohou dnes nasadit kompaktní textový embedder a rozvinout se do plného multimodálního vyhledávání, aniž by museli měnit rodiny modelů.
Srovnávací výsledky a efektivita úložiště
Google uvádí, že EmbeddingGemma 2 dosahuje předních skóre mezi multimodálními embeddery nižšími než 1B ve srovnávacích testech, včetně kódu MTEB (Massive Text Embedding Benchmark) a MAEB (Massive Audio Embedding Benchmark), přičemž se vyrovná nebo překonává mnoho větších modelů v textových, vizuálních a zvukových úlohách. Nejkonkrétnější zisk je v kódu: Výkon kódu MTEB vyskočil o 9,92 bodu, z 68,76 na 78,68, což podle Googlu dělá model dobře vhodný pro místní indexování kódové báze, vyhledávání sémantického kódu a získávání kódovacích agentů. V oblasti obrazu, videa, dokumentů a zvuku společnost prohlašuje nový standard v kvalitě na parametr pro modely pod 1B a tvrdí, že dokonce překonává některé specializované modely více než dvojnásobnou velikostí.
Efektivita skladování vychází z Matryoshka Representation Learning (MRL). Výstupní vektory lze dynamicky zkracovat ze 768 dimenzí až na 512, 256 nebo 128 dimenzí, což přináší až 6x zmenšení úložiště pro lokální vektorové databáze a využití paměti. Pro vývojáře, kteří spouštějí vyhledávání na telefonech nebo vestavěném hardwaru, tento rozdíl často určuje, zda se funkce vůbec dodá.
Navrženo pro malé rozpočty na hardware
Stopa na zařízení je hlavním prodejním argumentem modelu. S kvantizací Google uvádí, že EmbeddingGemma 2 vyžaduje jen zhruba 191 MB aktivní paměti RAM pro textové váhy a asi 567 MB pro plně multimodální model na Google Pixel 11 Pro. Kontextové okno se také rozrostlo na 8 000 tokenů, čtyřikrát větší než EmbeddingGemma 1, což je dostatečné množství pro zpracování až 5,5 minuty zvuku, 29 obrázků nebo 58 video snímků v jednom průchodu nebo jejich prokládaných kombinací.
Vzhledem k tomu, že model sdílí svůj textový tokenizér a zvukový kodér s Gemma 4, mohou vývojáři provozovat EmbeddingGemma 2 spolu s Gemma 4 v jednotném kanálu s nižším kombinovaným zatížením paměti, což umožňuje RAG na zařízení, kde načítání i generování probíhá lokálně. Google to demonstruje ve své aplikaci AI Edge Foresight, která spáruje místní načítání souborů s kontextovým uvažováním Gemma 4.
Nástroje a dostupnost
Model je k dispozici prostřednictvím nástroje Google AI Edge. Aplikace Google AI Edge Gallery představuje Okamžité vyhledávání médií, které najde shody knihoven podle sémantické podobnosti z textových nebo obrázkových dotazů, a Vyhledávač videomomentů, který vyhledá konkrétní scény pomocí textových nebo zvukových dotazů. Klasifikace v reálném čase, směrování a prediktivní případy použití jsou odhaleny prostřednictvím rozhraní MediaPipe Decision Task API a blog Google AI Edge dokumentuje, jak vytvořit systémy vyhledávání na zařízení a RAG pomocí LiteRT. Úplné metriky hodnocení jsou k dispozici na kartě modelu.
Proč záleží na vkládání na zařízení
Modely vkládání se jen zřídka dostávají do titulků tak, jako to dělají modely hraničního chatu, ale jsou pod nejpraktičtějšími funkcemi umělé inteligence: sémantické vyhledávání, doporučení, deduplikace, klasifikace a vyhledávání pro RAG. Jejich místním spuštěním se zcela změní výpočet soukromí a latence. Data nikdy neopustí zařízení, dotazy fungují offline a neexistují žádné náklady na API za volání, což je důležité v měřítku miliard vestavěných zařízení.
EmbeddingGemma 2 také zintenzivňuje konkurenci v efektivním otevřeném modelovém prostoru, kde se Google, Meta, Mistral a kohorta menších laboratoří předhánějí, aby dokázaly, že užitečná umělá inteligence může fungovat i bez datového centra. Model s parametrem 740M zvládající pět modalit na telefonu je v tomto závodě pozoruhodným ukazatelem. Pokud trajektorie stahování jeho předchůdce naznačuje, očekávejte, že se EmbeddingGemma 2 v nadcházejících měsících objeví v široké řadě mobilních a okrajových produktů.
Udržujte si náskok před křivkou umělé inteligence
Umělá inteligence na zařízení se vyvíjí rychleji, než si většina lidí uvědomuje. Přečtěte si nejnovější zprávy o AI na aibuzzwire.news, kde najdete informace o uvedení každého velkého modelu na trh, benchmarku a vydání vývojářských nástrojů.
Přečtěte si další zprávy o AI →