Google a lansat EmbeddingGemma 2, un model de încorporare deschis, ușor, care mapează în mod nativ combinații de text, imagini, audio și video într-un singur spațiu de încorporare unificat. Anunțul, postat pe 6 octombrie 2026 de inginerii de cercetare Google DeepMind Sahil Dua și Henrique Schechter Vera, poziționează modelul cu 740 de milioane de parametri drept cea mai capabilă opțiune pentru încorporarea multimodală pe dispozitiv, lansată sub o licență Apache 2.0 permisivă comercial și construit pe arhitectura Gemma 4.

Prima EmbeddingGemma a depășit așteptările Google, cu peste 20 de milioane de descărcări care au alimentat instrumente de căutare de pe dispozitiv și canale de generație augmentată pentru recuperarea în primul rând a confidențialității. Continuarea a generat interes imediat pentru dezvoltatori, atrăgând una dintre cele mai mari discuții Hacker News din ziua de azi, în timp ce constructorii au evaluat ce înseamnă un singur embeder multimodal pentru aplicațiile locale știri AI, bibliotecile media și sistemele RAG care nu ating niciodată cloudul.

Un model pentru text, cod, imagini, audio și video

Capacitatea de titlu EmbeddingGemma 2 este multimodalitatea nativă. În loc să ruleze codificatoare separate pe modalitate și să îmbine rezultatele împreună, modelul încorporează combinații de text, cod, imagini, video și audio într-un spațiu comun. Exemplele Google includ găsirea unui videoclip specific folosind o notă vocală ca interogare sau căutarea de ore de înregistrări audio cu un mesaj text, toate procesate de un singur model pe hardware local.

Arhitectura este modulara. Nucleul numai text necesită doar 270 de milioane de parametri, cu codificatoare opționale pentru viziune (170 de milioane de parametri) și audio (300 de milioane de parametri) adăugând suport multimodal complet. Prin urmare, dezvoltatorii pot implementa un încorporator de text compact astăzi și pot crește în recuperarea multimodală completă fără a schimba familiile de modele.

Rezultatele benchmark și eficiența stocării

Google raportează că EmbeddingGemma 2 atinge scoruri de top în rândul înglobărilor multimodale sub-1B la benchmark-uri, inclusiv MTEB (Massive Text Embedding Benchmark) Cod și MAEB (Massive Audio Embedding Benchmark), în același timp potrivind sau depășind multe modele mai mari în sarcinile de text, viziune și audio. Cel mai concret câștig este în cod: performanța codului MTEB a crescut cu 9,92 de puncte, de la 68,76 la 78,68, ceea ce, potrivit Google, face ca modelul să fie potrivit pentru indexarea locală a bazei de cod, căutarea codului semantic și recuperarea agentului de codare. În ceea ce privește imaginea, videoclipul, documentele și audio, compania revendică un nou standard de calitate pe parametru pentru modelele sub-1B, spunând că depășește chiar unele modele specializate de peste două ori dimensiunea sa.

Eficiența stocării provine din Matryoshka Representation Learning (MRL). Vectorii de ieșire pot fi trunchiați dinamic de la 768 de dimensiuni la 512, 256 sau 128 de dimensiuni, oferind o reducere de stocare de până la 6 ori pentru bazele de date vectoriale locale și utilizarea memoriei. Pentru dezvoltatorii care execută recuperarea pe telefoane sau hardware încorporat, această diferență determină adesea dacă o funcție este livrată.

Proiectat pentru bugete reduse de hardware

Amprenta pe dispozitiv este punctul central de vânzare al modelului. Cu cuantificare, Google raportează că EmbeddingGemma 2 necesită aproximativ 191 MB de memorie RAM activă pentru greutăți doar text și aproximativ 567 MB pentru modelul multimodal complet pe un Google Pixel 11 Pro. Fereastra de context a crescut, de asemenea, la 8.000 de jetoane, de patru ori mai mare decât EmbeddingGemma 1, suficient pentru a procesa până la 5,5 minute de audio, 29 de imagini sau 58 de cadre video într-o singură trecere sau combinații între acestea.

Deoarece modelul își împărtășește tokenizerul de text și codificatorul audio cu Gemma 4, dezvoltatorii pot rula EmbeddingGemma 2 împreună cu Gemma 4 într-o conductă unificată cu o amprentă de memorie combinată mai mică, permițând RAG pe dispozitiv, unde recuperarea și generarea au loc local. Google demonstrează acest lucru în aplicația sa AI Edge Foresight, asociind recuperarea fișierelor locale cu raționamentul contextual Gemma 4.

Instrumente și disponibilitate

Modelul este disponibil prin instrumentele Google AI Edge. Aplicația Google AI Edge Gallery prezintă Instant Media Search, care găsește potriviri de bibliotecă prin similitudine semantică din interogări de text sau imagine, și un Video Moments Finder care localizează anumite scene folosind interogări text sau audio. Clasificarea în timp real, rutarea și cazurile de utilizare predictive sunt expuse prin API-ul MediaPipe Decision Task, iar blogul Google AI Edge documentează cum să construiți sisteme de căutare și RAG pe dispozitiv cu LiteRT. Valorile complete de evaluare sunt disponibile în cardul model.

De ce contează înglobările pe dispozitiv

Modelele de încorporare rareori fac titluri la titlu în felul în care modelele de chat de frontieră, dar ele stau sub cele mai practice funcții AI: căutare semantică, recomandare, deduplicare, clasificare și preluare pentru RAG. Rularea lor local schimbă complet calculul de confidențialitate și latență. Datele nu părăsesc niciodată dispozitivul, interogările funcționează offline și nu există un cost API per apel, care contează la scara de miliarde de dispozitive încorporate.

EmbeddingGemma 2 intensifică, de asemenea, concurența în spațiul eficient de model deschis, unde Google, Meta, Mistral și o cohortă de laboratoare mai mici se întrec pentru a demonstra că AI utilă poate rula fără un centru de date. Un model cu parametrii 740M care gestionează cinci modalități pe un telefon este un marker notabil în acea cursă. Dacă traiectoria de descărcare a predecesorului său este un indiciu, așteptați-vă ca EmbeddingGemma 2 să apară într-o gamă largă de produse mobile și edge în lunile următoare.

Rămâi înaintea curbei AI

Inteligența artificială pe dispozitiv avansează mai repede decât își dau seama majoritatea oamenilor. Citiți cele mai recente știri despre AI pe aibuzzwire.news pentru acoperirea fiecărei lansări majore de modele, benchmark și lansări de instrumente pentru dezvoltatori.

Citiți mai multe știri AI →