Google ha lanciato EmbeddingGemma 2, un modello di incorporamento aperto e leggero che mappa in modo nativo combinazioni di testo, immagini, audio e video in un unico spazio di incorporamento unificato. L'annuncio, pubblicato il 6 ottobre 2026 dagli ingegneri ricercatori di Google DeepMind Sahil Dua e Henrique Schechter Vera, posiziona il modello da 740 milioni di parametri come l'opzione più capace per gli incorporamenti multimodali sul dispositivo, rilasciato con una licenza Apache 2.0 commercialmente permissiva e costruito sull'architettura Gemma 4.
Il primo EmbeddingGemma ha superato le aspettative di Google, con oltre 20 milioni di download che hanno alimentato gli strumenti di ricerca sul dispositivo e pipeline di generazione aumentata di recupero della privacy. Il sequel ha suscitato un immediato interesse da parte degli sviluppatori, suscitando una delle più grandi discussioni della giornata su Hacker News mentre gli sviluppatori valutavano cosa significa un singolo embedder multimodale per le app locali AI news, le librerie multimediali e i sistemi RAG che non toccano mai il cloud.
Un modello per testo, codice, immagini, audio e video
La capacità principale di EmbeddingGemma 2 è la multimodalità nativa. Invece di eseguire codificatori separati per modalità e unire insieme i risultati, il modello incorpora combinazioni di testo, codice, immagini, video e audio in uno spazio condiviso. Gli esempi di Google includono la ricerca di un clip video specifico utilizzando un memo vocale come query o la ricerca di ore di registrazioni audio con un messaggio di testo, il tutto elaborato da un unico modello sull'hardware locale.
L'architettura è modulare. Il core di solo testo richiede appena 270 milioni di parametri, con codificatori visivi opzionali (170 milioni di parametri) e audio (300 milioni di parametri) che aggiungono il supporto multimodale completo. Gli sviluppatori possono quindi implementare oggi stesso un incorporamento di testo compatto e svilupparlo fino al recupero multimodale completo senza modificare le famiglie di modelli.
Risultati benchmark ed efficienza di archiviazione
Google segnala che EmbeddingGemma 2 ottiene punteggi di primo piano tra gli embedder multimodali sub-1B su benchmark tra cui il codice MTEB (Massive Text Embedding Benchmark) e MAEB (Massive Audio Embedding Benchmark), abbinando o superando molti modelli più grandi nelle attività di testo, visione e audio. Il guadagno più concreto è nel codice: le prestazioni del codice MTEB sono aumentate di 9,92 punti, da 68,76 a 78,68, cosa che secondo Google rende il modello adatto all'indicizzazione della base di codice locale, alla ricerca di codice semantico e al recupero dell'agente di codifica. Attraverso immagini, video, documenti e audio, l'azienda rivendica un nuovo standard di qualità per parametro per i modelli inferiori a 1B, affermando che supera addirittura alcuni modelli specialistici di oltre il doppio delle sue dimensioni.
L'efficienza dello storage deriva dal Matryoshka Representation Learning (MRL). I vettori di output possono essere troncati dinamicamente da 768 dimensioni fino a 512, 256 o 128 dimensioni, offrendo una riduzione dello spazio di archiviazione fino a 6 volte per i database vettoriali locali e l'utilizzo della memoria. Per gli sviluppatori che eseguono il recupero su telefoni o hardware incorporato, questa differenza spesso determina se una funzionalità viene fornita o meno.
Progettato per budget hardware limitati
L'impronta sul dispositivo è il punto di forza del modello. Con la quantizzazione, Google segnala che EmbeddingGemma 2 richiede solo circa 191 MB di RAM attiva per i pesi di solo testo e circa 567 MB per il modello multimodale completo su Google Pixel 11 Pro. Anche la finestra di contesto è cresciuta fino a 8.000 token, quattro volte più grande di EmbeddingGemma 1, sufficienti per elaborare fino a 5,5 minuti di audio, 29 immagini o 58 fotogrammi video in un singolo passaggio, o combinazioni interleaved degli stessi.
Poiché il modello condivide il tokenizzatore di testo e il codificatore audio con Gemma 4, gli sviluppatori possono eseguire EmbeddingGemma 2 insieme a Gemma 4 in una pipeline unificata con un ingombro di memoria combinato inferiore, abilitando il RAG sul dispositivo dove il recupero e la generazione avvengono entrambi localmente. Google lo dimostra nella sua app AI Edge Foresight, abbinando il recupero di file locali al ragionamento contestuale di Gemma 4.
Strumenti e disponibilità
Il modello è disponibile tramite gli strumenti AI Edge di Google. L'app Google AI Edge Gallery presenta Instant Media Search, che trova corrispondenze nella libreria per somiglianza semantica da query di testo o immagini, e un Video Moments Finder che individua scene specifiche utilizzando query di testo o audio. La classificazione in tempo reale, il routing e i casi d'uso predittivi vengono esposti tramite l'API MediaPipe Decision Task e il blog AI Edge di Google documenta come creare sistemi di ricerca e RAG sul dispositivo con LiteRT. Le metriche di valutazione complete sono disponibili nella scheda modello.
Perché gli incorporamenti sul dispositivo sono importanti
I modelli di incorporamento raramente fanno notizia come fanno i modelli di chat di frontiera, ma si collocano al di sotto delle funzionalità più pratiche dell'intelligenza artificiale: ricerca semantica, raccomandazione, deduplicazione, classificazione e recupero per RAG. Eseguirli localmente modifica completamente il calcolo della privacy e della latenza. I dati non lasciano mai il dispositivo, le query funzionano offline e non vi è alcun costo API per chiamata, il che è importante su scala di miliardi di dispositivi integrati.
EmbeddingGemma 2 intensifica anche la concorrenza nello spazio efficiente del modello aperto, dove Google, Meta, Mistral e una coorte di laboratori più piccoli stanno gareggiando per dimostrare che un’intelligenza artificiale utile può funzionare senza un data center. Un modello con parametri 740M che gestisce cinque modalità su un telefono è un indicatore notevole in quella corsa. Se la traiettoria di download del suo predecessore è indicativa, aspettatevi che EmbeddingGemma 2 venga visualizzato in un'ampia gamma di prodotti mobili ed edge nei prossimi mesi.
Resta al passo con la curva dell'intelligenza artificiale
L’intelligenza artificiale sui dispositivi sta avanzando più velocemente di quanto la maggior parte delle persone creda. Leggi le ultime notizie sull'intelligenza artificiale su aibuzzwire.news per la copertura di ogni importante lancio di modelli, benchmark e rilascio di strumenti per sviluppatori.
Leggi altre notizie sull'AI →