Google a lancé EmbeddingGemma 2, un modèle d'intégration ouvert et léger qui mappe de manière native des combinaisons de texte, d'images, d'audio et de vidéo dans un seul espace d'intégration unifié. L'annonce, publiée le 6 octobre 2026 par les ingénieurs de recherche de Google DeepMind, Sahil Dua et Henrique Schechter Vera, positionne le modèle de 740 millions de paramètres comme l'option la plus performante pour les intégrations multimodales sur appareil, publiée sous une licence Apache 2.0 commercialement permissive et construite sur l'architecture Gemma 4.
Le premier EmbeddingGemma a dépassé les attentes de Google, avec plus de 20 millions de téléchargements alimentant les outils de recherche sur les appareils et les pipelines de génération augmentée de récupération axée sur la confidentialité. La suite a suscité un intérêt immédiat des développeurs, suscitant l'une des plus grandes discussions de Hacker News de la journée alors que les constructeurs évaluaient ce qu'un seul intégrateur multimodal signifie pour les applications locales AI news, les médiathèques et les systèmes RAG qui ne touchent jamais au cloud.
Un modèle pour le texte, le code, les images, l'audio et la vidéo
La capacité principale d'EmbeddingGemma 2 est la multimodalité native. Plutôt que d'exécuter des encodeurs distincts par modalité et d'assembler les résultats, le modèle intègre des combinaisons de texte, de code, d'images, de vidéo et d'audio dans un seul espace partagé. Les exemples de Google incluent la recherche d'un clip vidéo spécifique à l'aide d'un mémo vocal comme requête, ou la recherche d'heures d'enregistrements audio avec une invite textuelle, le tout traité par un modèle unique sur du matériel local.
L'architecture est modulaire. Le noyau texte uniquement nécessite aussi peu que 270 millions de paramètres, avec des encodeurs optionnels de vision (170 millions de paramètres) et d'audio (300 millions de paramètres) ajoutant une prise en charge multimodale complète. Les développeurs peuvent donc déployer dès aujourd’hui un intégrateur de texte compact et évoluer vers une récupération multimodale complète sans changer de famille de modèles.
Résultats de référence et efficacité du stockage
Google rapporte qu'EmbeddingGemma 2 obtient les meilleurs scores parmi les intégrateurs multimodaux sub-1B sur des tests de référence, notamment le code MTEB (Massive Text Embedding Benchmark) et MAEB (Massive Audio Embedding Benchmark), tout en faisant correspondre ou surpassant de nombreux modèles plus grands pour les tâches de texte, de vision et d'audio. Le gain le plus concret réside dans le code : les performances du code MTEB ont bondi de 9,92 points, passant de 68,76 à 78,68, ce qui, selon Google, rend le modèle bien adapté à l'indexation de la base de code locale, à la recherche de code sémantique et à la récupération d'agents de codage. En matière d'image, de vidéo, de documents et d'audio, la société revendique une nouvelle norme de qualité par paramètre pour les modèles inférieurs à 1B, affirmant qu'elle surpasse même certains modèles spécialisés de plus de deux fois sa taille.
L'efficacité du stockage provient de l'apprentissage des représentations Matryoshka (MRL). Les vecteurs de sortie peuvent être tronqués dynamiquement de 768 dimensions à 512, 256 ou 128 dimensions, offrant ainsi une réduction de stockage jusqu'à 6 fois pour les bases de données vectorielles locales et l'utilisation de la mémoire. Pour les développeurs exécutant la récupération sur des téléphones ou du matériel embarqué, cette différence détermine souvent si une fonctionnalité est livrée ou non.
Conçu pour les budgets matériels serrés
L'empreinte sur l'appareil est le principal argument de vente du modèle. Avec la quantification, Google rapporte qu'EmbeddingGemma 2 nécessite aussi peu qu'environ 191 Mo de RAM active pour les pondérations de texte uniquement et environ 567 Mo pour le modèle multimodal complet sur un Google Pixel 11 Pro. La fenêtre contextuelle est également passée à 8 000 jetons, soit quatre fois plus grande qu'EmbeddingGemma 1, suffisamment pour traiter jusqu'à 5,5 minutes d'audio, 29 images ou 58 images vidéo en un seul passage, ou des combinaisons entrelacées de ceux-ci.
Étant donné que le modèle partage son tokenizer de texte et son encodeur audio avec Gemma 4, les développeurs peuvent exécuter EmbeddingGemma 2 aux côtés de Gemma 4 dans un pipeline unifié avec une empreinte mémoire combinée inférieure, permettant un RAG sur l'appareil où la récupération et la génération se produisent toutes deux localement. Google le démontre dans son application AI Edge Foresight, associant la récupération de fichiers locaux au raisonnement contextuel Gemma 4.
Outillage et disponibilité
Le modèle est disponible via l'outil AI Edge de Google. L'application Google AI Edge Gallery présente la recherche instantanée de médias, qui recherche des correspondances de bibliothèque par similarité sémantique à partir de requêtes de texte ou d'image, et un outil de recherche de moments vidéo qui localise des scènes spécifiques à l'aide de requêtes de texte ou d'audio. Les cas d'utilisation de classification, de routage et de prédictivité en temps réel sont exposés via l'API MediaPipe Decision Task, et le blog AI Edge de Google explique comment créer des systèmes de recherche et RAG sur appareil avec LiteRT. Les mesures d’évaluation complètes sont disponibles dans la fiche modèle.
Pourquoi les intégrations sur l'appareil sont importantes
Les modèles d'intégration font rarement la une des journaux comme le font les modèles de chat frontalier, mais ils se trouvent sous la plupart des fonctionnalités pratiques de l'IA : recherche sémantique, recommandation, déduplication, classification et récupération pour RAG. Leur exécution locale modifie entièrement le calcul de la confidentialité et de la latence. Les données ne quittent jamais l'appareil, les requêtes fonctionnent hors ligne et il n'y a aucun coût d'API par appel, ce qui est important à l'échelle de milliards d'appareils intégrés.
EmbeddingGemma 2 intensifie également la concurrence dans l'espace efficace du modèle ouvert, où Google, Meta, Mistral et une cohorte de petits laboratoires se battent pour prouver qu'une IA utile peut fonctionner sans centre de données. Un modèle à 740 millions de paramètres gérant cinq modalités sur un téléphone est un marqueur notable dans cette course. Si la trajectoire de téléchargement de son prédécesseur est une indication, attendez-vous à ce qu'EmbeddingGemma 2 apparaisse dans une large gamme de produits mobiles et de pointe au cours des prochains mois.
Gardez une longueur d'avance sur la courbe de l'IA
L’IA sur appareil progresse plus rapidement que la plupart des gens ne le pensent. Lisez les dernières nouvelles sur l'IA sur aibuzzwire.news pour une couverture de chaque lancement de modèle majeur, de référence et de version d'outil de développement.
Lire plus d'actualités sur l'IA →