Google lanzó EmbeddingGemma 2, un modelo de incrustación ligero y abierto que asigna de forma nativa combinaciones de texto, imágenes, audio y video en un único espacio de incrustación unificado. El anuncio, publicado el 6 de octubre de 2026 por los ingenieros de investigación de Google DeepMind, Sahil Dua y Henrique Schechter Vera, posiciona el modelo de 740 millones de parámetros como la opción más capaz para integraciones multimodales en dispositivos, lanzado bajo una licencia Apache 2.0 comercialmente permisiva y construido sobre la arquitectura Gemma 4.
El primer EmbeddingGemma superó las expectativas de Google, con más de 20 millones de descargas impulsando herramientas de búsqueda en el dispositivo y canales de generación aumentada de recuperación de privacidad. La secuela generó un interés inmediato de los desarrolladores, generando una de las mayores discusiones de Hacker News del día, mientras los constructores evaluaban lo que significa un único integrador multimodal para aplicaciones locales AI news, bibliotecas multimedia y sistemas RAG que nunca tocan la nube.
Un modelo para texto, código, imágenes, audio y vídeo
La capacidad principal de EmbeddingGemma 2 es la multimodalidad nativa. En lugar de ejecutar codificadores separados por modalidad y unir los resultados, el modelo incorpora combinaciones de texto, código, imágenes, video y audio en un espacio compartido. Los ejemplos de Google incluyen encontrar un video clip específico usando una nota de voz como consulta, o buscar horas de grabaciones de audio con un mensaje de texto, todo procesado por un solo modelo en hardware local.
La arquitectura es modular. El núcleo de solo texto requiere tan solo 270 millones de parámetros, con codificadores opcionales de visión (170 millones de parámetros) y audio (300 millones de parámetros) que agregan soporte multimodal completo. Por lo tanto, los desarrolladores pueden implementar hoy un incrustador de texto compacto y convertirlo en una recuperación multimodal completa sin cambiar las familias de modelos.
Resultados comparativos y eficiencia de almacenamiento
Google informa que EmbeddingGemma 2 logra puntuaciones líderes entre los integradores multimodales sub-1B en puntos de referencia que incluyen el código MTEB (Massive Text Embedding Benchmark) y MAEB (Massive Audio Embedding Benchmark), al tiempo que iguala o supera a muchos modelos más grandes en tareas de texto, visión y audio. La ganancia más concreta está en el código: el rendimiento del código MTEB aumentó 9,92 puntos, de 68,76 a 78,68, lo que según Google hace que el modelo sea muy adecuado para la indexación de bases de código locales, la búsqueda de códigos semánticos y la recuperación de agentes de codificación. En imágenes, videos, documentos y audio, la compañía reclama un nuevo estándar en calidad por parámetro para modelos sub-1B, diciendo que incluso supera a algunos modelos especializados con más del doble de su tamaño.
La eficiencia del almacenamiento proviene del aprendizaje de representación de Matryoshka (MRL). Los vectores de salida se pueden truncar dinámicamente desde 768 dimensiones hasta 512, 256 o 128 dimensiones, lo que ofrece una reducción de almacenamiento de hasta 6 veces para bases de datos de vectores locales y uso de memoria. Para los desarrolladores que ejecutan la recuperación en teléfonos o hardware integrado, esa diferencia a menudo determina si una función se incluye o no.
Diseñado para presupuestos de hardware ajustados
El espacio que ocupa en el dispositivo es el principal atractivo de venta del modelo. Con la cuantificación, Google informa que EmbeddingGemma 2 requiere tan solo aproximadamente 191 MB de RAM activa para pesos de solo texto y aproximadamente 567 MB para el modelo multimodal completo en un Google Pixel 11 Pro. La ventana de contexto también ha crecido hasta 8.000 tokens, cuatro veces más grande que EmbeddingGemma 1, suficiente para procesar hasta 5,5 minutos de audio, 29 imágenes o 58 fotogramas de vídeo en una sola pasada, o combinaciones intercaladas de los mismos.
Debido a que el modelo comparte su tokenizador de texto y codificador de audio con Gemma 4, los desarrolladores pueden ejecutar EmbeddingGemma 2 junto con Gemma 4 en una tubería unificada con una menor huella de memoria combinada, lo que permite RAG en el dispositivo donde la recuperación y la generación ocurren localmente. Google lo demuestra en su aplicación AI Edge Foresight, combinando la recuperación de archivos locales con el razonamiento contextual Gemma 4.
Herramientas y disponibilidad
El modelo está disponible a través de las herramientas AI Edge de Google. La aplicación Google AI Edge Gallery presenta Instant Media Search, que encuentra coincidencias de biblioteca por similitud semántica a partir de consultas de texto o imágenes, y un Buscador de momentos de video que localiza escenas específicas mediante consultas de texto o audio. Los casos de uso predictivo, enrutamiento y clasificación en tiempo real se exponen a través de la API MediaPipe Decision Task, y el blog AI Edge de Google documenta cómo crear sistemas RAG y de búsqueda en el dispositivo con LiteRT. Las métricas de evaluación completas están disponibles en la tarjeta modelo.
Por qué son importantes las incorporaciones en el dispositivo
Los modelos integrados rara vez aparecen en los titulares como lo hacen los modelos de chat fronterizo, pero se encuentran debajo de las funciones más prácticas de IA: búsqueda semántica, recomendación, deduplicación, clasificación y recuperación para RAG. Ejecutarlos localmente cambia por completo el cálculo de privacidad y latencia. Los datos nunca salen del dispositivo, las consultas funcionan sin conexión y no hay costo de API por llamada, lo cual es importante en la escala de miles de millones de dispositivos integrados.
EmbeddingGemma 2 también intensifica la competencia en el espacio eficiente del modelo abierto, donde Google, Meta, Mistral y un grupo de laboratorios más pequeños compiten para demostrar que la IA útil puede funcionar sin un centro de datos. Un modelo con parámetros 740M que maneja cinco modalidades en un teléfono es un marcador notable en esa carrera. Si la trayectoria de descarga de su predecesor es una indicación, se espera que EmbeddingGemma 2 aparezca en una amplia gama de productos móviles y de vanguardia en los próximos meses.
Manténgase a la vanguardia de la curva de la IA
La IA en los dispositivos avanza más rápido de lo que la mayoría de la gente cree. Lea las últimas noticias sobre IA en aibuzzwire.news para conocer la cobertura de cada lanzamiento de modelo importante, punto de referencia y lanzamiento de herramientas para desarrolladores.
Leer más noticias sobre IA →