O Google lançou o EmbeddingGemma 2, um modelo de incorporação aberto e leve que mapeia nativamente combinações de texto, imagens, áudio e vídeo em um único espaço de incorporação unificado. O anúncio, postado em 6 de outubro de 2026 pelos engenheiros de pesquisa do Google DeepMind Sahil Dua e Henrique Schechter Vera, posiciona o modelo de 740 milhões de parâmetros como a opção mais capaz para incorporações multimodais no dispositivo, lançado sob uma licença Apache 2.0 comercialmente permissiva e construído na arquitetura Gemma 4.
O primeiro EmbeddingGemma superou as expectativas do Google, com mais de 20 milhões de downloads alimentando ferramentas de pesquisa no dispositivo e pipelines de geração aumentada de recuperação que priorizam a privacidade. A sequência gerou interesse imediato dos desenvolvedores, gerando uma das maiores discussões do dia sobre Hacker News, enquanto os construtores avaliavam o que um único incorporador multimodal significa para aplicativos locais notícias de IA, bibliotecas de mídia e sistemas RAG que nunca tocam a nuvem.
Um modelo para texto, código, imagens, áudio e vídeo
A capacidade principal do EmbeddingGemma 2 é a multimodalidade nativa. Em vez de executar codificadores separados por modalidade e unir os resultados, o modelo incorpora combinações de texto, código, imagens, vídeo e áudio em um espaço compartilhado. Os exemplos do Google incluem encontrar um videoclipe específico usando uma mensagem de voz como consulta ou pesquisar horas de gravações de áudio com um prompt de texto, tudo processado por um único modelo em hardware local.
A arquitetura é modular. O núcleo somente de texto requer apenas 270 milhões de parâmetros, com codificadores opcionais de visão (170 milhões de parâmetros) e áudio (300 milhões de parâmetros) adicionando suporte multimodal completo. Portanto, os desenvolvedores podem implantar hoje um incorporador de texto compacto e evoluir para uma recuperação multimodal completa sem alterar as famílias de modelos.
Resultados de referência e eficiência de armazenamento
O Google relata que o EmbeddingGemma 2 alcança pontuações líderes entre os incorporadores multimodais sub-1B em benchmarks, incluindo código MTEB (Massive Text Embedding Benchmark) e MAEB (Massive Audio Embedding Benchmark), ao mesmo tempo em que corresponde ou supera muitos modelos maiores em tarefas de texto, visão e áudio. O ganho mais concreto está no código: o desempenho do código MTEB saltou 9,92 pontos, de 68,76 para 78,68, o que, segundo o Google, torna o modelo adequado para indexação de base de código local, pesquisa de código semântico e recuperação de agente de codificação. Em imagem, vídeo, documentos e áudio, a empresa reivindica um novo padrão de qualidade por parâmetro para modelos sub-1B, dizendo que até supera alguns modelos especializados em mais do que o dobro do seu tamanho.
A eficiência de armazenamento vem do Matryoshka Representation Learning (MRL). Os vetores de saída podem ser truncados dinamicamente de 768 dimensões para 512, 256 ou 128 dimensões, proporcionando uma redução de armazenamento de até 6x para bancos de dados de vetores locais e uso de memória. Para desenvolvedores que executam recuperação em telefones ou hardware incorporado, essa diferença geralmente determina se um recurso será fornecido.
Projetado para orçamentos apertados de hardware
A pegada no dispositivo é o principal ponto de venda do modelo. Com a quantização, o Google relata que o EmbeddingGemma 2 requer apenas cerca de 191 MB de RAM ativa para pesos somente de texto e cerca de 567 MB para o modelo multimodal completo em um Google Pixel 11 Pro. A janela de contexto também cresceu para 8.000 tokens, quatro vezes maior que o EmbeddingGemma 1, o suficiente para processar até 5,5 minutos de áudio, 29 imagens ou 58 quadros de vídeo em uma única passagem, ou combinações intercaladas dos mesmos.
Como o modelo compartilha seu tokenizador de texto e codificador de áudio com o Gemma 4, os desenvolvedores podem executar o EmbeddingGemma 2 junto com o Gemma 4 em um pipeline unificado com menor consumo de memória combinada, permitindo RAG no dispositivo onde a recuperação e a geração acontecem localmente. O Google demonstra isso em seu aplicativo AI Edge Foresight, combinando a recuperação de arquivos locais com o raciocínio contextual Gemma 4.
Ferramentas e Disponibilidade
O modelo está disponível por meio das ferramentas AI Edge do Google. O aplicativo Google AI Edge Gallery apresenta Instant Media Search, que encontra correspondências de biblioteca por semelhança semântica de consultas de texto ou imagem, e um Video Moments Finder que localiza cenas específicas usando consultas de texto ou áudio. Classificação em tempo real, roteamento e casos de uso preditivos são expostos por meio da API MediaPipe Decision Task, e o blog AI Edge do Google documenta como construir sistemas RAG e pesquisa no dispositivo com LiteRT. As métricas de avaliação completas estão disponíveis no cartão do modelo.
Por que os embeddings no dispositivo são importantes
Os modelos de incorporação raramente chegam às manchetes da mesma forma que os modelos de bate-papo de fronteira, mas eles ficam abaixo da maioria dos recursos práticos de IA: pesquisa semântica, recomendação, desduplicação, classificação e recuperação para RAG. Executá-los localmente altera totalmente o cálculo de privacidade e latência. Os dados nunca saem do dispositivo, as consultas funcionam off-line e não há custo de API por chamada, o que é importante na escala de bilhões de dispositivos incorporados.
O EmbeddingGemma 2 também intensifica a competição no espaço eficiente do modelo aberto, onde Google, Meta, Mistral e um grupo de laboratórios menores estão correndo para provar que a IA útil pode funcionar sem um data center. Um modelo de 740M de parâmetros que lida com cinco modalidades em um telefone é um marco notável nessa corrida. Se a trajetória de downloads de seu antecessor servir de indicação, espere que o EmbeddingGemma 2 apareça em uma ampla gama de produtos móveis e de ponta nos próximos meses.
Fique à frente da curva da IA
A IA no dispositivo está avançando mais rápido do que a maioria das pessoas imagina. Leia as últimas notícias sobre IA em aibuzzwire.news para cobertura de todos os principais lançamentos de modelos, benchmarks e lançamentos de ferramentas para desenvolvedores.
Leia mais notícias sobre IA →