O Google DeepMind lançou o EmbeddingGemma 2, um modelo de embedding aberto que mapeia texto, código, imagens, áudio e vídeo em um único espaço vetorial compartilhado para que possam ser pesquisados juntos. Ele sucede o EmbeddingGemma do ano passado, apenas de texto, que a empresa diz ter ultrapassado 20 milhões de downloads.
Construído sobre a arquitetura Gemma 4 e lançado sob licença Apache 2.0, o EmbeddingGemma 2 tem 740 milhões de parâmetros, mas é modular: cargas de trabalho apenas de texto precisam de apenas 270 milhões de parâmetros, com encoders opcionais de visão (170 milhões de parâmetros) e áudio (300 milhões de parâmetros) adicionados para suporte multimodal completo. Em um Google Pixel 11 Pro, o Google relata que a versão quantizada precisa de cerca de 191MB de RAM ativa para uso somente de texto e cerca de 567MB para a versão multimodal completa.
O modelo usa Matryoshka Representation Learning para permitir que desenvolvedores truncar os vetores de saída de 768 dimensões para 512, 256 ou 128 dimensões, o que o Google diz reduzir o armazenamento local em banco de dados vetorial em até 6 vezes. O contexto também cresceu: uma janela de 8 mil tokens, quatro vezes maior que a do EmbeddingGemma original, permite processar até 5,5 minutos de áudio, 29 imagens ou 58 quadros de vídeo em uma única passagem.
Em benchmarks, o Google relata que o EmbeddingGemma 2 lidera os embedders multimodais abaixo de 1 bilhão de parâmetros no MTEB Code e no MAEB, igualando ou superando alguns modelos especialistas maiores em tarefas de texto, visão e áudio. A recuperação de código teve o maior salto, melhorando de 68,76 para 78,68 no MTEB Code — um ganho que o Google posiciona para indexação local de bases de código e casos de uso de recuperação para agentes de codificação.
Como compartilha tokenizer e encoder de áudio com o Gemma 4, o Google está posicionando a dupla para geração aumentada por recuperação (RAG) no dispositivo: o EmbeddingGemma 2 encontra texto, imagens ou trechos de áudio relevantes localmente, e o Gemma 4 raciocina sobre eles, tudo sem uma chamada de rede. O Google aponta seus apps do AI Edge Gallery — Instant Media Search e Video Moments Finder — e o app Foresight como demonstrações iniciais, além de uma MediaPipe Decision Task API para construir sistemas de classificação e roteamento sobre os mesmos embeddings.
Os pesos do modelo estão disponíveis no Hugging Face e no Kaggle, já com suporte para transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama, LMStudio e Qdrant para armazenamento vetorial; a Unsloth publicou orientações de fine-tuning.