Ir para o conteúdo

Google DeepMind lança modelo gratuito que roda no dispositivo para buscar texto, imagem, áudio e vídeo juntos

Resposta curta

O Google DeepMind lançou o EmbeddingGemma 2, um modelo de embedding multimodal de 740 milhões de parâmetros sob licença Apache 2.0 que roda no dispositivo, unificando texto, código, imagens, áudio e vídeo em um único espaço vetorial pesquisável. Isso importa porque equipes agora podem montar pipelines de busca semântica e recuperação privados sem passar dados sensíveis por uma API na nuvem nem pagar por chamada.

O que isso significa na operação

Para uma empresa B2B de 10 a 200 pessoas, isso é um bloco de construção, não um produto pronto: significa que um engenheiro poderia indexar transcrições de suporte, capturas de tela de produto, vídeos de onboarding e gravações de chamadas em um único sistema de busca que roda em um notebook ou servidor modesto, sem que dado algum saia das instalações e sem conta de API por consulta. Isso é diretamente útil para equipes de suporte que querem encontrar o artigo certo da base de conhecimento, um ticket antigo ou um trecho de demo gravado a partir de uma única busca, e para equipes de operações construindo busca interna sobre documentação multimodal dispersa. A ressalva é que o EmbeddingGemma 2 é só a metade de recuperação de um sistema RAG — alguém ainda precisa montar o pipeline, acoplá-lo a um modelo generativo e manter o banco de dados vetorial, então o ganho de curto prazo é custo de infraestrutura menor e mais privacidade de dados, não um produto plug-and-play.

O Google DeepMind lançou o EmbeddingGemma 2, um modelo de embedding aberto que mapeia texto, código, imagens, áudio e vídeo em um único espaço vetorial compartilhado para que possam ser pesquisados juntos. Ele sucede o EmbeddingGemma do ano passado, apenas de texto, que a empresa diz ter ultrapassado 20 milhões de downloads.

Construído sobre a arquitetura Gemma 4 e lançado sob licença Apache 2.0, o EmbeddingGemma 2 tem 740 milhões de parâmetros, mas é modular: cargas de trabalho apenas de texto precisam de apenas 270 milhões de parâmetros, com encoders opcionais de visão (170 milhões de parâmetros) e áudio (300 milhões de parâmetros) adicionados para suporte multimodal completo. Em um Google Pixel 11 Pro, o Google relata que a versão quantizada precisa de cerca de 191MB de RAM ativa para uso somente de texto e cerca de 567MB para a versão multimodal completa.

O modelo usa Matryoshka Representation Learning para permitir que desenvolvedores truncar os vetores de saída de 768 dimensões para 512, 256 ou 128 dimensões, o que o Google diz reduzir o armazenamento local em banco de dados vetorial em até 6 vezes. O contexto também cresceu: uma janela de 8 mil tokens, quatro vezes maior que a do EmbeddingGemma original, permite processar até 5,5 minutos de áudio, 29 imagens ou 58 quadros de vídeo em uma única passagem.

Em benchmarks, o Google relata que o EmbeddingGemma 2 lidera os embedders multimodais abaixo de 1 bilhão de parâmetros no MTEB Code e no MAEB, igualando ou superando alguns modelos especialistas maiores em tarefas de texto, visão e áudio. A recuperação de código teve o maior salto, melhorando de 68,76 para 78,68 no MTEB Code — um ganho que o Google posiciona para indexação local de bases de código e casos de uso de recuperação para agentes de codificação.

Como compartilha tokenizer e encoder de áudio com o Gemma 4, o Google está posicionando a dupla para geração aumentada por recuperação (RAG) no dispositivo: o EmbeddingGemma 2 encontra texto, imagens ou trechos de áudio relevantes localmente, e o Gemma 4 raciocina sobre eles, tudo sem uma chamada de rede. O Google aponta seus apps do AI Edge Gallery — Instant Media Search e Video Moments Finder — e o app Foresight como demonstrações iniciais, além de uma MediaPipe Decision Task API para construir sistemas de classificação e roteamento sobre os mesmos embeddings.

Os pesos do modelo estão disponíveis no Hugging Face e no Kaggle, já com suporte para transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama, LMStudio e Qdrant para armazenamento vetorial; a Unsloth publicou orientações de fine-tuning.

Fonte: Google DeepMind

Próximo passo

Visibility Analyzer

É isto que o Visibility Analyzer mede num site real: quais respostas citam você, quais páginas o motor não consegue recuperar e o que corrigir primeiro. Rodar é grátis.

Rodar uma auditoria de visibilidade grátis

Rodar é grátis. Sem cartão.

Preço
Grátis
Duração
Uma rodada, minutos

Plano grátis: duas análises por dia, sem cartão.