Saltar al contenido

Google DeepMind lanza un modelo gratuito on-device para buscar texto, imágenes, audio y video a la vez

Respuesta corta

Google DeepMind lanzó EmbeddingGemma 2, un modelo de embeddings multimodal de 740 millones de parámetros bajo licencia Apache 2.0 que corre on-device, unificando texto, código, imágenes, audio y video en un solo espacio vectorial buscable. Importa porque los equipos ya pueden construir búsqueda semántica privada sin enrutar datos sensibles por una API en la nube ni pagar por llamada.

Qué significa para las operaciones

Para una empresa B2B de 10 a 200 personas, esto es una pieza de construcción, no un producto terminado: un ingeniero podría indexar transcripciones de soporte, capturas de producto, videos de onboarding y grabaciones de llamadas en un solo sistema buscable que corre en una laptop o un servidor modesto, sin que los datos salgan de la empresa ni se pague por consulta a una API. Esto es directamente útil para equipos de soporte que quieren encontrar el artículo correcto de la base de conocimiento, un ticket pasado o un clip de demo grabado a partir de una sola consulta, y para equipos de operaciones que construyen búsqueda interna sobre documentación multimodal dispersa. La salvedad es que EmbeddingGemma 2 es solo la mitad de recuperación de un sistema RAG — alguien todavía tiene que construir el pipeline, emparejarlo con un modelo generativo y mantener la base de datos vectorial, así que la ganancia a corto plazo es menor costo de infraestructura y mejor privacidad de datos, no un producto listo para usar.

Google DeepMind lanzó EmbeddingGemma 2, un modelo de embeddings abierto que mapea texto, código, imágenes, audio y video en un único espacio vectorial compartido para que puedan buscarse juntos. Sigue al EmbeddingGemma de solo texto lanzado el año pasado, que según la compañía superó las 20 millones de descargas.

Construido sobre la arquitectura Gemma 4 y publicado bajo licencia Apache 2.0, EmbeddingGemma 2 tiene 740 millones de parámetros pero es modular: las cargas de trabajo de solo texto necesitan apenas 270 millones de parámetros, con codificadores opcionales de visión (170 millones de parámetros) y audio (300 millones de parámetros) añadidos para soporte multimodal completo. En un Google Pixel 11 Pro, Google reporta que la versión cuantizada necesita aproximadamente 191MB de RAM activa para uso solo de texto y unos 567MB para la versión multimodal completa.

El modelo usa Matryoshka Representation Learning para permitir que los desarrolladores trunquen sus vectores de salida de 768 dimensiones a 512, 256 o 128 dimensiones, lo que según Google reduce el almacenamiento local en bases de datos vectoriales hasta 6 veces. El contexto también creció: una ventana de 8K tokens, cuatro veces mayor que la del EmbeddingGemma original, le permite procesar hasta 5.5 minutos de audio, 29 imágenes o 58 fotogramas de video en una sola pasada.

En benchmarks, Google reporta que EmbeddingGemma 2 lidera entre los embedders multimodales de menos de 1.000 millones de parámetros en MTEB Code y MAEB, igualando o superando a algunos modelos especializados más grandes en tareas de texto, visión y audio. La recuperación de código tuvo el mayor salto, mejorando de 68.76 a 78.68 en MTEB Code — una ganancia que Google posiciona para indexación local de bases de código y casos de uso de recuperación para agentes de programación.

Como comparte tokenizador y codificador de audio con Gemma 4, Google posiciona al par para generación aumentada por recuperación (RAG) on-device: EmbeddingGemma 2 encuentra texto, imágenes o clips de audio relevantes localmente, y Gemma 4 razona sobre ellos, todo sin una llamada de red. Google señala sus apps AI Edge Gallery —Instant Media Search y Video Moments Finder— y la app Foresight como demostraciones tempranas, junto con una API de MediaPipe Decision Task para construir sistemas de clasificación y enrutamiento sobre los mismos embeddings.

Los pesos del modelo están disponibles en Hugging Face y Kaggle, con soporte ya construido para transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama, LMStudio y Qdrant para almacenamiento vectorial; Unsloth ha publicado guías de fine-tuning.

Fuente: Google DeepMind

Siguiente paso

Visibility Analyzer

Esto es lo que el Visibility Analyzer mide en un sitio real: qué respuestas te citan, qué páginas el motor no puede recuperar y qué arreglar primero. Ejecutarlo es gratis.

Lanzar una auditoría de visibilidad gratuita

Lanzarlo es gratis. Sin tarjeta.

Precio
Gratis
Duración
Una ejecución, minutos

Plan gratuito: dos análisis al día, sin tarjeta.