Google DeepMind выпустила EmbeddingGemma 2 - открытую модель эмбеддингов, которая отображает текст, код, изображения, аудио и видео в единое общее векторное пространство, позволяя искать по ним вместе. Модель продолжает прошлогоднюю текстовую EmbeddingGemma, которую, по данным компании, скачали более 20 миллионов раз.
Построенная на архитектуре Gemma 4 и выпущенная под лицензией Apache 2.0, EmbeddingGemma 2 насчитывает 740 миллионов параметров, но модульна: для задач только с текстом достаточно 270 миллионов параметров, а для полной мультимодальной поддержки добавляются опциональные визуальный энкодер на 170 миллионов параметров и аудиоэнкодер на 300 миллионов параметров. На Google Pixel 11 Pro, по данным Google, квантованная модель требует около 191 МБ активной оперативной памяти при работе только с текстом и около 567 МБ для полной мультимодальной версии.
Модель использует Matryoshka Representation Learning, позволяя разработчикам усекать выходные векторы размерностью 768 до 512, 256 или 128 измерений, что, по словам Google, сокращает объём локальной векторной базы данных до 6 раз. Вырос и контекст: окно в 8 тысяч токенов, вчетверо больше, чем у исходной EmbeddingGemma, позволяет обрабатывать за один проход до 5,5 минут аудио, 29 изображений или 58 кадров видео.
В бенчмарках, по данным Google, EmbeddingGemma 2 лидирует среди мультимодальных эмбеддеров с числом параметров меньше 1 миллиарда на MTEB Code и MAEB, а на задачах с текстом, изображениями и аудио соответствует или превосходит некоторые более крупные специализированные модели. Наибольший скачок показал поиск по коду: результат на MTEB Code вырос с 68,76 до 78,68 - Google связывает это улучшение с задачами локальной индексации кодовых баз и retrieval для агентов, работающих с кодом.
Поскольку модель использует общий токенизатор и аудиоэнкодер с Gemma 4, Google позиционирует эту пару для retrieval-augmented generation на устройстве: EmbeddingGemma 2 локально находит релевантный текст, изображения или аудиофрагменты, а Gemma 4 рассуждает над ними - всё без обращения к сети. В качестве ранних демонстраций Google называет приложения AI Edge Gallery - Instant Media Search и Video Moments Finder, - а также приложение Foresight и MediaPipe Decision Task API для построения систем классификации и маршрутизации на основе тех же эмбеддингов.
Веса модели доступны на Hugging Face и Kaggle, уже реализована поддержка для transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama, LMStudio и Qdrant для векторного хранения; Unsloth опубликовал руководство по дообучению.