Перейти к содержимому

DeepMind выпустила бесплатную локальную модель для поиска по тексту, фото, аудио и видео

Короткий ответ

Google DeepMind выпустила EmbeddingGemma 2 - мультимодальную модель эмбеддингов на 740 млн параметров под лицензией Apache 2.0, работающую полностью на устройстве и объединяющую текст, код, изображения, аудио и видео в едином векторном пространстве для поиска. Это важно, потому что команды теперь могут строить приватные конвейеры семантического поиска и retrieval без передачи чувствительных данных в облачный API и без оплаты за каждый запрос.

Что это значит для операций

Для B2B-компании на 10-200 человек это строительный блок, а не готовый продукт: инженер может проиндексировать транскрипты поддержки, скриншоты продукта, обучающие видео и записи звонков в единую систему поиска, которая работает на ноутбуке или скромном сервере - без передачи данных за периметр компании и без оплаты за каждый запрос к API. Это напрямую полезно командам поддержки, которые хотят по одному запросу находить нужную статью базы знаний, похожий тикет или фрагмент записанной демонстрации, а также операционным командам, строящим внутренний поиск по разрозненной мультимодальной документации. Загвоздка в том, что EmbeddingGemma 2 - это только retrieval-половина RAG-системы: кто-то всё равно должен собрать конвейер, соединить его с генеративной моделью и поддерживать векторную базу данных, поэтому ближайший выигрыш - это снижение инфраструктурных расходов и повышение приватности данных, а не готовый продукт.

Google DeepMind выпустила EmbeddingGemma 2 - открытую модель эмбеддингов, которая отображает текст, код, изображения, аудио и видео в единое общее векторное пространство, позволяя искать по ним вместе. Модель продолжает прошлогоднюю текстовую EmbeddingGemma, которую, по данным компании, скачали более 20 миллионов раз.

Построенная на архитектуре Gemma 4 и выпущенная под лицензией Apache 2.0, EmbeddingGemma 2 насчитывает 740 миллионов параметров, но модульна: для задач только с текстом достаточно 270 миллионов параметров, а для полной мультимодальной поддержки добавляются опциональные визуальный энкодер на 170 миллионов параметров и аудиоэнкодер на 300 миллионов параметров. На Google Pixel 11 Pro, по данным Google, квантованная модель требует около 191 МБ активной оперативной памяти при работе только с текстом и около 567 МБ для полной мультимодальной версии.

Модель использует Matryoshka Representation Learning, позволяя разработчикам усекать выходные векторы размерностью 768 до 512, 256 или 128 измерений, что, по словам Google, сокращает объём локальной векторной базы данных до 6 раз. Вырос и контекст: окно в 8 тысяч токенов, вчетверо больше, чем у исходной EmbeddingGemma, позволяет обрабатывать за один проход до 5,5 минут аудио, 29 изображений или 58 кадров видео.

В бенчмарках, по данным Google, EmbeddingGemma 2 лидирует среди мультимодальных эмбеддеров с числом параметров меньше 1 миллиарда на MTEB Code и MAEB, а на задачах с текстом, изображениями и аудио соответствует или превосходит некоторые более крупные специализированные модели. Наибольший скачок показал поиск по коду: результат на MTEB Code вырос с 68,76 до 78,68 - Google связывает это улучшение с задачами локальной индексации кодовых баз и retrieval для агентов, работающих с кодом.

Поскольку модель использует общий токенизатор и аудиоэнкодер с Gemma 4, Google позиционирует эту пару для retrieval-augmented generation на устройстве: EmbeddingGemma 2 локально находит релевантный текст, изображения или аудиофрагменты, а Gemma 4 рассуждает над ними - всё без обращения к сети. В качестве ранних демонстраций Google называет приложения AI Edge Gallery - Instant Media Search и Video Moments Finder, - а также приложение Foresight и MediaPipe Decision Task API для построения систем классификации и маршрутизации на основе тех же эмбеддингов.

Веса модели доступны на Hugging Face и Kaggle, уже реализована поддержка для transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama, LMStudio и Qdrant для векторного хранения; Unsloth опубликовал руководство по дообучению.

Источник: Google DeepMind

Следующий шаг

Visibility Analyzer

Ровно это Visibility Analyzer и меряет на живом сайте: в каких ответах вас цитируют, до каких страниц движок не дотягивается и что чинить первым. Запуск бесплатный.

Запустить бесплатный аудит видимости

Запуск бесплатный, карта не нужна.

Стоимость
Бесплатно
Срок
Один прогон, минуты

Бесплатный тариф: два анализа в день, без карты.