Skip to content

Sentence Transformers научился «поздним» эмбеддингам в стиле ColBERT

Короткий ответ

Hugging Face добавила в библиотеку Sentence Transformers встроенную поддержку multi-vector моделей эмбеддингов (late-interaction, в стиле ColBERT). Вместо сжатия документа в один вектор каждый токен получает собственный вектор, а релевантность считается сравнением всех векторов токенов запроса и документа. Это обычно повышает точность поиска, но требует больше памяти и вычислений.

Что это значит для операций

Если вы уже построили или тестируете RAG-бота поддержки, внутренний поиск по базе знаний или инструмент поиска по продажным материалам, модель эмбеддингов часто оказывается главным рычагом качества ответов — и теперь самая массовая библиотека эмбеддингов даёт официальный, документированный путь к late-interaction моделям, которые в опубликованных бенчмарках стабильно превосходят single-vector эмбеддинги на данных вне обучающего домена и на длинных документах. Компромисс реален: multi-vector индексы требуют больше памяти и вычислений на каждый запрос, поэтому команда поддержки с базой из 200 документов может получить заметный прирост точности почти бесплатно, а компания, индексирующая миллионы записей или логов, должна заранее заложить бюджет на увеличенное векторное хранилище и более медленные запросы перед переходом. Тем, кто пользуется вендорским RAG-инструментом, незаметно построенным на Sentence Transformers, стоит спросить у поставщика, планирует ли он внедрить эту возможность — от этого напрямую зависит, как часто бот находит нужный документ перед ответом клиенту.

Hugging Face добавила нативную поддержку multi-vector, или «late-interaction», моделей эмбеддингов в Sentence Transformers — самую распространённую open-source библиотеку для превращения текста в эмбеддинги для поиска и извлечения информации.

Большинство продуктивных моделей эмбеддингов сегодня — single-vector: документ или запрос сжимается в один вектор фиксированной длины, а релевантность оценивается простым скалярным произведением или косинусным сходством. Late-interaction модели, популяризированные ColBERT, вместо этого хранят отдельный вектор для каждого токена документа. Во время запроса каждый вектор токена запроса сравнивается с каждым вектором токена документа, а лучшие совпадения суммируются (метод MaxSim), формируя итоговую оценку релевантности.

Практический эффект, согласно бенчмаркам, упомянутым в релизе, состоит в том, что late-interaction модели лучше обобщаются на текст, отличающийся от обучающих данных, и увереннее работают с длинными документами, поскольку ни один вектор не должен вместить в себя весь смысл целого фрагмента. Цена — память и вычисления: вместо одного вектора на документ хранится один вектор на токен, а оценка релевантности при запросе сравнивает гораздо больше пар векторов.

Sentence Transformers теперь поставляется с утилитами для кодирования, индексирования и оценки, необходимыми для обучения, дообучения и запуска таких моделей напрямую, без отдельного ColBERT-специфичного инструментария.

Для команд, строящих системы retrieval-augmented generation (RAG) — чат-бота поддержки, отвечающего на основе базы знаний, ассистента продаж, ищущего по истории предложений, или внутреннего инструмента поиска по контрактам — модель эмбеддингов часто оказывается узким местом качества ответов, а не языковая модель, генерирующая финальный текст. Late-interaction модель, чаще находящая нужный фрагмент, чем single-vector модель, напрямую означает меньше неверных или галлюцинированных ответов на выходе — без изменений в остальной части пайплайна.

Компромисс масштабируется вместе с объёмом данных. Компания на 200 человек с базой знаний в несколько тысяч документов, скорее всего, способна принять дополнительные затраты на хранение и задержку ради реального прироста точности. Компания, индексирующая миллионы обращений в поддержку или логов, должна заложить бюджет на более крупную векторную базу данных и более медленную оценку на каждый запрос, и обязана протестировать переход перед внедрением в продакшене.

Изменений цен или обратной несовместимости нет — это добавление возможности в библиотеку, и существующие single-vector пайплайны продолжают работать без изменений. Командам, которые сейчас полагаются на вендора RAG-решения, а не на собственный пайплайн, стоит спросить, планирует ли этот вендор внедрить late-interaction поиск, поскольку это меняет точность извлечения информации, никак не затрагивая то, что видит конечный пользователь.

Источник: Hugging Face

Следующий шаг

Visibility Analyzer

Ровно это Visibility Analyzer и меряет на живом сайте: в каких ответах вас цитируют, какие страницы движок не может достать и что чинить первым. Запуск бесплатный.

Запустить бесплатный аудит видимости

Запуск бесплатный, карта не нужна.

Стоимость
Бесплатно
Срок
Один прогон, минуты

Бесплатный тариф: два анализа в день, без карты.