Hugging Face добавила нативную поддержку multi-vector, или «late-interaction», моделей эмбеддингов в Sentence Transformers — самую распространённую open-source библиотеку для превращения текста в эмбеддинги для поиска и извлечения информации.
Большинство продуктивных моделей эмбеддингов сегодня — single-vector: документ или запрос сжимается в один вектор фиксированной длины, а релевантность оценивается простым скалярным произведением или косинусным сходством. Late-interaction модели, популяризированные ColBERT, вместо этого хранят отдельный вектор для каждого токена документа. Во время запроса каждый вектор токена запроса сравнивается с каждым вектором токена документа, а лучшие совпадения суммируются (метод MaxSim), формируя итоговую оценку релевантности.
Практический эффект, согласно бенчмаркам, упомянутым в релизе, состоит в том, что late-interaction модели лучше обобщаются на текст, отличающийся от обучающих данных, и увереннее работают с длинными документами, поскольку ни один вектор не должен вместить в себя весь смысл целого фрагмента. Цена — память и вычисления: вместо одного вектора на документ хранится один вектор на токен, а оценка релевантности при запросе сравнивает гораздо больше пар векторов.
Sentence Transformers теперь поставляется с утилитами для кодирования, индексирования и оценки, необходимыми для обучения, дообучения и запуска таких моделей напрямую, без отдельного ColBERT-специфичного инструментария.
Для команд, строящих системы retrieval-augmented generation (RAG) — чат-бота поддержки, отвечающего на основе базы знаний, ассистента продаж, ищущего по истории предложений, или внутреннего инструмента поиска по контрактам — модель эмбеддингов часто оказывается узким местом качества ответов, а не языковая модель, генерирующая финальный текст. Late-interaction модель, чаще находящая нужный фрагмент, чем single-vector модель, напрямую означает меньше неверных или галлюцинированных ответов на выходе — без изменений в остальной части пайплайна.
Компромисс масштабируется вместе с объёмом данных. Компания на 200 человек с базой знаний в несколько тысяч документов, скорее всего, способна принять дополнительные затраты на хранение и задержку ради реального прироста точности. Компания, индексирующая миллионы обращений в поддержку или логов, должна заложить бюджет на более крупную векторную базу данных и более медленную оценку на каждый запрос, и обязана протестировать переход перед внедрением в продакшене.
Изменений цен или обратной несовместимости нет — это добавление возможности в библиотеку, и существующие single-vector пайплайны продолжают работать без изменений. Командам, которые сейчас полагаются на вендора RAG-решения, а не на собственный пайплайн, стоит спросить, планирует ли этот вендор внедрить late-interaction поиск, поскольку это меняет точность извлечения информации, никак не затрагивая то, что видит конечный пользователь.