Главное
Sentence Transformers научился «поздним» эмбеддингам в стиле ColBERT
Hugging Face добавила в библиотеку Sentence Transformers встроенную поддержку multi-vector моделей эмбеддингов (late-interaction, в стиле ColBERT). Вместо сжатия документа в один вектор каждый токен получает собственный вектор, а релевантность считается сравнением всех векторов токенов запроса и документа. Это обычно повышает точность поиска, но требует больше памяти и вычислений.
Что меняется для операций — Если вы уже построили или тестируете RAG-бота поддержки, внутренний поиск по базе знаний или инструмент поиска по продажным материалам, модель эмбеддингов часто оказывается главным рычагом качества ответов — и теперь самая массовая библиотека эмбеддингов даёт официальный, документированный путь к late-interaction моделям, которые в опубликованных бенчмарках стабильно превосходят single-vector эмбеддинги на данных вне обучающего домена и на длинных документах. Компромисс реален: multi-vector индексы требуют больше памяти и вычислений на каждый запрос, поэтому команда поддержки с базой из 200 документов может получить заметный прирост точности почти бесплатно, а компания, индексирующая миллионы записей или логов, должна заранее заложить бюджет на увеличенное векторное хранилище и более медленные запросы перед переходом. Тем, кто пользуется вендорским RAG-инструментом, незаметно построенным на Sentence Transformers, стоит спросить у поставщика, планирует ли он внедрить эту возможность — от этого напрямую зависит, как часто бот находит нужный документ перед ответом клиенту.