Sentence Transformers научились обучать мультивекторные эмбеддинги: новый кирпичик для поиска
Мультивекторные эмбеддинги (например, архитектура ColBERT) хранят не один, а несколько векторов на документ, что позволяет лучше улавливать нюансы семантики и достигать более высокой точности в задачах поиска и RAG. До сих пор обучение таких моделей в популярной библиотеке Sentence Transformers было доступно только через обходные пути.
Теперь разработчики могут напрямую обучать и дообучать мультивекторные модели стандартными методами библиотеки — с loss-функциями, ускорителями и датасетами, которые привычны сообществу. Это упрощает создание кастомных эмбеддингов под конкретные домены без написания собственного тренировочного цикла.
Обновление появилось в последнем релизе Sentence Transformers и уже доступно для установки. Для тех, кто строит поиск по документам или базам знаний, это прямая возможность поднять качество без смены инфраструктуры.