Как LLM-судья заменил косинусную близость и поднял точность рекрутинга с 44% до 66%
Платформа подбора IT-специалистов столкнулась с типичной проблемой векторного поиска: резюме сильного программиста и вакансия архитектора имеют высокую косинусную близость, но кандидат не подходит. Рекрутёр видит это за секунды, а поиск — нет. Чтобы исправить ситуацию, команда внедрила LLM-судью, который отвечает на вопрос: «Показал бы я этого кандидата клиенту?» Модель перечитывает найденные резюме и обязана подтверждать вердикт дословными цитатами.
Результат на замороженном эталонном наборе: доля подходящих кандидатов в топ-10 выросла с 43,7% до 66,3%. По ходу внедрения выявились четыре неожиданных провала. Тендер между четырьмя LLM выигрывала недорогая и быстрая модель, пока не проверили настоящие ли цитаты она приводит — экономия на глубине рассуждений провалилась на проверке цитат. Перебор 1330 вариантов взвешивания оценок показал, что веса не нужны. А стандартный RRF (слияние семантического и полнотекстового поиска) ухудшил и полноту, и точность с первой же проверки.
Статья подробно разбирает каждый из четырёх провалившихся приёмов и методологию замера. Это практический опыт использования LLM для ранжирования в рекрутинге, который может быть полезен командам, строящим похожие системы подбора.