Честный RAG-оценщик: как собрать свои 100–300 кейсов и не потерять доверие к метрикам
В предыдущей статье серии автор сжимал эмбеддинги и радовался, что выдача почти не изменилась относительно полного fp32-поиска. Но такой замер ловит лишь одно: ломает ли квантизация уже существующий retrieval. Он ничего не говорит о том, насколько хорошо поиск вообще находит нужные документы на вашем домене.
Внешние бенчмарки, даже сильные, этой проблемы не решают. BEIR как раз создан, чтобы показать, насколько retrieval-результаты различаются между задачами и доменами, так что один усреднённый скор там бесполезен как гарантия для ваших данных. Нужен собственный eval set — и тут возникает ложная развилка.
Статья объясняет, как собрать первые 100–300 кейсов, не обманув себя цифрой. Это практический гайд для всех, кто строит RAG-системы и хочет честно измерять качество.