Волна ИИПодписаться
← Назад
Тесты и бенчмарки

Честный RAG-оценщик: как собрать свои 100–300 кейсов и не потерять доверие к метрикам

14.08.2026 · habr.com ↗

В предыдущей статье серии автор сжимал эмбеддинги и радовался, что выдача почти не изменилась относительно полного fp32-поиска. Но такой замер ловит лишь одно: ломает ли квантизация уже существующий retrieval. Он ничего не говорит о том, насколько хорошо поиск вообще находит нужные документы на вашем домене.

Внешние бенчмарки, даже сильные, этой проблемы не решают. BEIR как раз создан, чтобы показать, насколько retrieval-результаты различаются между задачами и доменами, так что один усреднённый скор там бесполезен как гарантия для ваших данных. Нужен собственный eval set — и тут возникает ложная развилка.

Статья объясняет, как собрать первые 100–300 кейсов, не обманув себя цифрой. Это практический гайд для всех, кто строит RAG-системы и хочет честно измерять качество.

Источник: habr.com
← Все новости AI Wave