Волна ИИПодписаться
← Назад
Исследования

RAG на практике: почему BM25 и реранкер только всё испортили

27.07.2026 · habr.com ↗

В статье на Habr инженер поделился опытом внедрения RAG на реальных данных. Ожидаемо он начал с «индустриальных дефолтов»: векторная база, эмбеддер, реранкер, гибридный поиск с BM25. Но почти каждое такое улучшение на его данных привело к падению метрик. BM25 уронил результат, реранкер — дважды в разных конфигурациях.

Единственное, что реально помогло, — вовсе не код, а тщательная работа с данными: чистка корпуса и построение качественного eval-харнесса. Автор подчёркивает, что RAG работает, но «правильные» рецепты из общих статей не универсальны. Без честных замеров на своих данных невозможно понять, что именно приносит пользу, а что вредит.

Главный вывод: настоящая работа в RAG — это не двадцать строк кода, а дни возни с метриками и корпусом. «Так принято» — не аргумент, если у вас другие данные.

Источник: habr.com
← Все новости AI Wave