RAG больше не нужен? Когда длинный контекст заменяет сложный пайплайн
В 2023 году RAG был единственным способом засунуть знания в LLM — контекстное окно было крошечным, а галлюцинации — обычным делом. Технология стала стандартом для построения чатов по документации. Но сегодня многие модели держат 1M токенов и больше, и в это окно спокойно влезает вся документация средней компании.
Проблема в том, что RAG-пайплайн — это тяжёлая инфраструктура: чанкинг, эмбеддинги, векторная база, реранкер. Два-три месяца разработки плюс вечная поддержка. Для 400-страничной документации это часто оверхед. Автор статьи на Habr предлагает сначала прикинуть, влезает ли база знаний в контекст модели, и только потом решать, нужен ли RAG.
Конечно, Long Context не панацея: на больших объёмах качество поиска падает, и RAG всё ещё выигрывает. Но для многих реальных сценариев — особенно внутри одной компании — простой промпт с полной документацией работает не хуже, а стоит в разы дешевле. Статья сравнивает подходы и даёт практические рекомендации, когда что использовать.