Redis LangCache: семантический кэш для LLM экономит до 90% затрат на API и отвечает в 15 раз быстрее
Проблема: продакшен-LLM редко получают уникальные вопросы. Поддержка и RAG-пайплайны обрабатывают одни и те же интенты тысячами раз в день, но каждый новый запрос с перефразировкой идёт как полноценный вызов модели. Префиксный кэш лишь удешевляет генерацию, но не отменяет её — модель всё равно обрабатывает токены и декодирует ответ.
Redis LangCache решает это иначе: кэш хранится вне модели и содержит готовые ответы. Перед вызовом LLM приложение отправляет промпт в POST /v1/caches/{cacheId}/entries/search — сервис генерирует эмбеддинг и ищет семантически похожие записи. Если совпадение выше порога, возвращается кэшированный ответ, и вызов модели не происходит. При промахе ответ сохраняется для будущих совпадений.
Сервис работает с любым LLM-провайдером, настраивается через пороги схожести, TTL и политики вытеснения, включая адаптивные контролы для баланса точности и полноты. LangCache доступен в публичном превью на Redis Cloud через REST API с SDK для Python и JavaScript. Метрики попаданий и экономии отслеживаются в консоли Redis Cloud.