Волна ИИПодписаться
← Назад
Фичи и апдейты

Агент дешевле RAG: почему больше вызовов LLM не означает больший счёт

30.07.2026 · habr.com ↗

Показывали агенту — пользователь спрашивает про интеграцию с ITSM, агент делает четыре шага: семантический поиск, OpenChunk, текстовый поиск, синтез. Техдиректор заказчика возразил: «Один RAG-запрос — один вызов LLM, а тут двадцать. Значит, в 20 раз дороже?» Формально — да, но на практике всё наоборот.

RAG-запрос генерирует гигантский контекст: векторный поиск подтягивает десятки фрагментов, плюс инструкция и вопрос. Вы платите за все входные токены — это может быть 10–20 тысяч. Агент же разбивает задачу на короткие шаги: каждый промпт — пара сотен токенов, и для промежуточных шагов можно использовать дешёвые модели.

Итоговый счёт складывается из суммы токенов, а не из количества вызовов. В типичном сценарии один RAG-запрос на 15 000 токенов может стоить столько же, сколько 10–15 агентских шагов по 500 токенов. Плюс агент умеет переиспользовать результаты и не переплачивать за лишний контекст.

Вывод: не ведитесь на количество вызовов — считайте общее число токенов. Агент на практике часто оказывается дешевле и точнее, потому что не тратит ресурсы на переваривание километрового контекста.

Источник: habr.com
← Все новости AI Wave