Агент дешевле RAG: почему больше вызовов LLM не означает больший счёт
Показывали агенту — пользователь спрашивает про интеграцию с ITSM, агент делает четыре шага: семантический поиск, OpenChunk, текстовый поиск, синтез. Техдиректор заказчика возразил: «Один RAG-запрос — один вызов LLM, а тут двадцать. Значит, в 20 раз дороже?» Формально — да, но на практике всё наоборот.
RAG-запрос генерирует гигантский контекст: векторный поиск подтягивает десятки фрагментов, плюс инструкция и вопрос. Вы платите за все входные токены — это может быть 10–20 тысяч. Агент же разбивает задачу на короткие шаги: каждый промпт — пара сотен токенов, и для промежуточных шагов можно использовать дешёвые модели.
Итоговый счёт складывается из суммы токенов, а не из количества вызовов. В типичном сценарии один RAG-запрос на 15 000 токенов может стоить столько же, сколько 10–15 агентских шагов по 500 токенов. Плюс агент умеет переиспользовать результаты и не переплачивать за лишний контекст.
Вывод: не ведитесь на количество вызовов — считайте общее число токенов. Агент на практике часто оказывается дешевле и точнее, потому что не тратит ресурсы на переваривание километрового контекста.