Сократил стоимость сессии ИИ-агента с 48 до 8 рублей — как я убрал лишний контекст
На 30-м шаге агент отправлял модели 124 тысячи входных токенов — почти как небольшой роман. Большая часть контекста уже передавалась раньше: логи, прочитанные файлы, ответы инструментов и описания тех, которые на этом шаге не использовались. Автор начал резать повторный контекст сначала на сервере, потом на клиенте.
За два дня появились локальный архив сессий, оглавление, загрузка схем инструментов по требованию и песочница для расчётов. На синтетическом 30-шаговом сценарии стоимость упала с 48,26 до 8,40 рубля, вход — с 2,4 млн до 419 тысяч токенов. Полный вариант решил все 30 задач.
Однако при переносе на живого агента выяснилось: на коротких задачах такая оптимизация может сделать всё дороже. Красивая цифра работает не везде — границы метода нужно проверять на реальных сценариях.