Почему длинные чаты с LLM сжигают токены: разбор механизма и советы по экономии
В Reddit появляются сообщения о миллиардах входных токенов и счетах на $6000 за один разговор с ИИ-агентом. Механизм за этим прост: LLM постоянно пересчитывает весь контекст, даже если вы добавляете один короткий ответ. Чем длиннее чат, тем больше токенов на каждый новый запрос — и тем дороже.
Большое контекстное окно не всегда улучшает ответы: модель может «забывать» ранние фрагменты или распылять внимание. В статье разобраны причины — от архитектуры трансформеров до особенностей самовнимания. А также объяснено, как prompt caching помогает не пересчитывать предыдущие сообщения, экономя до 90% токенов.
Среди практических советов: чистить историю от лишнего, переключаться на короткие суммы, использовать явные системные промпты для удержания фокуса, а не бороться за каждое слово в запросе. Главное — понимать, что токены тратятся не на текст пользователя, а на всё, что модель «видит» в окне контекста.