Исследования
Налог на контекст: куда утекают токены при работе ИИ-агентов
Исследователь измерил реальный расход токенов в 40 сессиях разработки с ИИ-агентами Claude Code и Codex. Оказалось, что львиная доля затрат — до 80% — приходится не на «мысли» модели или диалог с пользователем, а на повторную отправку уже переданного контекста.
Этот «налог на контекст» возникает из-за архитектуры агентов: каждое новое действие требует повторной передачи всей истории сессии, включая код, который уже был отправлен ранее. В результате счёт за токены растёт экспоненциально, особенно при длительных сессиях.
Автор призывает разработчиков оптимизировать работу с контекстом: например, использовать кеширование или урезать историю, чтобы снизить издержки. Полные данные и графики доступны в оригинальной статье на Хабре.
Источник: habr.com