Headroom сжал контекст ИИ-агентов: до 25% экономии на одних задачах и рост на 40% на других
Разработчик провёл серию из 80 запусков, чтобы проверить эффективность сжатия контекста с помощью Headroom — метода, который сжимает данные перед отправкой в LLM: агент читает файлы, логи и результаты команд, а затем передаёт эту историю модели, удаляя повторяющуюся информацию.
Тестирование проводилось на 10 задачах Terminal-Bench 2.1 и на 5 небольших проектах (по три повтора каждый). Результаты разошлись: для модели Sol на Terminal-Bench входной контекст снизился на 4,1%, но на малых проектах вырос на 40,7%. У Astra на тех же проектах экономия составила 25,3%.
Автор отмечает, что разобраться в противоречивых цифрах помогли логи запросов до и после сжатия. Вывод: эффективность Headroom сильно зависит от структуры задачи и модели агента — на одних сценариях метод даёт ощутимую экономию, на других только увеличивает накладные расходы.