ИИ-агент научил кодинг-ассистента тратить вдвое меньше токенов: 4 приёма из 152 идей сработали
Команда из NVIDIA, MIT и NTU провела необычный эксперимент: вместо ручной настройки harness для кодинг-агента они отдали эту задачу другому ИИ-агенту. Тот перебрал 152 идеи по оптимизации и нашёл четыре, которые реально работают — расход токенов сократился почти вдвое при той же самой модели.
Экономия ощутимая: счёт за API упал на треть, а средний балл на EdgeBench снизился лишь на 6% — небольшая цена за двукратное сокращение затрат. Исследователи разобрали, что именно сработало: речь идёт об оптимизации промптов, управления контекстом и стратегий вызова инструментов, хотя детали пока туманны.
Слабые места у подхода тоже есть: результат получен на одной конкретной модели Pi и одном бенчмарке, так что универсальность под вопросом. Тем не менее, идея использовать ИИ для улучшения собственной инфраструктуры выглядит перспективной — особенно если учесть, что harness часто таит в себе скрытые резервы экономии.
Пока это скорее исследовательский прототип, чем готовый инструмент, но он наглядно показывает: иногда не нужно менять модель, чтобы сильно сократить расходы — достаточно умнее настроить обвязку.