Харнесс решает: одна и та же модель может стоить в пять раз дороже
Команда из UC Berkeley и Arena прогнала семь моделей внутри трёх популярных харнессов для кодинг-агентов: Claude Code, Codex CLI и минималистичного Pi. На двух бенчмарках средняя успешность почти не зависела от обвязки — разница в пару процентов. Зато цена выполнения задач для одной и той же модели менялась кратно: до пяти раз.
Причина — в том, как харнесс управляет контекстом, количеством попыток и повторами запросов. Один и тот же LLM в разных обёртках генерирует разный объём токенов, отсюда и разброс по стоимости. Авторы подчёркивают: сравнивать coding-агентов только по названию модели больше нельзя — нужно учитывать и харнесс, иначе выводы будут искажены.
Практический вывод: при выборе агента важно смотреть не только на модель под капотом, но и на эффективность самой обвязки. Инструмент, который «умнее» расходует контекст, может дать ту же точность за пятую часть цены.