Тесты и бенчмарки
Локальная Gemma вместо Codex для экономии токенов? Расход вырос вдвое
Разработчик на MacBook Pro с Intel Core i7 и 16 ГБ RAM решил разгрузить облачный Codex, поручив простые задачи вроде разбора traceback или написания commit message локальной модели Gemma. Он написал MCP-сервер, интегрировал его с Codex и прогнал одинаковые задания, замеряя точный расход токенов.
Результат оказался неожиданным: на простой задаче маршрут через локальную модель использовал примерно вдвое больше облачного input, чем прямой ответ Codex. Первоначальная гипотеза об экономии не подтвердилась.
Тем не менее, автор отмечает, что для некоторых задач маленькая локальная модель всё же пригодилась — в статье разбираются условия, при которых такой подход оправдан.
Источник: habr.com