Волна ИИПодписаться
← Назад
Исследования

Один харнесс, три модели: почему на длинных цепочках тезис «харнесс важнее модели» перестаёт работать

31.08.2026 · habr.com ↗

Чичев Максим из Петрович-Тех поделился результатами эксперимента: он протестировал три LLM разных весовых категорий на одном и том же харнессе, решая агентные задачи с длиной цепочки в 2, 3 и 15 шагов. Цель — проверить, насколько справедлив популярный тезис «харнесс важнее модели».

На коротких цепочках (2–3 шага) разница между моделями оказалась незначительной — харнесс действительно нивелировал слабости. Но на 15-шаговых задачах картина меняется: тезис перестаёт работать, и выбор модели начинает критически влиять на результат. Автор объясняет, почему так происходит и что это значит для практиков, строящих агентные системы.

Источник: habr.com
← Все новости AI Wave