Волна ИИПодписаться
← Назад
Тесты и бенчмарки

Сравнение четырёх моделей на рутинных задачах: дорогая быстрее, дешёвая ошибается

20.09.2026 · habr.com ↗

На Хабре разгорелся спор: нужны ли программисту топовые модели или для повседневных задач хватит бюджетных. Вместо слов автор взял четыре модели одного семейства и дал им пять рутинных задач — скрытые тесты, два прогона на каждую. Всего 40 замеров.

Результат: четыре задачи из пяти решили все модели — 32 успешных прогона из 32. Самая дорогая оказалась самой быстрой (341 с против 395 с у дешёвой) за счёт меньшего числа ходов и вдвое меньшего объёма текста. А вот на пятой задаче младшая модель написала баг и выдала две противоречащие друг другу галочки.

Источник: habr.com
← Все новости AI Wave