Тесты и бенчмарки
Сравнение четырёх моделей на рутинных задачах: дорогая быстрее, дешёвая ошибается
На Хабре разгорелся спор: нужны ли программисту топовые модели или для повседневных задач хватит бюджетных. Вместо слов автор взял четыре модели одного семейства и дал им пять рутинных задач — скрытые тесты, два прогона на каждую. Всего 40 замеров.
Результат: четыре задачи из пяти решили все модели — 32 успешных прогона из 32. Самая дорогая оказалась самой быстрой (341 с против 395 с у дешёвой) за счёт меньшего числа ходов и вдвое меньшего объёма текста. А вот на пятой задаче младшая модель написала баг и выдала две противоречащие друг другу галочки.
Источник: habr.com