Тесты и бенчмарки
Сравнение семи нейросетей: 3360 битв без синтетики и стоковых картинок
Автор не смог найти внятного сравнения нейросетей для практических задач — все бенчмарки либо синтетические (олимпиадные задачи), либо рекламные топы. Поэтому он собрал свою тестовую среду из семи моделей: GPT, Claude и участников через OpenRouter. Каждая модель получала реальные запросы на создание сайтов, и результат оценивался не по абстрактным метрикам, а по пригодности для заказчика.
Всего состоялось 3360 битв: модели соревновались попарно, а финалистов определяло голосование самих нейросетей-участников. Результаты — не просто цифры, а практические выводы о том, какая модель лучше справляется с первым промптом без доработок. Подробности эксперимента и победитель — в полной версии статьи.
Источник: habr.com