Тесты и бенчмарки
GPT Astra против Qwen 3.8: блогер устроил собственный тест повседневных ИИ-моделей
В ленте автора стало подозрительно много мемов про пеликанов на велосипеде, и это подтолкнуло его к собственному расследованию: он запустил сравнительный тест повседневных ИИ-моделей, которые легко проверить в деле. В фокусе — качество генерации и практическая польза в бытовых сценариях.
В эксперименте участвуют GPT Astra, Qwen 3.8 и другие доступные модели. Автор не гонится за синтетическими бенчмарками, а смотрит на то, что реально важно обычному пользователю: насколько адекватно модель отвечает, пишет тексты и решает рутинные задачи. Подробности эксперимента — в материале.
Источник: habr.com