Тесты и бенчмарки
Jev против обычных LLM: кто быстрее, дешевле и точнее на спаме, категориях и негативе?
Автор провёл бенчмарк Jev — модели, которая не генерирует текст, а выбирает из заранее заданных вариантов — против обычных LLM (без уточнения конкретных моделей). Тестировали на трёх классических задачах NLP: детекция спама, классификация комментариев по категориям и оценка тональности (негатив). Замеряли точность ответов, скорость инференса и стоимость на русском и английском языках.
Отдельно проверили, как модели справляются с определением повторного вопроса в длинной истории диалога — важный сценарий для чат-ботов и поддержки. Результаты показывают, насколько Jev выгоднее по цене и быстрее по времени, хотя по качеству может уступать на некоторых задачах. Полные цифры и графики — в оригинальной статье на Habr.
Источник: habr.com