Тесты и бенчмарки
Jev, Laya и Gemini Flash: тест трёх моделей на реальных задачах классификации в поддержке
Разработчик протестировал три модели на реальных задачах классификации в техподдержке: Jev, Laya и Gemini Flash. Модели не генерируют текст, а только выбирают ответ из списка, ставят оценку по шкале или возвращают вероятность.
Две из трёх задач модели решают успешно. Третья, по словам автора, не поддаётся никакой модели — и это было очевидно ещё до замеров. Полные результаты и детали эксперимента — в статье на Habr.
Источник: habr.com