Волна ИИПодписаться
← Назад
Тесты и бенчмарки

Свой бенчмарк для LLM: как лаборатория сравнила DeepSeek, ChatGPT и Claude на своих задачах

03.10.2026 · habr.com ↗

Выбирая LLM, обычно смотрят на рейтинги вроде LMArena, но они не отвечают на главный вопрос: справится ли модель с вашими рабочими сценариями и сколько это будет стоить. В лаборатории, где ИИ-ассистент отвечает на вопросы по электронному лабораторному журналу через MCP, обнаружили, что общие метрики бесполезны — нужен тест на реальных данных.

Собрали 24 вопроса по своей работе, прогнали их на моделях DeepSeek, ChatGPT и Claude в 19 комбинациях модели и уровня усилий при рассуждении (reasoning effort) — всего около 450 прогонов. Авторы делятся методикой: как формулировать вопросы, какие нюансы учитывать и как повторить такой бенчмарк под свою задачу.

Материал полезен всем, кто выбирает модель для продакшена и не доверяет абстрактным рейтингам. Это не готовый ответ, а рабочий инструмент: можно взять подход и адаптировать под свои данные, чтобы сравнить модели по скорости, качеству и цене.

Источник: habr.com
← Все новости AI Wave