Тесты и бенчмарки
12 тестов для китайских LLM-середнячков: MiniMax M3, LongCat 2.0, MiMo-v2.5-Pro и DeepSeek V4 Pro
В предыдущих частях цикла автор гонял флагманские модели — Opus 4.8, GPT 5.5, Gemini 3.1 Pro, а затем устроил дуэль Claude Fable 5 и GPT 5.5 Pro. По просьбам читателей, которые заметили, что работать приходится на моделях попроще, он решил протестировать «рабочих лошадок» — китайские LLM среднего класса.
На ринг вышли MiniMax M3, LongCat 2.0, MiMo-v2.5-Pro и DeepSeek V4 Pro. Всех их прогнали через 12 тестов, результаты — в статье.
Источник: habr.com