Тесты и бенчмарки
Китайские LLM-флагманы сразились в 12 тестах: Kimi K3, GLM-5.2, DeepSeek V4 Pro и Qwen 3.8 Max
В новом выпуске цикла сравнительных тестов LLM на ринг вышли четыре китайских флагмана: Kimi K3, GLM-5.2, DeepSeek V4 Pro и Qwen 3.8 Max. Автор пообещал прогнать их по 12 бенчмаркам — тем же, что использовались в предыдущих статьях. Ранее в серии уже сравнивали Opus 4.8, GPT 5.5 и Gemini 3.1 Pro, а затем устроили дуэль Claude Fable 5 и GPT 5.5 Pro.
Третья часть цикла была посвящена среднему классу: три поколения Sonnet, GigaChat 2 MAX и YandexGPT Pro 5.1. После неё читатели в комментариях попросили включить DeepSeek и Qwen — автор услышал запрос и подготовил выпуск про китайские модели. Детали результатов пока не раскрыты, но статья уже доступна для чтения.
Источник: habr.com