Сравнение 10 локальных MoE-моделей для кодинга: Qwen 3.6 против Gemma 4 и других — победитель неожиданный
Разработчик решил проверить, насколько локальные MoE-модели справляются с реальной задачей — написанием кода для браузерных игр на HTML, CSS и JavaScript. В тесте участвовало 10 моделей: Qwen 3.6 (MTP), KAT Coder V2.5, Gemma 4, Aurora-Code-1, Frontis, GLM 4.7 Flash, Ornith 1.0, Salience 1.5 Pro, Agents A1 и GPT-oss 20b. Все они запускались локально, результаты оценивались по готовому продакшн-коду.
Многие из моделей сделаны на базе Qwen и, судя по карточкам на HuggingFace, показывают улучшенные показатели на стандартных бенчмарках. Однако практический тест на игровой задаче выявил обратное: ни одна дообученная версия не смогла обойти оригинальную Qwen 3.6. Разработчик отмечает, что такой разрыв между бенчмарками и реальным кодингом — обычное дело, и таблица с результатами это подтверждает.
Автор не раскрывает полную методологию, но публикует ссылки на модели и итоговую таблицу. Для тех, кто ищет локальную MoE-модель под веб-разработку, вывод однозначен: базовая Qwen остаётся лучшим выбором среди опробованных — по крайней мере для игр на чистом фронтенде.