Волна ИИПодписаться
← Назад
Тесты и бенчмарки

Почему MoE-модели на RTX 5090 работают в полтора раза медленнее плотных: разбор с цифрами

12.08.2026 · habr.com ↗

Инженер провёл детальное исследование производительности MoE-модели Qwen3.5-35B-A3B на видеокарте RTX 5090 в llama.cpp. При одинаковых условиях (один драйвер, батч 1) плотная Qwen3.5-9B утилизирует 72% пропускной способности памяти, а MoE-версия — только 41%. Разрыв в 1.5 раза, и маршрутизация экспертов тут ни при чём: ядра top-k занимают лишь 7% времени, CUDA-графы захвачены, занятость SM — 97%.

Проблема оказалась в объёме данных, которые читает одно ядро за запуск. Автор написал программу на ggml, которая гоняет mul_mat_vec_q на холодных весах, и получил кривую: на 1 МБ ядро берёт 23% полосы, на 4.2 МБ — 53%, на 33.6 МБ — 91%. У MoE на одно ядро приходится 4.6 МБ, у плотной модели — 22.2 МБ. Вот и весь разрыв.

В статье также разобраны четыре способа неправильного измерения производительности, проверка на другой архитектуре с ошибкой 3.7% и влияние обвязки llama-server. Оказалось, что сэмплер и весь рантайм съедают больше всего: пользователь видит 225 токенов в секунду, хотя бенчмарк показывает 317.

Источник: habr.com
← Все новости AI Wave