Волна ИИПодписаться
← Назад
Инструменты

Почему MoE-модель тормозит на локальной машине: чек-лист из трёх шагов

26.08.2026 · habr.com ↗

Если вы запускаете большую MoE-модель (например, Qwen, DeepSeek, Mixtral) на локальной машине через llama.cpp или llama-server, но скорость генерации токенов в разы ниже ожидаемой, проблема может быть в настройках. Статья адресована Linux-пользователям с гибридными процессорами Intel 12-го поколения и новее и видеокартами NVIDIA (CUDA). В качестве примера используется конфигурация: RTX 4070 (12 ГБ), i5-12600K, 32 ГБ DDR5-6000.

Автор предлагает чек-лист из трёх шагов для диагностики и оптимизации. Первый шаг — проверить, задействованы ли все ядра CPU и GPU, особенно на гибридных процессорах, где часть ядер может простаивать. Второй — убедиться, что модель загружается в GPU, а не в CPU, и что хватает видеопамяти. Третий — настроить параметры llama.cpp, такие как batch size, количество потоков и использование Flash Attention. Статья основана на публикации "Local LLM Inference Optimization: The Complete Guide" и является частью цикла по траблшутингу локальных LLM.

Источник: habr.com
← Все новости AI Wave