Волна ИИПодписаться
← Назад
Инструменты

Qwen3.8-27B разогнали до 75 ток/сек на двух RTX 3090: детальный гайд по настройке llama.cpp

29.08.2026 · habr.com ↗

Плотная 27B-модель Qwen3.8 на двух RTX 3090 из коробки даёт лишь 32 токена в секунду — меньше, чем одна карта. Автор нашёл несколько узких мест и снял их флагами запуска llama.cpp: MTP (Multi-Token Prediction), тензорный параллелизм и другие оптимизации подняли скорость до 75 ток/сек на тех же весах.

Каждый флаг описан по единой схеме: зачем нужен, что писать в команде, какой прирост в токенах, где ломается и соответствующая строка в логе. В конце — готовый docker run с тремя проверками после каждой смены флага и список того, что не сработало. Текст построен как инструкция для агента с доступом к серверу: практический кейс для инженеров, которые хотят выжать максимум из железа.

Источник: habr.com
← Все новости AI Wave