Волна ИИПодписаться
← Назад
Инструменты

Как запустить 176B-модель Qwen3.8-Flash-Next на GTX 1080 Ti с 11 ГБ VRAM

23.09.2026 · habr.com ↗

Qwen3.8-Flash-Next — мультимодальная MoE-модель от команды Qwen, позиционируемая как предпросмотр архитектуры будущей Qwen4. В модели суммарно около 176 млрд параметров: 125 млрд в основной части, 51 млрд в n-gram embedding-таблицах и дополнительный 4B MTP-компонент. На один токен активируется около 6 млрд параметров. Архитектура гибридная — Gated DeltaNet и Qwen Sparse Attention, 48 слоёв, 512 экспертов MoE (10 маршрутизируемых + shared expert на токен). Нативный контекст — 262 144 токена (256K).

На бумаге модель требует более 100 ГБ памяти, что делает её запуск на старом игровом GPU с 11 ГБ VRAM безумной идеей. Однако автор эксперимента показал, что это вполне реально: достаточно использовать llama.cpp и грамотно распределить вычисления между видеокартой и оперативной памятью. В результате модель стабильно работает, хоть и с ожидаемым снижением скорости инференса.

Для сообщества это интересный кейс: он подтверждает, что даже очень большие MoE-модели можно запускать на потребительском «железе» за счёт offloading, а сама Qwen3.8-Flash-Next даёт ранний взгляд на то, что готовит Qwen4. Статья содержит конкретные параметры сборки и настройки llama.cpp для такого запуска.

Источник: habr.com
← Все новости AI Wave