Как я запустил Qwen3.6 на NPU в мини-ПК: 200 ток/с prefill и квест с драйверами
Энтузиаст приобрёл мини-ПК с процессором Ryzen AI 9 365, рассчитывая использовать встроенный NPU для инференса большой языковой модели. Первая попытка на Windows с гибридом NPU+iGPU провалилась: квест с драйвером NPU показал, что NPU видит только половину оперативной памяти, а система падает с double free, если клиент не дождался ответа.
После переезда на Proxmox удалось запустить Qwen3.6-35B-A3B прямо на хосте через FastFlowLM. Модель работает круглосуточно: prefill выдаёт около 200 токенов в секунду, decode — 13–17 ток/с. Выяснились ограничения: NPU обслуживает только один запрос за раз и может выгрузить большую модель ради маленькой embedding-модели.
Автор делится полным гайдом по настройке, включая решение проблем с памятью и драйверами. Результат — рабочая локальная LLM на компактном устройстве, но с рядом компромиссов, которые стоит учитывать при выборе подобного железа для AI-задач.