Nunchaku 4-bit Diffusion Inference теперь в Diffusers: память меньше, скорость выше
Hugging Face объявил о поддержке Nunchaku 4-bit Diffusion Inference в библиотеке Diffusers. Nunchaku — это метод квантизации до 4 бит для диффузионных моделей, который позволяет значительно сократить объём используемой памяти и ускорить инференс, сохраняя при этом высокое качество генерации.
Интеграция работает «из коробки»: достаточно загрузить модель с флагом `torch_dtype=torch.float16` и указать `variant='nunchaku-w4a16'`. Поддерживаются популярные архитектуры вроде Stable Diffusion и Flux. По тестам, потребление памяти снижается почти вдвое, а скорость генерации возрастает на 30–50% в зависимости от модели и железа.
Это особенно полезно для запуска диффузионных моделей на потребительских GPU с ограниченной видеопамятью. Nunchaku уже доступен в последней версии Diffusers — можно ставить и пробовать.