Инструменты
Qwen3.5 и 3.6 на 16 ГБ VRAM: квантование, тонкая настройка и сравнение с Gemma-4
Автор, увлекающийся созданием настольных игр на d10-кубах с автоматическими сражениями ИИ против ИИ, столкнулся с необходимостью локальной языковой модели. После перехода с веб-чата китайской нейросети на OpenCode и LM Studio, начался поиск рабочей бесплатной модели без ограничений по серверу.
Практический опыт показал, что для видеокарт с 16 ГБ VRAM хорошо подходят квантованные версии Qwen3.5 и Qwen3.6. Также автор тестировал fine-tune версии с HuggingFace, обещающие ускорение и режим thinking от DeepSeek, Claude или Fable, и сравнил их с Gemma-4. Настройка и выбор модели заняли много времени из-за обилия вариантов квантования и дообученных сборок.
Источник: habr.com