Лучшие локальные LLM для 24 ГБ видеокарты в 2026: Qwen, Gemma, Mistral, DeepSeek — сравнение и гайд
Одна видеокарта с 24 ГБ — практический минимум для серьёзного локального инференса. Старая рекомендация «втиснуть 70B-квант» устарела: в 2026 году разумнее выбирать модели класса 20–35B, которые помещаются с запасом, оставляют место для контекста и выдают приемлемую скорость для кодинга, чата и агентов. В статье сравниваются Qwen, Gemma, Mistral и DeepSeek — какие из них реально умещаются и почему.
Расход VRAM складывается из трёх частей: веса модели (при Q4_K_M каждый параметр занимает ~0,58 байт, так что 32B модель требует 18–20 ГБ только на веса), KV-кэш (растёт с длиной контекста) и служебный оверхед (~1–2 ГБ при коротком контексте). Особенность Mixture-of-Experts (MoE) — все эксперты висят в памяти, независимо от того, сколько активных, поэтому размер надо считать по полному числу параметров.
Квантование — главный рычаг, чтобы уложиться в 24 ГБ. Q4_K_M даёт стандартный баланс качества и размера. Q5_K_M и Q6_K качественнее, но тяжелее; Q8_0 и BF16 для 30B-моделей на одной карте уже не влезают. В статье есть интерактивный инструмент, где можно менять квантование и видеть, как меняется fit для каждой модели.
Итог: для 24 ГБ в 2026 году стоит смотреть в сторону моделей 20–35B в кванте Q4_K_M/Q5_K_M. 70B-квант — потеря скорости и контекста, а 7B-модели уже не дают нужного качества. Сравнение Qwen, Gemma, Mistral и DeepSeek поможет выбрать конкретную модель под задачу.