Волна ИИПодписаться
← Назад
Инструменты

Квантизация LLM: как запустить 70B модель на домашней видеокарте — разбор методов PTQ, QAT, GPTQ, GGUF и AWQ

18.08.2026 · habr.com ↗

Для запуска LLaMA 3 70B или DeepSeek-V3 с 671 млрд параметров не обязательно покупать серверную стойку — квантизация позволяет уместить такие модели в обычную видеокарту. В статье подробно разбирается, как работает этот механизм: снижение точности весов с FP16 до INT4 или INT8 кратно уменьшает потребление vRAM при минимальной потере качества.

Рассмотрены два основных подхода: Post-Training Quantization (PTQ) — быстрая калибровка после обучения, и Quantization-Aware Training (QAT) — встраивание квантизации прямо в процесс тренировки для лучшего сохранения точности. Особое внимание уделено MoE-моделям (DeepSeek-V3, Mixtral, LLaMA 4 Scout), где из-за разреженной архитектуры квантизация требует более тонких методов.

Практическая часть охватывает выбор формата: GPTQ — для GPU с CUDA, GGUF — для CPU и гибридного инференса, AWQ — для максимального качества на малом битрейте. Материал будет полезен как новичкам, так и ML-инженерам, которые хотят запускать большие LLM на ограниченном железе — с примерами кода и реальными бенчмарками.

Источник: habr.com
← Все новости AI Wave