GGUF, GPTQ, AWQ, EXL2: полный разбор форматов LLM-моделей 2026
Многие путают два понятия: контейнер (как тензоры хранятся на диске) и метод квантования (как сжимаются веса). К контейнерам относятся safetensors, GGUF, PyTorch pickle (.bin/.pt). К методам — GPTQ, AWQ, bitsandbytes NF4, llama.cpp K-quants и I-quants. EXL2 и EXL3 — гибриды: и метод, и формат хранения, привязанные к одному инференс-движку.
Правило памяти: вес модели в ГБ ≈ параметры × бит на вес ÷ 8. Например, 16-битная модель 8B занимает ~16 ГБ, 70B — ~140 ГБ. При квантовании до ~4.5 бит: 8B ~4.5 ГБ, 70B ~39 ГБ. Это только веса, без KV-кэша и рантайма.
Safetensors — современный стандарт безрискового хранения (не использует pickle). GGUF — формат от создателя llama.cpp, поддерживает метаданные, токенизатор и чат-шаблон в одном файле. Имена вроде Q4_K_M указывают на схему квантования: Q4_K_M использует Q6_K для половины тензоров внимания, поэтому средний битрейд выше 4.5. Новые типы включают TQ1_0 (тернарные веса) и MXFP4 (4-битный микроскейлинг).
Совет: для near-lossless качества на практике остаётся Q8_0 (8.5 бит на вес). Для максимального сжатия с приемлемым качеством — Q4_K_M или IQ4_XS. GPTQ и AWQ лучше для GPU, GGUF — универсален для CPU/GPU.