Новый метод Quantization-Aware Healing: 4-битная модель обходит full-precision оригинал
Quantization-Aware Healing (QAH) — новый подход к сжатию нейросетей, представленный сообществом Hugging Face. В отличие от стандартного квантования, которое неизбежно теряет точность, QAH корректирует веса таким образом, что 4-битная версия модели показывает результаты выше, чем оригинал с полной точностью. Эффект достигается за счёт специальной процедуры «исцеления»: после квантования модель дообучается на небольшом объёме данных, компенсируя потери и даже улучшая обобщение.
По словам авторов, QAH работает для разных архитектур и датасетов. Пока метод протестирован на моделях среднего размера, но авторы уверены, что масштабирование не потребует принципиальных изменений. Если результаты подтвердятся на больших LLM, это серьёзно упростит развёртывание мощных моделей на устройствах с ограниченной памятью — от смартфонов до edge-серверов.