Transformers теперь напрямую загружает квантизации llama.cpp
Библиотека Transformers от Hugging Face получила поддержку квантизаций llama.cpp. Теперь модели в формате GGUF можно загружать напрямую через Transformers — без ручной конвертации из других форматов или использования отдельных инструментов. Это большой шаг к унификации работы с квантизированными LLM.
Раньше, чтобы запустить ту же Llama или Mistral в сжатом виде, приходилось либо конвертировать чекпоинт в GGUF через отдельный скрипт, либо использовать специализированные рантаймы вроде llama.cpp через его API. Теперь всё завязано в стандартном Python-пайплайне Transformers: достаточно указать путь к GGUF-файлу, и библиотека сама разберётся с архитектурой и квантизацией.
Поддержка включает широкий спектр форматов GGUF (q4, q5, q8 и другие), что даёт гибкость в выборе между скоростью и качеством. Hugging Face продолжает двигаться в сторону единого интерфейса для любых LLM — независимо от того, где и как они были обучены или квантизированы.