Как запустить 1-битную Bonsai-27B локально: гайд по PrismML llama.cpp с OpenAI-сервером
В туториале описывается полный пайплайн развёртывания 1-битной модели Bonsai-27B (формат Q1_0_g128 GGUF) на GPU. Сначала проверяется среда выполнения, устанавливаются зависимости, компилируется форк llama.cpp от PrismML с поддержкой CUDA, а затем скачиваются веса с Hugging Face (~5,2 ГБ пикового потребления памяти при 4K контексте).
После сборки модель тестируется через llama-cli, запускается локальный сервер, совместимый с API OpenAI, и демонстрируется работа с Python-клиентом: стандартные завершения, потоковые ответы, многопоточные диалоги и генерация кода. Также рассматриваются опциональные конфигурации — бенчмаркинг пропускной способности, квантованное кэширование ключей-значений, длинный контекст, спекулятивное декодирование и мультимодальные расширения.
Bonsai-27B — это экстремально сжатая модель (1 бит на параметр), которая позволяет запускать 27-миллиардную архитектуру даже на скромных GPU вроде T4 из Google Colab. Гайд ориентирован на практиков, желающих организовать локальный инференс без облачных затрат.