PrismML ужала Qwen3.8 27B до 5,9 ГБ: тернарная модель сохранила 98,2% качества
PrismML выпустила Ternary Bonsai 2 27B — тернарную версию Qwen3.8 27B, которая весит всего 5,93 ГБ против 53,8 ГБ у оригинала в FP16. При этом модель сохраняет 98,2% среднего качества родителя по 20 бенчмаркам. Это заметный прогресс: первая версия Bonsai 27B, вышедшая два месяца назад, удерживала лишь около 95%.
Архитектура Qwen3.8 27B не менялась: 27,36 млрд параметров, из которых 24,35 млрд — языковой каркас, 2,54 млрд — эмбеддинги и LM-голова, 0,47 млрд — зрительный энкодер. Гибридное внимание: примерно 75% линейных слоёв и 25% полного внимания. Тернарными стали веса эмбеддингов, attention и MLP-проекций, а также LM-головы — только 26,2 млн параметров (0,0976%) остались в повышенной точности.
Каждый вес принимает одно из трёх значений: -1, 0 или +1. Группа из 128 весов делит один FP16-масштаб, что даёт 1,71 бита на вес. В GGUF-упаковке PTQ1_0 плотно пакует триты — 1,76 бита на вес и 5,93 ГБ; вариант PQ2_0 хранит каждый трит в 2-битной ячейке (7,25 ГБ), что проще распаковывать. Перед тернаризацией применяется блочное преобразование Адамара с размером блока 1024 — идея из SpinQuant.
Модель принимает текст и изображения, поддерживает контекст на 262K токенов. Веса распространяются под Apache 2.0 и уже работают на 16-гигабайтном ноутбуке или одной видеокарте на 24 ГБ — нужен форк llama.cpp от PrismML или их MLX-рантайм. Демонстрации показывают, как Bonsai 2 управляет агентами Cline и компьютером на RTX 5090. PrismML не раскрывает, как именно назначает тернарные значения.