Фичи и апдейты
Qwen3.8-27B научили обходиться без роста KV-кэша: экспериментальный CMF-режим
Модель Qwen3.8-27B в квантизации Q4TP занимает около 14,3 ГБ весов, но при длинном контексте упирается в KV-кэш. Для 16 full-attention слоёв гибридной модели FP16 KV-state растёт на 65 536 байт с каждым токеном — на 64K токенов это около 4 ГБ только для K/V.
Экспериментальный режим CMF (O(1) рантайм) заменяет растущий KV-кэш этих 16 слоёв фиксированным состоянием: четыре sink-токена, точное окно последних 128 токенов и 32 опорных представления для дальней части контекста.
В использованном профиле GPU-state attention составляет всего 44,1 МиБ и не увеличивается с длиной контекста. Это позволяет эффективно работать с длинными последовательностями даже на видеокартах с ограниченной VRAM.
Источник: habr.com