Волна ИИПодписаться
← Назад
Фичи и апдейты

Qwen3.8-27B научили обходиться без роста KV-кэша: экспериментальный CMF-режим

09.09.2026 · habr.com ↗

Модель Qwen3.8-27B в квантизации Q4TP занимает около 14,3 ГБ весов, но при длинном контексте упирается в KV-кэш. Для 16 full-attention слоёв гибридной модели FP16 KV-state растёт на 65 536 байт с каждым токеном — на 64K токенов это около 4 ГБ только для K/V.

Экспериментальный режим CMF (O(1) рантайм) заменяет растущий KV-кэш этих 16 слоёв фиксированным состоянием: четыре sink-токена, точное окно последних 128 токенов и 32 опорных представления для дальней части контекста.

В использованном профиле GPU-state attention составляет всего 44,1 МиБ и не увеличивается с длиной контекста. Это позволяет эффективно работать с длинными последовательностями даже на видеокартах с ограниченной VRAM.

Источник: habr.com
← Все новости AI Wave