Волна ИИПодписаться
← Назад
Модели и агенты

DeepSeek V4.1-Flash: 1M контекст, FP4 KV-кэш и архитектура с переиспользованием внимания

10.09.2026 · marktechpost.com ↗

DeepSeek представила V4.1-Flash — новую мультимодальную модель на архитектуре Mixture-of-Experts с 552B параметров в бэкбоне и 196B дополнительных параметров Engram. Ключевая фишка — контекстное окно в 1 млн токенов и рекордно малый KV-кэш: всего 890 байт на токен, что в 4 раза меньше, чем у V4-Flash, и примерно в 437 раз меньше, чем у V1. Модель активирует 8B параметров на токен при prefill и 16B при decode. Веса открыты под лицензией MIT, доступны через vLLM, SGLang и Transformers на Hugging Face.

Архитектурные нововведения: 40-слойный бэкбон разделён на 20-слойный каузальный энкодер и 20-слойный декодер. Декодер не вычисляет собственный глобальный KV — он получает его из финального скрытого состояния энкодера через проекционные веса. Это почти вдвое сокращает вычислительные затраты на prefill. В каждом слое работает sliding-window attention (окно 128 токенов), а для декодера применяется Decoder SWA Bounded Replay — пересчёт только последних 128 токенов при промахе кэша.

Второй ключевой компонент — Compressed Sparse Attention 2 (CSA2). Каждый слой CSA2 статически получает один из трёх режимов: Full (вычисляет свой KV и индексы), Reindex (переиспользует KV и индексы от последнего Full, но пересчитывает свои Q), Reuse (полностью переиспользует KV и индексы). В энкодере 18 слоёв CSA2 сжаты в группы 2:1 (1 Full, 5 Reuse), в декодере 20 слоёв — группы 1:1 (Full или Reindex плюс 3 Reuse). Иерархический разреженный индексатор в декодере позволяет Full-слою строить пул до 16 384 позиций.

KV-кэш квантифицирован в E2M1 с одной шкалой E4M3 на 16 каналов (NVFP4 без глобальной шкалы) — это почти вдвое уменьшает хранилище по сравнению с FP8 в V4. SWA KV не сохраняется на SSD, а живёт в распределённом пуле из 10% DRAM хоста с TTL в минуты, глобальный KV гарантированно хранится 72 часа. Предобучение на 45 трлн мультимодальных токенов (7:1 текст/мультимода), контекст расширен до 1M на 34 трлн токенов. Базовая модель сравнивается с V4-Pro-Base при трети общего и четверти активированных параметров. Пост-тренинг — RL на синтетических задачах агентов и дистилляция от 40+ учителей.

Источник: marktechpost.com
← Все новости AI Wave