DeepSeek V4.1-Flash: 552 млрд параметров, KV-кэш в 4 раза меньше и обходит топ-модели на кодинге
DeepSeek представила V4.1-Flash — новую мультимодальную модель с 552 миллиардами параметров и архитектурой Mixture of Experts (MoE). Ключевое нововведение — сокращение KV-кэша до четверти от объёма предшественника, что резко снижает требования к памяти при развёртывании AI-агентов.
На бенчмарке DeepSWE (кодинг-задачи) модель с небольшим отрывом обходит Opus 5 и GPT-5.6 Sol, хотя на каждый токен активируется лишь 16 млрд параметров. Это означает, что V4.1-Flash обеспечивает производительность уровня фронтирных моделей при гораздо меньших вычислительных затратах.
Модель выпущена под лицензией MIT, что делает её доступной для коммерческого использования и самостоятельного хостинга. DeepSeek позиционирует V4.1-Flash как решение для массового внедрения недорогих AI-агентов, где важны низкая стоимость инференса и компактный кэш.