Волна ИИПодписаться
← Назад
Модели и агенты

DeepSeek обновила V4-Flash: агентные способности и код подтянулись без смены архитектуры

31.07.2026 · marktechpost.com ↗

DeepSeek выкатила на Hugging Face и в публичное бета-API обновление V4-Flash-0731. Это официальный релиз, который заменяет предыдущую превью-версию. Архитектура и размер модели не изменились — все улучшения достигнуты за счёт повторного пост-тренинга. В чекпоинт встроен модуль спекулятивного декодирования DSpark, как у DeepSeek-V4-Flash-DSpark, и на Hugging Face репозиторий весит 304B параметров с учётом этого модуля поверх базовых 284B.

На стороне API модель теперь нативно поддерживает формат Responses API и адаптирована для Codex. Цены: $0.14 за 1M входных токенов при промахе кэша, $0.0028 при попадании и $0.28 за 1M выходных токенов, с лимитом в 2500 одновременных запросов. Это примерно втрое дешевле V4-Pro по выходу ($0.87). Для самостоятельного развёртывания веса доступны под MIT-лицензией, но требования высоки: vLLM пример работает на одном узле 4×GB300, а lossless 8-bit сборка от Unsloth занимает 162 GB, 3-bit — 103 GB.

Архитектура V4-Flash — 284B-параметрический MoE с 13B активных на токен и окном контекста в 1M токенов. Каждый MoE-слой содержит 1 общий эксперт и 256 маршрутизируемых с промежуточной размерностью 2048, при этом 6 экспертов срабатывают на токен. Первые три слоя используют хэш-маршрутизацию. Внимание гибридное: Compressed Sparse Attention (CSA) и Heavily Compressed Attention (HCA). Manifold-Constrained Hyper-Connections (mHC) заменяют обычные residual-связи. Предобучение прошло на более чем 32T токенах с оптимизатором Muon. Эффективность в 27% FLOPs и 10% KV-кэша относительно DeepSeek-V3.2 указана для V4-Pro, не для Flash.

Источник: marktechpost.com
← Все новости AI Wave