Волна ИИПодписаться
← Назад
Модели и агенты

DeepSeek 0731 на DGX Spark: разгон до 68 tok/s — секрет в runtime-образе и флаге MoE

03.08.2026 · habr.com ↗

На двух NVIDIA DGX Spark (GB10, 128 GB unified memory на ноду, QSFP 200G / RoCEv2) автор протестировал DeepSeek V4 Flash 0731. Основной прирост скорости генерации дала смена runtime-образа: переход с vLLM 0.21.1 на 0.25.2 увеличил производительность примерно на 22% на том же чекпоинте. Механика неочевидна: новый образ снизил расчётную частоту verification-шагов на 17%, но поднял число выходных токенов за шаг с 3.27 до 4.80.

Вторая находка — флаг --moe-backend flashinfer_b12x, который не выбирается режимом auto. Явное включение дало +13.3% по среднему (59.7 против 67.6 tok/s) и +16.6% по медиане на card-like профиле. B12X поднимает SSE-производную частоту verification-шагов на 16-18%, хотя выходные токены за шаг падают на 2.5%. Итоговый прирост decode-метрики — 13.3-14.6% по средним и 15.6-16.6% по медианам.

Результаты: 67.6 tok/s на одиночном запросе и 260 tok/s суммарно на 12 параллельных запросов. Автор также вынес в отдельные разделы отрицательные результаты, погрешности и границы применимости. Материал полезен для инженеров, оптимизирующих инференс MoE-моделей на кластерах с unified memory.

Источник: habr.com
← Все новости AI Wave