Волна ИИПодписаться
← Назад
Тесты и бенчмарки

Nvidia обещала 15-кратное ускорение DFlash — на практике получили 2,3x, и то не везде

02.09.2026 · habr.com ↗

В начале года Nvidia громко анонсировала DFlash — метод ускорения любой LLM без изменения модели, обещая «до 15x к пропускной способности на Blackwell». Цифра выглядела революционно, но независимая проверка на реальном стенде показала скромные 2,3x, и только при одном активном запросе.

Для теста взяли драфтер DFlash из репозитория Gemma 4 26B. Как только число параллельных пользователей достигает четырёх, ускорение обнуляется, а на восьми запросах DFlash начинает проигрывать обычному инференсу. Автор разбирает, откуда берутся маркетинговые 15x и почему графики расходятся с вендорскими.

Источник: habr.com
← Все новости AI Wave