Волна ИИПодписаться
← Назад
Исследования

Спекулятивное декодирование: почему обещанные 6,5 раза на практике превращаются в 2,6 или ноль

15.09.2026 · habr.com ↗

Спекулятивное декодирование — техника, при которой маленькая «черновая» модель генерирует несколько токенов вперёд, а большая проверяет их за один проход. Производители обещают ускорение до 6,5 раза, но на практике всё сложнее. Автор воспроизвёл EAGLE-3 на бесплатной видеокарте Kaggle T4 и получил разброс от 2,6 раза на коде до нулевого выигрыша вне домена, на котором обучалась черновая голова — при одной и той же реализации и без подкруток.

Ключевой фактор — совпадение распределения входных данных с тем, на чём обучалась черновая модель. Если данные «не из той области», черновики оказываются неточными, большая модель их отклоняет, и вместо ускорения получается замедление. Глубина дерева черновиков тоже может увести метод в минус: слишком длинные цепочки увеличивают вероятность ошибки и накладные расходы.

Автор предлагает пять вопросов, которые стоит задавать к любой цифре «в N раз быстрее»: на каком домене измеряли, какая модель была черновой, какая глубина дерева использовалась, какое железо и какой бенчмарк. Без этих деталей заявления о спекулятивном декодировании — маркетинг, а не инженерная гарантия.

Источник: habr.com
← Все новости AI Wave