Волна ИИПодписаться
← Назад
Исследования

Speculative Decoding: как маленькая модель ускоряет большую без потери качества

22.09.2026 · habr.com ↗

Speculative decoding — это хитрый трюк: маленькая модель (draft model) за один шаг генерирует несколько следующих токенов, а большая модель за один проход проверяет всю пачку. Если токены совпали с её версией — оставляет, если нет — переписывает продолжение с первого расхождения. Итоговое распределение ответов не меняется, а скорость инференса растёт.

Ключевое условие: у обеих моделей должен быть одинаковый токенизатор, иначе токены не совпадут. Размер черновика — гиперпараметр, который нужно подбирать: слишком короткий даст мало ускорения, слишком длинный — заставит большую модель часто всё переделывать. В статье разбирают, как включить speculative decoding в Transformers и vLLM, а также обходят альтернативы без второй модели: EAGLE, Medusa, LayerSkip и DFlash.

На первый взгляд кажется, что ускорение должно стоить точности. Но speculative decoding — один из тех редких случаев, когда можно получить прирост скорости без компромисса по качеству. Подход особенно полезен для продакшн-систем, где важна низкая задержка.

Источник: habr.com
← Все новости AI Wave