Спекулятивное декодирование: почему обещанные 6,5 раза на практике превращаются в 2,6 или ноль
Спекулятивное декодирование — техника, при которой маленькая «черновая» модель генерирует несколько токенов вперёд, а большая проверяет их за один проход. Производители обещают ускорение до 6,5 раза, но на практике всё сложнее. Автор воспроизвёл EAGLE-3 на бесплатной видеокарте Kaggle T4 и получил разброс от 2,6 раза на коде до нулевого выигрыша вне домена, на котором обучалась черновая голова — при одной и той же реализации и без подкруток.
Ключевой фактор — совпадение распределения входных данных с тем, на чём обучалась черновая модель. Если данные «не из той области», черновики оказываются неточными, большая модель их отклоняет, и вместо ускорения получается замедление. Глубина дерева черновиков тоже может увести метод в минус: слишком длинные цепочки увеличивают вероятность ошибки и накладные расходы.
Автор предлагает пять вопросов, которые стоит задавать к любой цифре «в N раз быстрее»: на каком домене измеряли, какая модель была черновой, какая глубина дерева использовалась, какое железо и какой бенчмарк. Без этих деталей заявления о спекулятивном декодировании — маркетинг, а не инженерная гарантия.