Спекулятивное декодирование: как ускорить локальные LLM без потери качества
Энтузиасты локальных моделей часто гонятся за скоростью любой ценой: квантуют KV-кэш до предела, режут контекст до минимума. В результате модель «забывает» половину диалога и заметно тупеет. Автор статьи на Habr называет такой подход «бегом по тёмной улице без фонарей» — быстро, но до первого столба.
В качестве альтернативы предлагается спекулятивное декодирование. Это техника, при которой маленькая «черновая» модель быстро генерирует несколько вариантов следующего токена, а большая модель их проверяет и принимает правильный. Так удаётся ускорить генерацию в разы без потери качества и без урезания контекста.
Метод не требует переобучения и работает поверх любой LLM. Статья подробно разбирает современные реализации спекулятивного декодирования — от простых до продвинутых, с примерами кода и замерами скорости. Это must-read для всех, кто запускает модели локально и хочет получить максимум токенов в секунду без лоботомии.