Исследования
KV-кэш в трансформерах: плата за скорость — память
В авторегрессионных трансформерах каждый новый токен требует вычисления внимания между запросами и ключами. Без кэширования это было бы O(n²) — пришлось бы пересчитывать все попарные произведения для каждого шага.
KV-кэш решает проблему, сохраняя предыдущие ключи и значения. Это превращает инференс в линейный по времени, но ценой роста потребления памяти. В результате скорость теперь ограничена не вычислительной мощностью, а пропускной способностью памяти.
Статья разбирает, что из этого следует для практического использования трансформеров — какие узкие места возникают и как их можно обойти.
Источник: habr.com