Волна ИИПодписаться
← Назад
Исследования

KV-кэш в трансформерах: плата за скорость — память

02.10.2026 · habr.com ↗

В авторегрессионных трансформерах каждый новый токен требует вычисления внимания между запросами и ключами. Без кэширования это было бы O(n²) — пришлось бы пересчитывать все попарные произведения для каждого шага.

KV-кэш решает проблему, сохраняя предыдущие ключи и значения. Это превращает инференс в линейный по времени, но ценой роста потребления памяти. В результате скорость теперь ограничена не вычислительной мощностью, а пропускной способностью памяти.

Статья разбирает, что из этого следует для практического использования трансформеров — какие узкие места возникают и как их можно обойти.

Источник: habr.com
← Все новости AI Wave