Волна ИИПодписаться
← Назад
Исследования

Почему классический Attention уходит в прошлое: разбор механизмов внимания в современных LLM

06.10.2026 · habr.com ↗

Классический механизм внимания, который лежал в основе первых трансформеров, сегодня почти не встречается в чистом виде. На смену ему пришли модификации: multi-head attention (MHA) остался базой, но для экономии памяти и ускорения инференса модели используют grouped query attention (GQA) или multi-query attention (MQA). В некоторых архитектурах, например в DeepSeek, применяют multi-head latent attention (MLA), которая сжимает KV-кэш.

Отдельное направление — sparse и local attention, где модель обращает внимание не на весь контекст, а на выбранные токены или окно. Это снижает вычислительную сложность, но может ухудшать качество на задачах, требующих глобального понимания. Поэтому всё чаще встречаются гибридные подходы: часть слоёв использует полное внимание, часть — линейное или рекуррентное.

Главная проблема — KV-кэш: при росте длины контекста он растёт линейно, что делает inference дорогим. Современные модели, включая Qwen3.8 и DeepSeek, пытаются решить это за счёт комбинации механизмов: где-то жертвуют полнотой внимания ради скорости, где-то — наоборот. В итоге выбор архитектуры — это всегда компромисс между качеством извлечения информации и скоростью генерации.

Источник: habr.com
← Все новости AI Wave