MoVA — эволюция Mixture of Experts: новая архитектура внимания для LLM
Архитектура Mixture of Experts (MoE) уже стала стандартом для эффективных LLM: Mixtral и DeepSeek доказали, что динамический роутинг между экспертами позволяет наращивать параметры без пропорционального роста вычислительных затрат. Но на сцену выходит MoVA — прямое продолжение идеи, которое модифицирует не только FFN-слои, но и сам механизм внимания.
MoVA меняет то, как модель распределяет вычислительные ресурсы внутри attention. Если в классическом MoE роутер решает, какой экспертный слой активировать для каждого токена, то MoVA вводит динамический выбор голов внимания и их комбинаций. Это позволяет модели адаптивно фокусироваться на разных частях контекста в зависимости от задачи, не увеличивая общее число параметров.
Первые тесты на бенчмарках показывают, что MoVA даёт прирост качества при том же или меньшем количестве активных параметров по сравнению с обычным MoE. Пока архитектура только начинает привлекать внимание сообщества, но независимые обзоры уже отмечают её потенциал для следующего поколения эффективных LLM.