SESAME: студенты ВШЭ и VK перенесли MoE-архитектуру из LLM в шумоподавление речи
Группа студентов мастерской по сервисам и платформам ИИ в Инженерно-математической школе НИУ ВШЭ и VK — Александр Забурдаев, Ксения Золина, Даниил Марценюк, Илья Трофименко и Илья Кулешов — поделилась опытом применения разреженной смеси экспертов (sparse MoE) к задаче улучшения качества речи (Speech Enhancement). Их модель SESAME построена на базе MP-SENet: стандартные полносвязные блоки внутри трансформера заменены на MoE-модуль.
Идея в том, чтобы не скармливать весь речевой сигнал одной нейросети целиком, а позволить разным «экспертам» разбираться с разными типами шума. В языковых моделях MoE уже стала стандартом, а в обработке аудио пока не прижилась — авторы разбирают, какие трюки из мира LLM работают, а какие нет (например, Expert Choice) и почему.
Код проекта опубликован на GitHub, так что любой желающий может посмотреть, как устроена модель, и попробовать её в деле.