Волна ИИПодписаться
← Назад
Исследования

Анатомия Mixture-of-Experts: почему 17B активных параметров бьют 70B плотных

12.09.2026 · habr.com ↗

Если вы заметили, что все флагманские опенсорс-модели вдруг стали Mixture-of-Experts (MoE), это не случайно. MoE позволяет держать огромное количество параметров (например, 397 миллиардов у Qwen3.5), но при каждом запросе активировать лишь малую их часть — порядка 17 миллиардов. Именно поэтому такие модели не требуют космических бюджетов на видеокарты и при этом выдают токены с высокой скоростью.

Секрет в разделении нейросети на «экспертов» — специализированных подсетей, каждая из которых отвечает за свою область знаний (медицина, код, математика и т.д.). Маршрутизатор (router) направляет входной токен к нужным экспертам, и активируются только они. Остальные параметры простаивают, не тратя вычислительные ресурсы. Это и даёт выигрыш в скорости и стоимости при сохранении общей ёмкости знаний.

На практике это означает, что модель с 397B параметров может работать на оборудовании, которое раньше тянуло лишь плотные модели на 70B. При этом качество ответов не уступает, а часто и превосходит более «тяжёлые» аналоги. Именно поэтому MoE стала стандартом для современных опенсорс-флагманов — от Qwen до Mixtral.

Источник: habr.com
← Все новости AI Wave