AMD выпустила Instella-MoE-16B-A3B: открытая MoE-модель с 2,8B активных параметров, обученная на Instinct GPU
AMD выпустила Instella-MoE-16B-A3B — полностью открытую языковую модель на архитектуре Mixture-of-Experts. Модель имеет 16 миллиардов параметров, но активирует лишь 2,8 миллиарда на каждый токен. Она обучена с нуля на графических ускорителях Instinct MI300X и MI325X. AMD публикует веса со всех этапов обучения, а также данные о смесях данных, конфигурациях обучения и код инференса.
Архитектурные особенности: 27 слоёв, скрытая размерность 2048, 16 голов внимания, словарь на 128 896 токенов. Каждый MoE-слой использует 2 общих эксперта и 6 маршрутизируемых из 64 доступных. Ключевые нововведения — Gated Multi-head Latent Attention (дополнительный обучаемый выходной гейт) и FarSkip-Collective (передача устаревших частичных активаций для перекрытия коммуникации с вычислениями). AMD сообщает об ускорении претрейнинга на 12,7% и сокращении времени до первого токена при эксперт-параллельном сервинге до 39,2%.
Обучение проходило в несколько этапов: претрейнинг на 7,1 трлн токенов из открытых корпусов (Nemotron-CC-v2, MegaMath, FineMath, RefineCode, TxT360), мид-трейнинг на Dolma3 Dolmino 100B, расширение контекста с 4K до 64K с помощью YaRN, и пост-трейнинг с SFT, DPO и RL (1400 шагов RLVR + Multi-Teacher On-Policy Distillation). Базовый чекпоинт набирает в среднем 76,7 балла, опережая Moonlight-16B-A3B (76,2) и SmolLM3-3B-Base (70,5), но уступая Qwen3.5-4B-Base (79,5). После пост-трейнинга модель достигает 73,22 балла на Think-задачах, обходя Olmo3-7B-Think (71,97) и Gemma-4-E4B think (70,47).
Модель распространяется под лицензией ResearchRAIL только для академических и исследовательских целей — это не коммерческая модель. Код обучения доступен под MIT-лицензией. Для инференса в BF16 требуется около 32 ГБ памяти весов, что позволяет запускать модель на одном высокопроизводительном ускорителе. AMD поставляет код инференса на SGLang.