Волна ИИПодписаться
← Назад
Модели и агенты

MiniMax выпустила MiniMax-Music3: открытая модель генерирует песни до 5 минут по тексту и описанию

17.08.2026 · marktechpost.com ↗

Модель принимает раздельно текст песни с тегами разделов ([Intro], [Verse], [Chorus] и т.д.) и отдельное структурированное описание, содержащее глобальные метаданные, параметры вокала и аранжировку. На выходе — готовый трек в формате 32 кГц, 16-бит стерео WAV за одно поколение до 5 минут. Для упрощения ввода MiniMax также прилагает агента-переписчика, который расширяет короткое описание до формата Structured Caption.

Архитектура MiniMax-Music3 сочетает иерархический авторегрессионный стек с непрерывным путём синтеза. Глобальная LLM на 8B параметров предсказывает первый семантический кодбук кадр за кадром, а локальная LLM на 0.6B восстанавливает остальные акустические детали. Затем скрытые состояния обеих моделей подаются в 2.4B модуль flow-matching, который преобразует их в латентное представление, декодируемое 123M Flow-VAE, унаследованным от MiniMax Speech. Дискретный декодер токенизатора при инференсе не используется.

Веса, код для инференса и три документированных пути для развёртывания опубликованы в день релиза. Лицензия MiniMax-Music3 Community License разрешает коммерческое использование, но требует отображать «MiniMax-Music3» в интерфейсе продукта, а организации с годовым доходом свыше 20 млн долларов от таких продуктов должны получить отдельное письменное разрешение. Также необходимо внедрить защитные механизмы от нарушения авторских прав при хостинге генерации третьих лиц.

Модель ориентирована на игровую индустрию, рекламу, генерацию фоновой музыки для видео, обучающие приложения и подкастинг. Архитектура и лицензия позволяют развёртывать модель прямо сейчас, минуя стадию исследовательского превью.

Источник: marktechpost.com
← Все новости AI Wave