MiniMax представила H3: универсальная мультимодальная видеомодель с родным стереозвуком и 2K
MiniMax выпустил H3 — не просто очередную модель text-to-video с надстройками, а универсальный мультимодальный генератор. В отличие от типичных пайплайнов, где text-to-video, image-to-video, first-and-last-frame, subject reference и video editing живут как отдельные экспертные модели, H3 объединяет всё в один претрейнинговый подход: связи между референсами и редактированием описываются на естественном языке. Например, в одном запросе можно указать: «возьми движение камеры из Видео 1, пусть персонаж из Изображения 2 поёт, синхронизируй с Аудио 3».
Технические характеристики: выходное разрешение 2K, длительность от 4 до 15 секунд (только целые числа). Модель доступна через API с 31 июля 2026 года под идентификатором MiniMax-H3, а также в потребительском приложении Hailuo AI. На собственном «железе» развернуть H3 пока нельзя — только через облачный интерфейс. Входные ограничения: до 9 референсных изображений, до 3 видео (каждое 2–15 с, суммарно ≤15 с), до 3 аудиофайлов (обязательно в паре с изображением или видео), не более 12 файлов всего. Промпт — до 7000 символов, тело запроса — до 64 МБ, для больших ассетов рекомендуется передача по URL. Размеры файлов: видео ≤50 МБ, изображение ≤30 МБ, аудио ≤15 МБ. Поддерживаемые форматы: H.264/H.265, JPG/PNG/WEBP/HEIC/HEIF, WAV/MP3.
MiniMax позиционирует H3 для рекламы, брендинга, e-commerce, дизайна продуктов, UI/UX, игр, предвизуализации фильмов и каталогов товаров. Примеры применения: генерация вариантов рекламы, видео для товарных карточек, анимированные постеры, титры к фильмам, бесконечные петли на сайтах, заставки для игр с сохранением персонажа и перенос движения с видео на видео. API предлагает три режима: text-to-video, first/last-frame image-to-video и референсная генерация — все через один эндпоинт с асинхронным трёхшаговым потоком (создать задачу, опрашивать task_id, скачать content.url).
В основе H3 четыре ключевых нововведения. Contextual Omni Representation: переработанный подход к капшенингу — модель описывает отношения между контекстом и целевым видео, а не только само целевое видео. Исходный материал требует около 100K токенов инференса, сжатых в среднем до 4K токенов. H3-VAE: новый токенизатор с высоким коэффициентом сжатия, дающий заявленный 4-кратный прирост эффективной длины последовательности — ключ к нативному 2K. H3-Omni Transformer: архитектура разделяет workloads понимания и генерации, подстраивая под каждый загрузку GPU; сквозной throughput вырос почти на 30%. In-Context Regeneration: базовая модель регенерирует собственный низкоразрешённый вывод прямо в контексте, перечитывая исходный мультимодальный контекст — это восстанавливает мелкий текст и детали, которые обычные upscaler-ы лишь угадывают.