Модели и агенты
MiniMax H3: видеомодель, которая сама режиссирует, монтирует и накладывает звук
MiniMax H3 — не очередная текст-в-видео модель. Она объединяет генерацию, редактирование и звуковое сопровождение в едином трансформере. Достаточно подать шесть референсных изображений, образец тайминга и один текстовый промпт — модель выдаст смонтированный 15-секундный клип, повторяющий ритм примера. Также H3 умеет убирать зелёный экран, заменять фон и пересчитывать освещение под новую сцену.
Разработчики называют H3 «шагом к общему мультимодальному интеллекту» и критикуют зоопарк узких инструментов как излишнюю сложность. Модель доступна под открытой лицензией — любой может протестировать её на своих данных, чтобы проверить заявления маркетинга.
Источник: habr.com