Flux 3 от Black Forest Labs: первая модель с нативным звуком в видео длиной до 20 секунд
Black Forest Labs (BFL), создатели модели Flux, анонсировали третью версию — Flux 3. Это мультимодальная фундаментальная модель, которая одновременно учится на изображениях, видео и аудио. Главное новшество: она умеет генерировать видео с нативным звуком длиной до 20 секунд, чего не было в предыдущих моделях BFL.
Внутренние тесты компании показывают, что Flux 3 немного превосходит текущего лидера рынка Seedance 2.0 (это модель от другой лаборатории), но независимые бенчи ещё не выходили. BFL делает ставку на то, что объединение модальностей в одной модели — ключ к более реалистичной генерации.
В долгосрочной перспективе Black Forest Labs нацелена на создание «мировой модели» (world model), способной понимать физику и логику окружающей среды. Уже сейчас Flux 3 тестируют в задачах робототехники, что указывает на практический выход за рамки чисто генеративных задач.