NVIDIA скрестила NeMo Automodel с диффузионными моделями: проверяем, что за зверь
Ещё в июле NVIDIA и Hugging Face выпустили совместный пост о том, что их опенсорсная библиотека NeMo Automodel теперь умеет работать с диффузионными моделями. В анонсе — FSDP2, тензорный и контекстный параллелизм, мультинодовая оркестрация. Обещают масштабирование дообучения FLUX, Wan и HunyuanVideo с одной видеокарты до сотен — и всё это без конвертации чек-пойнтов.
Список впечатляет, но автор заметила: все эти технологии придумала не NVIDIA, они давно есть в PyTorch и Megatron-Core. Поэтому она решила проверить заявления на практике — ушло немало времени, но результат оказался достойным отдельного разбора.
Что из обещанного работает из коробки, а где приходится допиливать руками и насколько честно звучат громкие обещания — читайте в оригинале. Спойлер: не всё так гладко, как рисуют в анонсах.