AugLy: гайд по мультимодальной аугментации данных на PyTorch, тексте, аудио и изображениях
В новом руководстве разбирается сквозной пайплайн аугментации изображений, текста и аудио с помощью AugLy. Авторы решают проблемы совместимости зависимостей, показывают, как создавать детерминированные синтетические датасеты для воспроизводимости экспериментов.
Подробно описаны функциональное и классовое API библиотеки, работа с метаданными и отслеживание интенсивности аугментаций, вероятностная композиция трансформаций, аугментации с учётом ограничивающих рамок (bounding boxes) и пользовательские преобразования.
Особое внимание уделено практическим тестам на устойчивость: бенчмаркинг детекции копий по перцептивным хешам при искажениях изображений, оценка текстовых классификаторов против adversarial-атак, Unicode-обфускации, санитизации и adversarial-обучения. Также интегрирована аугментация аудио и построен запрашиваемый склад метаданных.
Всё это напрямую подключается к датасетам и DataLoader'ам PyTorch — получается полноценный инструмент как для генерации данных, так и для измерения робастности моделей.