Детектор бокового движения, обученный на синтетических данных, находит реальные атаки: AUC на уровне работ с настоящей разметкой
Автор сгенерировал выдуманную корпоративную сеть с историей входов, описал её конфигом на 135 строк и разыграл в ней атаку. На этих синтетических данных он обучил сети — каждая весит 4 тыс. параметров и учится за секунды на ноутбуке. Лучший результат дал ансамбль из шести таких сетей, обученных на шести разных выдуманных мирах. Ни одной настоящей строки в обучении не было.
Затем модель выпустили на реальные данные: журналы аутентификации Лос-Аламосской лаборатории (1,65 млрд событий) с размеченными учениями красной команды. Сети выстроили 3,6 млн окон по подозрительности. В верхних 23 строках оказалось 16 настоящих атак и 7 ложных тревог — аналитику остаётся открыть эти строки. Для сравнения: пороговый счётчик, чтобы добраться до 16-й атаки, потребовал бы 161 тыс. ложных тревог.
По AUC синтетика вошла в диапазон исследовательских работ, обученных на настоящих размеченных данных, хотя прямое сравнение некорректно. Главное открытие — петля обратной связи: ошибка детектора указывает на конкретную машину, автор понимает, какого явления не хватает в выдуманном мире, дописывает две строки конфига, и ошибка исчезает. Чуда не случилось, но подход позволяет итеративно улучшать детектор без доступа к реальным данным атак.