Just AI обучила детектор джейлбрейков специально для русскоязычных AI-агентов
Just AI поделилась опытом разработки детектора джейлбрейков для русскоязычных AI-агентов. Продукт Jay Guard представляет собой защитный слой между приложением и моделью, который проверяет запросы на атаки, контент-фильтры и утечку персональных данных. За последние два года хакеры научились воровать данные через AI-ассистентов без традиционных эксплойтов — социальная инженерия теперь работает и на модели, а не только на людей.
Готовые модели-детекторы плохо справлялись с русскоязычным трафиком: слишком много ложных срабатываний, которые блокировали легитимные запросы. Инженеры Just AI переработали обучающие данные под русский язык и российский контекст. После переобучения количество ложных блокировок снизилось, но авторы признают: поддержание качества — непрерывный процесс, так как атаки постоянно эволюционируют.
Разработка детектора — лишь верхушка айсберга: основная работа заключается в постоянном мониторинге и адаптации под новые уязвимости. В статье подробно разбираются типы атак, структура обучающей выборки и ограничения текущей версии Jay Guard.