Инструменты
FlautGuard: многоуровневая защита LLM от prompt injection и утечек данных
Защита языковой модели принципиально отличается от защиты обычного веб-приложения: в LLM пользовательский ввод — это не только данные, но и потенциальная инструкция. Граница между «данными» и «командой» размыта, что порождает prompt injection, попытки извлечения системных промптов и утечки информации через ответы модели.
В FlautCompany столкнулись с этой проблемой при разработке своей LLM FlautFast. Вместо одного классификатора команда FlautSecurity построила FlautGuard — многоуровневый защитный слой. В статье рассказывается, как он устроен, какие ошибки были допущены на этапе разработки и что показало тестирование на реальном пользовательском трафике.
Источник: habr.com