Как ломают ИИ: DAN, бабушка с химзавода и Base64 — разбор главных JailBreak-атак
Чтобы «взломать» нейросеть, порой хватает правильно составленного текста. Попросить модель сыграть персонажа без правил, вспомнить покойную бабушку с химзавода, разбить опасный вопрос на цепочку безобидных или закодировать его в Base64 — так модель сама обходит свои ограничения, искренне пытаясь помочь.
Андрей Якунин, инженер по информационной безопасности Selectel, в подробном тексте разбирает классику: DAN (Do Anything Now), «Бабушку», Crescendo, а также обход фильтров через кодирование и стеганографию. Отдельно поясняется, чем джейлбрейк отличается от промпт-инъекции, и почему эти приёмы срабатывают.
Материал будет полезен разработчикам продуктов на LLM, которые хотят понимать, какие атаки могут прилететь в их чат-бот, специалистам по ИБ, защищающим эти продукты, и всем, кто просто интересуется, как устроены атаки на искусственный интеллект.