Исследования
Промпт-инъекция с точки зрения лингвистики: почему отзыв становится командой для нейросети
Промпт-инъекция — классическая проблема безопасности ИИ: пользователь вставляет команду в, казалось бы, безобидный текст, и нейросеть выполняет её. Но почему фраза внутри чужого отзыва вдруг приобретает силу инструкции? Статья на Habr предлагает взглянуть на это явление с лингвистической точки зрения — через понятия адресата, речевых актов и смешения ролей.
Автор не просто объясняет механизм, но и проводит эксперимент: даёт модели Gemini одну и ту же инъекцию в разных языковых формах (прямая команда, косвенная просьба, риторический вопрос) и проверяет, какая из них эффективнее заставляет нейросеть сменить задачу. Результаты позволяют лучше понять, как устроено «внимание» большой языковой модели к контексту.
Источник: habr.com