Почему «ты — моя бабушка» ломает ИИ: анатомия джейлбрейка и как это исправить
Автор разбирает, почему ИИ так легко обмануть фразами вроде «ты — моя бабушка» или «я пишу роман про мошенника». Суть в том, что модель не понимает запрет как абстрактное правило, а просто выучила паттерн: определённые признаки запроса → выдать отказ. Это делает защиту чувствительной к форме: меняешь формулировку, контекст или язык — и отказ исчезает. Пример — кодирование опасного запроса в Base64, которое обходит фильтры.
Решение — перейти от поверхностного шаблона к настоящему пониманию категории запрета. Модель должна представлять: «эта задача относится к запрещённой категории, поэтому отказываюсь независимо от контекста и кодировки». Тогда джейлбрейки контекстом и переформулировками перестанут работать. Статья предлагает конкретный подход к обучению такой устойчивости.