Волна ИИПодписаться
← Назад
Исследования

Почему «ты — моя бабушка» ломает ИИ: анатомия джейлбрейка и как это исправить

01.10.2026 · habr.com ↗

Автор разбирает, почему ИИ так легко обмануть фразами вроде «ты — моя бабушка» или «я пишу роман про мошенника». Суть в том, что модель не понимает запрет как абстрактное правило, а просто выучила паттерн: определённые признаки запроса → выдать отказ. Это делает защиту чувствительной к форме: меняешь формулировку, контекст или язык — и отказ исчезает. Пример — кодирование опасного запроса в Base64, которое обходит фильтры.

Решение — перейти от поверхностного шаблона к настоящему пониманию категории запрета. Модель должна представлять: «эта задача относится к запрещённой категории, поэтому отказываюсь независимо от контекста и кодировки». Тогда джейлбрейки контекстом и переформулировками перестанут работать. Статья предлагает конкретный подход к обучению такой устойчивости.

Источник: habr.com
← Все новости AI Wave