Исследования
Джейлбрейк LLM: как легенда и стиль обходят защиту сильнее, чем сила
Jailbreak больших языковых моделей — это не всегда технический взлом. Часто атака работает через форму: модель убеждают принять вымышленную роль, стиль или легенду, и она сама снимает внутренние ограничения. Статья на Habr подробно разбирает этот механизм.
Автор показывает, что защита LLM уязвима не столько к прямым запросам, сколько к нарративным манипуляциям. Модель, обученная следовать инструкциям, может нарушить политику безопасности, если ей «легендировать» ситуацию — например, попросить написать от лица персонажа или в заданном стиле.
Материал полезен для понимания текущих ограничений alignment-техник и подчёркивает, что безопасность моделей требует не только технических барьеров, но и устойчивости к социальной инженерии.
Источник: habr.com