Волна ИИПодписаться
← Назад
Исследования

Prompt injection не лечится фильтрами: архитектура изоляции недоверенного текста

24.07.2026 · habr.com ↗

Языковая модель может быстро сгенерировать десятки пар «вопрос-ответ» для карточки товара. Но для корректных ответов ей нужны факты компании (цены, сроки, гарантии), а для релевантных вопросов — текст самой страницы. Как только то и другое оказывается в одном контексте, любая чужая страница получает «голос» внутри системы, которая знает данные компании и умеет вызывать инструменты.

Традиционные фильтры prompt injection неэффективны: злоумышленник может обойти их, используя неожиданные формулировки или многошаговые атаки. Предлагается архитектура, которая изолирует недоверенный текст (например, текст страницы) от доверенного контекста (данных компании) на уровне доступа: модель не может одновременно видеть и то, и другое, если не пройдёт строгую проверку.

Такой подход исключает саму возможность инъекции, а не борется с её проявлениями. Реализация требует разделения контекстов и явного указания, какой текст можно считать доверенным, а какой — нет. Это усложняет разработку, но кардинально повышает безопасность систем, где LLM работает с внешними данными.

Источник: habr.com
← Все новости AI Wave