Волна ИИПодписаться
← Назад
Исследования

Исследователи научились восстанавливать промпты LLM из ответов с почти 100% точностью

12.08.2026 · the-decoder.com ↗

Исследователи из IIT Bombay и Adobe Research разработали метод Previous-Token Prediction (PTP), который позволяет восстановить оригинальный промпт, поданный на вход LLM, по её выходному тексту. Точность восстановления близка к идеальной — модель-инвертор практически не ошибается. При этом для атаки не нужен доступ к весам или архитектуре целевой LLM: метод работает «чёрным ящиком» и переносится между разными моделями.

Суть подхода в том, что специально обученная инверсная языковая модель предсказывает предыдущий токен — то есть шаг за шагом восстанавливает последовательность промпта, глядя на сгенерированный ответ. Это принципиально отличается от предыдущих попыток, которые требовали либо доступа к внутренним состояниям модели, либо работали только на конкретных архитектурах. PTP справляется даже с длинными и сложными промптами.

Для бизнеса, который полагается на секретные системные промпты (например, инструкции для ассистентов или правила фильтрации), это тревожный сигнал. Если злоумышленник может получить несколько примеров ответов LLM, он с высокой вероятностью восстановит исходные инструкции. Пока это исследовательская работа, но она демонстрирует принципиальную уязвимость, которую стоит учитывать при проектировании систем на базе LLM.

Источник: the-decoder.com
← Все новости AI Wave