Исследователи научились читать «мысли» ИИ-моделей: извлечены пароли и ключи API
Восемь исследователей из ELLIS Institute Tübingen, Института интеллектуальных систем Общества Макса Планка, Tübingen AI Center, MATS и Snyk 10 августа опубликовали препринт «Stealing Reasoning Traces from Proprietary LLM APIs». Они показали, что внутренние рассуждения передовых моделей, которые провайдеры обычно скрывают от пользователя, можно прочитать целиком без прямой атаки на саму модель. Атака сработала на моделях трёх крупнейших поставщиков: Anthropic, OpenAI и Google.
Попутно авторы применили свой метод к публичным репозиториям и извлекли из зашифрованных блоков 62 ключа API, 33 пароля, 24 токена доступа и ещё несколько сотен секретов, о которых их владельцы не подозревали. Это демонстрирует, что уязвимость не только теоретическая — она уже позволяет добывать реальные учётные данные.
Открытие ставит под вопрос безопасность использования «скрытых» рассуждений в коммерческих LLM. Провайдерам придётся пересмотреть механизмы изоляции внутренних цепочек мыслей, а пользователям — быть осторожнее с тем, какие данные попадают в контекст модели.