Волна ИИПодписаться
← Назад
Исследования

Разобрали защищённый блок рассуждений Claude: protobuf, прозрачный конверт и открытые метаданные

11.08.2026 · habr.com ↗

Атака на зашифрованные цепочки рассуждений Claude оказалась ещё проще, чем думали. Исследователи подкладывают слабую «сестру» той же компании и просят дословно пересказать чужой блок — так читают пароли, ключи API и прочие секреты, случайно попавшие в рассуждения. Автор статьи подтверждает, что метод работает, но делает важное уточнение: поле signature, которое Anthropic добавляет к каждому блоку thinking, не является полностью непрозрачным.

Полгода назад он уже разбирал это поле в локальных сессиях своего агента — набралось около 1500 блоков. Выяснилось, что конверт — обычный protobuf без шифрования ключами. Внутри открыто лежат метаданные, а зашифрован только один вложенный кусок — сам текст мысли. За последние полгода протокол обновился четыре раза, и парсер пришлось переписать.

В обновлённой версии автор нашёл новые детали, которые ставят под сомнение некоторые выводы препринта. В частности, в незашифрованной части поля signature может содержаться служебная информация, включая случайно попавшие токены. Это делает атаку ещё более опасной: злоумышленник может получить не только мысли модели, но и конфиденциальные данные, которые модель «проговорилась» в процессе рассуждения.

Источник: habr.com
← Все новости AI Wave