Как работают текстовые ИИ-вотермарки и можно ли их обойти — разбор механизма
После вступления в силу европейского AI Act провайдеры больших языковых моделей обязаны помечать сгенерированный контент. Anthropic недавно обновила документацию по водяным знакам для Claude, но не раскрыла детали реализации и не выложила публичные инструменты для их добавления или обнаружения.
Автор статьи на Хабре исследует, как именно работают такие метки: они встраиваются в распределение токенов так, чтобы быть незаметными для человека, но детектируемыми алгоритмически. Рассматриваются методы обхода — от простого перефразирования до специальных атак на генеративную выборку.
Материал будет полезен всем, кто хочет понять, можно ли случайно «засветить» свой текст как ИИ‑сгенерированный, и какие контрмеры существуют для сохранения авторской анонимности.