Anthropic показала, как works текстовый водяной знак в Claude
Anthropic опубликовала официальную статью How Claude's Text Watermark Works, в которой объясняется, как и зачем внедрять невидимые метки в сгенерированный текст. Это потенциально ключевой инструмент для детекции контента, созданного ИИ, и защиты авторских прав.
Известный исследователь LLM Себастьян Рашка сделал детальный разбор этого механизма. Он показал, как вотермаркинг может быть устроен на уровне токенов: выбор определённых слов с учётом seed, который недоступен пользователю, но проверяем владельцем модели. В разборе — примеры, код и объяснение, почему это трудно обойти незаметно.
Наша версия — это чистый, адаптированный под русский язык перевод разбора. Оригинал у Рашки местами затянут и излишне рекламируется, поэтому мы вычистили воду и оставили суть: как именно вотермаркинг работает, какие у него сильные и слабые стороны и почему это может стать стандартом для LLM.
Статья вышла в ключевой момент, когда всё больше площадок задумываются о детекции синтетического текста, и Anthropic делает ставку на технически прозрачный, но трудноуловимый метод.