Anthropic: водяные знаки в текстах Claude

Anthropic встраивает в тексты Claude невидимые водяные знаки, которые переживают копипаст — того требует европейский AI Act с 2 августа 2026 года. Изображения теперь получают криптоподпись по стандарту C2PA.

Автор: Michael Kokin ·

Забавно, как весь твиттер взбудоражился от новости о том, что Anthropic начала помечать невидимыми водяными знаками тексты, которые генерируют их модели. Не в метаданных, а прямо в тексте.

Знак (водяной) не виден глазу, не меняет смысл и качество текста и переживает копипаст. Работает на уровне модели, поэтому помечается всё — от API и приложения до Claude Code и доступа через облака Amazon, Google и Microsoft. А к сгенерированным файлам (.png, .svg, .jpg) теперь вкладывается криптоподпись по открытому стандарту C2PA (как я понял).

Это всё связано с комплаенсом. С 2 августа 2026 года европейский AI Act требует делать ИИ-контент машинно-различимым. Поэтому маркируют пока только модели, запущенные после этой даты, а старые — «в переходном периоде», то есть их тексты никто не помечает.

Как вообще можно спрятать знак в словах?

Anthropic деталей не раскрывает, но у Google похожая штука — SynthID-Text — уже два года работает в Gemini, так что механику можно подсмотреть там.

Например, модель пишет «утром выпил кофе и ___ на работу» и выбирает между «поехал», «пошел» и «отправился». Секретный ключ вместе с несколькими предыдущими словами псевдослучайно делит словарь на «зеленые» и «красные» слова, и модель чуть чаще берет зеленые.

Читатель видит обычный текст. А детектор с тем же ключом считает статистику. Если на тысячу слов зеленых 70% вместо ожидаемых 50%, текст писала модель. Поэтому в Anthropic и предупреждают, что детекция на небольших текстах срабатывать не будет, а вот ресечи, статьи или дипломные работы раскрасит как новогоднюю елку.

Что это значит, если механика похожа на SynthID-Text

Так что если они будут использовать что-то наподобие гугловского SynthID-Text, мы получим следующую историю:

Итого

В общем, все «хуманайзеры» и деслоп-промпты не работают. Они чистят стиль, а знак сидит в статистике выбора слов. Стереть его может только пересказ текста другой моделью. Ну или машина времени. Тексты моделей, вышедших до августа, не помечены до сих пор.