Забавно, как весь твиттер взбудоражился от новости о том, что Anthropic начала помечать невидимыми водяными знаками тексты, которые генерируют их модели. Не в метаданных, а прямо в тексте.
Знак (водяной) не виден глазу, не меняет смысл и качество текста и переживает копипаст. Работает на уровне модели, поэтому помечается всё — от API и приложения до Claude Code и доступа через облака Amazon, Google и Microsoft. А к сгенерированным файлам (.png, .svg, .jpg) теперь вкладывается криптоподпись по открытому стандарту C2PA (как я понял).
Это всё связано с комплаенсом. С 2 августа 2026 года европейский AI Act требует делать ИИ-контент машинно-различимым. Поэтому маркируют пока только модели, запущенные после этой даты, а старые — «в переходном периоде», то есть их тексты никто не помечает.
Как вообще можно спрятать знак в словах?
Anthropic деталей не раскрывает, но у Google похожая штука — SynthID-Text — уже два года работает в Gemini, так что механику можно подсмотреть там.
Например, модель пишет «утром выпил кофе и ___ на работу» и выбирает между «поехал», «пошел» и «отправился». Секретный ключ вместе с несколькими предыдущими словами псевдослучайно делит словарь на «зеленые» и «красные» слова, и модель чуть чаще берет зеленые.
Читатель видит обычный текст. А детектор с тем же ключом считает статистику. Если на тысячу слов зеленых 70% вместо ожидаемых 50%, текст писала модель. Поэтому в Anthropic и предупреждают, что детекция на небольших текстах срабатывать не будет, а вот ресечи, статьи или дипломные работы раскрасит как новогоднюю елку.
Что это значит, если механика похожа на SynthID-Text
Так что если они будут использовать что-то наподобие гугловского SynthID-Text, мы получим следующую историю:
- Списка «слов-маркеров» не существует. Раскраска пересчитывается на каждом слове от контекста, найти знак глазами невозможно.
- Короткие тексты и код почти не маркируются. Статистике нужен объем и свобода выбора между синонимами.
- Знак появится, даже если Claude просто вычитал или перевел ваш собственный текст. Anthropic честно пишет, что watermark не доказывает авторство ИИ.
- Проверить метку сможет только сам Anthropic. Детектор обещают «в будущей документации».
Итого
В общем, все «хуманайзеры» и деслоп-промпты не работают. Они чистят стиль, а знак сидит в статистике выбора слов. Стереть его может только пересказ текста другой моделью. Ну или машина времени. Тексты моделей, вышедших до августа, не помечены до сих пор.