У ИИ-контента из Claude появятся водяные знаки — как это работает? Можно ли будет отследить использование нейросети?

Anthropic начнет помечать весь контент Claude.
В текст встроят невидимый водяной знак, в файлы — подпись в метаданных. Это требование европейского кодекса практик по прозрачности ИИ-контента.
Отвечу на главные вопросы.
- Как Claude будет маркировать контент?
- Когда Claude начнет маркировать контент?
- Как технически устроены водяные знаки в ИИ-тексте?
- Становится ли ИИ-текст хуже от маркировки?
- Если перефразировать ИИ-текст, водяные знаки пропадут?
- Можно ли проверить сгенерированный код на водяные знаки?
- Как будет работать детектор Anthropic?
Как Claude будет маркировать контент?
Чтобы соблюсти кодекс практик Евросоюза по прозрачности контента, Anthropic вводит два вида маркировок.
Водяные знаки в тексте. Модель будет добавлять невидимые человеческому глазу отметки в текст. По словам компании, они остаются при копировании текста и частично при редактировании.
Подпись в метаданных картинок. Их будут добавлять в файлы форматов SVG, PNG и JPG. Водяной знак позволит определить, был ли файл обработан в Claude, и проверить, вносили ли в него изменения.
Дальше расскажу именно про водяные знаки. С метаданными все проще: они либо есть в файле, либо нет.
Когда Claude начнет маркировать контент?
Маркировка появится в новых моделях Claude, выпущенных после 2 августа 2026 года. То есть если Anthropic, например, в августе или сентябре представит новую версию Opus или Sonnet — в ней уже должен быть механизм пометки водяными знаками. Если же технологии там не будет, компанию ждут штрафы.
К моменту написания текста компания выпустила последнюю модель 24 июля 2026 года. Так что пока никакие модели не помечают сгенерированные тексты. При этом в Anthropic работают над тем, чтобы встроить маркировку в старые версии. Когда это произойдет, неизвестно.
Когда метка появится, она будет работать везде, где представлены модели Claude: на сайте, в приложениях, в Claude Code и Claude Cowork, а также по API.
Как технически устроены водяные знаки в ИИ-тексте?
Когда говорят о невидимых водяных знаках, многие представляют себе скрытые символы, вшитые в текст: невидимые пробелы, апострофы и так далее. Их легко удалить в любом редакторе за пару секунд. На самом деле речь идет о маркировке на уровне токенов.
Представители Anthropic не рассказывают в подробностях, как будут работать их водяные знаки. Но подобные механизмы уже есть, например Google SynthID. ML-исследователь и технический директор детектора ИИ-текстов GPTZero Алекс Цуй рассказал, как это устроено.

Модель генерирует ответ по одному токену за раз. Перед каждым следующим токеном она берет несколько предыдущих и добавляет к ним секретный ключ — набор символов, который знает только сама компания, например Anthropic. Из этих данных считается хеш. На выходе получается число фиксированной длины, например 8419273.
Это число работает как стартовая точка для генератора случайных чисел. Он проходит по всему словарю модели и делит все токены на два списка: зеленый и красный. Человеку деление кажется хаотичным, но оно задано стартовым числом.
Слова из зеленого списка получают небольшую прибавку к вероятности. Предположим, модель написала фразу «Девушка сидела на» и выбирает, что должно быть дальше. Слово «стул» попало в зеленый список, слово «кровать» — в красный. Поскольку вероятность выбора из зеленого списка выше, нейросеть выбирает «стул». Но когда по контексту больше подойдет красное слово, модель выберет его, а не зеленое, даже если вероятность у того выше.
Дальше все повторяется: текст стал длиннее на один токен, значит, у хеша новое входное число и новая раскладка на красный и зеленый списки. «Кровать», которая была красной, на следующем шаге может оказаться зеленой.
Детектор, у которого есть ключ, проходится по готовому тексту и для каждой позиции восстанавливает ту же раскладку зеленых и красных слов. Дальше он ищет статистический перекос. Например, в тексте 312 зеленых слов из 500 — 62%. Случайно так получиться практически не может, поэтому детектор выдаст вердикт, что текст с высокой вероятностью прошел через нейросеть.
Важно, что текст должен быть достаточно длинным, чтобы его мог проверить детектор. Например, в предложениях «Розы красные, фиалки голубые» или «2 + 2 = 4» вариаций быть не может — вердикт будет неопределенным.
Становится ли ИИ-текст хуже от маркировки?
В соцсетях предполагают, что раз нейросеть для маркировки текста пытается уложиться в конкретный статистический паттерн, это может испортить качество генерации.
В 2024 году Google, которая использует SynthID, провела исследование для оценки качества маркированного ИИ-текста. Его проводили на 20 миллионах ответов нейросети. В одной половине был водяной знак, в другой — нет. Оказалось, что пользователи не видят между ними разницы.
Если перефразировать ИИ-текст, водяные знаки пропадут?
Скорее всего, да. В том же исследовании Google выяснила: если прогнать сгенерированный текст через другую ИИ-модель, маркировку различить уже не получится.
В Anthropic признают: если текст переписать или отредактировать вручную, детектор не распознает его как сгенерированный. По словам Алекса Цуя, маркировку легко обойти, если заметно перефразировать текст. Неважно как — вручную или через бесплатные сервисы.
Как изменение текста влияет на маркировку
| Если сделать это с текстом | Вот что произойдет с водяным знаком |
|---|---|
| Скопировать и вставить в редактор | Ничего, водяной знак останется |
| Внести мелкие правки | Скорее всего, останется |
| Серьезно переработать или переписать | Скорее всего, пропадет |
| Перевести на другой язык | Пропадет |
| Если сделать это с текстом | Вот что произойдет с водяным знаком |
|---|---|
| Скопировать и вставить в редактор | Ничего, водяной знак останется |
| Внести мелкие правки | Скорее всего, останется |
| Серьезно переработать или переписать | Скорее всего, пропадет |
| Перевести на другой язык | Пропадет |
Можно ли проверить сгенерированный код на водяные знаки?
В коде нет такой свободы, как в языке. Название функции нельзя написать иначе. Если попытаться что-то подкрутить, нейросеть может сгенерировать неверный токен и сломать код.
Исследователи из Сеульского университета обнаружили, что существующие способы маркировки на сгенерированном коде не работают именно из-за нехватки вариаций. Они предложили свой метод SWEET, по которому отмечаются только те места, где у модели есть выбор, — в комментариях и названиях переменных.
При этом ученые Шанхайского и Токийских университетов определили: если просто удалить или переписать комментарии к коду, определить его как сгенерированный детекторы уже не смогут.
Какой именно метод будет использовать Anthropic, неизвестно.
Как будет работать детектор Anthropic?
По словам представителей Anthropic, проверять наличие водяных знаков смогут и пользователи, и компании. Когда выпустят детектор и кому конкретно он будет доступен, не раскрыли.
Известно, что детектор будет отвечать на вопрос, есть ли маркировка в тексте или файле. При этом:
- Обнаруженный детектором водяной знак не означает, что текст или код целиком сгенерирован. Его могли написать вручную, а потом прогнать через Claude — например, попросили нейросеть найти ошибки и откорректировать.
- Если метки нет, это тоже не доказывает, что текст или код написаны без участия ИИ. Материал могли переписать после генерации или смешать с человеческим текстом, а метаданные в файлах — удалить.
Для сравнения — детектор Google SynthID закрыт для обычных пользователей. Алекс Цуй предполагает, что, если Anthropic откроет свой публично, люди быстро найдут стратегии обхода. Достаточно будет протестировать разные варианты против детектора.
Мы постим кружочки, красивые карточки и новости о технологиях и поп-культуре в нашем телеграм-канале. Подписывайтесь, там классно: @t_technocult

























