
2.08.2026 года, в день когда в ЕС реально завелась статья 50 AI Act, Anthropic сделала ход конём: с этого дня каждый текст, который выдаёт свеженькая модель Claude, тащит в себе невидимую метку. (Не пиксель или строчку метаданных в углу, а метку, вплетённую прямо в сам выбор слов) Это подали как жест прозрачности: мол, вот вам транспарентность(как просили).
Не прошло и суток, как в гитхабе набрал обороты проект, обещающий эту метку стереть. За ним — ещё десяток.
А неделю спустя независимое издание констатировало: доказать, что хоть один из них реально работает, не может никто (ни авторы ни сама Anthropic).
Эта статья – о том, почему это не баг и не провал маркетинга, а неизбежное следствие того, как устроена технология. И заодно — почему у истории куда более длинная борода, чем у чат-ботов: первые водяные знаки придумали за семьсот с лишним лет до GPT.

Что произошло
Anthropic подписала Кодекс практики по прозрачности ИИ-контента — добровольный и признанный Еврокомиссией «адекватным» способ соответствовать статье 50 AI Act. Под каток новых правил попали все свежие релизы, включая флагманский Opus 5 и более легковесный Sonnet 5.
Компания взяла на себя четыре обязательства, и на официальной странице поддержки Claude они прописаны по пунктам. Чтобы было понятно, насколько Anthropic всё продумала:
Обязательство |
Что это значит на практике |
|---|---|
Новые модели маркируются с первого дня |
Модели Claude, запущенные в ЕС 2 августа 2026 года или позже, поддерживают маркировку сразу при релизе |
Маркировка работает везде |
Метки применяются к выводу на Claude Platform (API), приложения Claude, Claude Code, Claude Cowork и Claude Tag — и вообще везде, где доступен Claude, по всему миру |
Будет инструмент детекции |
Anthropic обещает помочь пользователям и третьим лицам обнаруживать метки, детали — «в будущей документации» |
Старые модели — в процессе |
Для моделей до 2 августа действует переходный период |
Механизм двухслойный. Для сгенерированного текста это невидимый водяной знак, вплетённый на уровне модели. Для файлов (.svg, .png, .jpg) — подписанные метаданные по открытому стандарту C2PA, тому самому, что уже юзают в фотожурналистике для проверки, не подделан ли кадр.
Важная деталь, которую многие пропускают: Anthropic не ограничилась Евросоюзом. Хотя закон требует этого только от контента для европейских пользователей, метка теперь применяется везде — в США, Азии. Ход не то чтобы бескорыстный, скажем прямо: поддерживать две параллельные версии модели, с меткой и без, — та ещё боль для инженеров. Проще сделать один продукт для всего мира. Но выглядит это красиво, и об этом уже написали все, от TechCrunch до SiliconANGLE.
Как вообще можно спрятать метку в тексте без пикселей
Первая реакция любого нормального человека на фразу «невидимый водяной знак в тексте»: Погодите, это как вообще?! У изображения есть пиксели, в них можно спрятать сдвиг яркости на одну единицу — глаз не заметит, а алгоритм считает. У текста НЕТ пикселей. Есть только буквы, и они у всех на виду, блин.
Разгадка в том, что модель никогда не “печатает” текст, как машинистка. Она на каждом шаге держит в голове список кандидатов на следующее слово — с вероятностями. Вот в этом зазоре, между несколькими одинаково уместными словами, и существует технология.
Секретный ключ, известный только Anthropic, на каждом шаге делит список кандидатов на две произвольные группы — условно «зелёные» и «красные» — и слегка подталкивает модель выбирать из зелёных чуть чаще, чем предписывает случайность. Не запрещает красные — просто чуть занижает им шанс, так, незаметно. Один такой выбор — шум, ни о чём не говорящий. Но за тысячу слов текста накапливается статистическое смещение, которое у человека, не знающего ключа, просто невозможно случайно повторить с такой регулярностью.
Кто-то сравнил это с игральным кубиком: после двух бросков нельзя сказать ничего, но если из тысячи бросков шестёрка выпадает подозрительно часто — вот тебе и подкрутка.

Технология эта не изобретение Anthropic — открыл её ещё коллектив Kirchenbauer et al. в 2023-м, а до массового производства довёл Google со своим SynthID, который метит текст, изображения, видео и даже аудио в Gemini ещё с 2024 года. У OpenAI, кстати, есть собственная похожая разработка авторства Скотта Ааронсона — просочилась из его блога ещё в бытность работы над безопасностью в OpenAI, но публично так и не задеплоена в ChatGPT.


Anthropic технические детали своей реализации (хэш-функцию, долю «зелёных» токенов, политику ротации ключей) не раскрыла. Выглядит как элемент безопасности («security by design»), но по факту это ровно то же самое, что заставило независимых исследователей строить свои реконструкции по аналогии с SynthID, а не по прямому описанию.

Бумага из Фабриано
Тут будет уместно вспомнить одну штуку, которая делает всю историю куда объёмнее, чем кажется. Идея «спрятать метку так, чтобы её не увидел глаз, но мог считать посвящённый» — не изобретение века нейросетей, отнюдь. В 1282 году бумажные мельницы итальянского городка Фабриано начали вдавливать в мокрую бумажную массу крошечные символы — рог, крест, три горы. В обычном свете их не видно. Только если поднести лист к свету, силуэт проступает.
Разница принципиальная, и в ней, собственно, вся суть современной дискуссии. Мельник в Фабриано ставил подпись добровольно — он ручался за качество своего листа, и покупатель знал, к кому идти с претензией, если бумага окажется бракованной. Водяной знак был обещанием мастера. А метка, которую сегодня вплетает Claude, работает наоборот: это след, оставленный без ведома того, кто пишет. Она ничего не гарантирует про качество и достоверность текста. Она говорит только одно: этот текст (или часть его) прошёл через конкретную систему. Вот так-то.
И раз уж заговорили про шпионские штуки: уместно вспоминают и Гистиея, который обрил голову курьеру, вытатуировал послание на коже его черепа и отправил в путь, дождавшись, пока волосы отрастут заново. Стражники ничего не нашли, потому что искали письмо, а не гонца. Прямая параллель с современными невидимыми метками — только раньше секрет прятал сам отправитель ради собственной защиты, а сегодня секрет прячут от автора текста третьи лица. Ну не чудо ли?
Паника, мемы, злость
Как только новость разлетелась, соцсети взорвались в лучших традициях жанра.
На Reddit разгорелась настоящая битва мнений. В r/artificial называли новую систему маркировки «заговором, призванным навредить пользователям чат-ботов по всему миру» . Логика автора такая: продвинутый пользователь легко скроет следы использования ИИ, а вот обычный студент, который просто попросил Claude переформулировать абзац, или журналист, попросивший ужать двухсотстраничную стенограмму — попадётся. Цифровая татуировка на лбу.
Отдельная линия критики — этическая, и её тоже стоит проговорить честно. Пользователь, назвавший маркировку неэтичной и отвратительной задал вопрос, который на самом деле неглупый: если я дал промпт, контекст, приоритеты и десятки итераций правок, а Claude был лишь инструментом — на что именно претендует метка, когда её ставят на сгенерированный код? Вопрос авторства в эпоху copilot- подобных инструментов — штука реально мутная, и однозначного ответа тут нет ни у кого, включая саму Anthropic.
Взломал ли опенсорс защиту?
Вот здесь притормозим, потому что заголовки коварны.
«Community responded in 24 hours» — да, буквально в течение суток на GitHub появился watermarks-remover от Гийома Мейера, основателя Memo. Штука реально взлетела: больше 4500 звёзд.
Но вот что важно: автор признался сам — на текущий момент инструмент чистит только юникодный мусор и метаданные файлов, а не сам статистический водяной знак. Стирание настоящей метки, по его словам, «может появиться позже», но пока не готово. В README к проекту он идёт дальше и объясняет, почему полноценный «магический ластик» — вообще идея сомнительная: чтобы стереть статистическую метку, нужно переписать значительную часть текста через другую модель, а это заменяет словарный выбор дорогой топовой модели на выбор более дешёвой — и итоговое качество ограничено потолком той самой более слабой модели. Зачем платить за премиум-модель, если потом всё равно прогонять её вывод через что-то похуже? НУ СЕРЬЁЗНО?
Появились и коммерческие сайты-однодневки — claudewatermark.com, claudewatermark.rip, gptcleanup.com, claudewatermarkremover.app — обещающие «чистый, недетектируемый текст». Крупный сервис StealthGPT, который в принципе специализируется на обходе детекторов, добавил себе страницу про удаление меток Claude. Другой сервис, Human Writes, честно продающий обход Turnitin и GPTZero для студенческих работ, тоже подключил Claude в список поддерживаемых, при этом в подвале сайта скромно приписав, что использовать его нужно «в соответствии с политикой академической честности». Да, примерно как продавать отмычки с гарантией «только для законного вскрытия собственной двери». Ага, конечно.
Ключевая мысль: НИ ОДНО из заявлений об эффективности удаления метки нельзя сейчас проверить, потому что Anthropic не опубликовала детектор. Проверять снятие метки попросту НЕ С ЧЕМ — эталона нет ни у кого, кроме самой компании.
Паскуале Пиллитери, вместо того чтобы верить обещаниям в README, склонировал главные проекты и прочитал сам код. Итог неутешительный: один из популярных текстовых «чистильщиков» пропустил самый распространённый способ скрытой закладки насквозь — скрытая полезная нагрузка декодировалась обратно целиком уже после того, как инструмент якобы почистил текст.
Пока что рынок «удалятелей меток» — это в основном чистка Unicode-мусора иметаданных файлов (тоже реально работает, но метаданные и без всякого хака слетают при любой пересохранении или скриншоте). А до настоящего статистического водяного знака добраться пока не удалось никому доказуемо — просто потому что нечем измерить успех. C’est la vie.
Так почему же водяные знаки в тексте в принципе так уязвимы
А вот здесь начинается настоящая физика вопроса. Дело не в том, что кто-то плохо спроектировал систему Anthropic. Ведь у текстовых водяных знаков есть фундаментальное ограничение.
Каждое слово получает свою «зелёную» или «красную» окраску на основе небольшого контекста — обычно нескольких предыдущих слов. Это значит, что метка живёт исключительно в непрерывных кусках оригинальной формулировки. Стоит переформулировать фразу — контекст меняется и старая окраска слова больше не действует. Метка не «размазывается» по смыслу, она в буквальном смысле привязана к конкретным словам в конкретном порядке.
Один из авторов declaude, протестировал это на открытых реализациях (схемы KGW и EXP из библиотеки MarkLLM) и получил проверяемую цифру: после полного переписывания смысла своими словами выживает примерно 0,5% исходных «окон» текста, а точность детектора падает с почти стопроцентной до банального подбрасывания монетки. Вот, собственно, наглядная табличка, что происходит с меткой при разных способах удаления:
Метод удаления |
Что происходит с меткой |
|---|---|
Лёгкая правка (пара слов) |
Метка ослабевает, но легко восстанавливается — детектор снова уверенно распознаёт текст примерно после 800 токенов (около 600 слов) |
Перевод на другой язык и обратно |
Метка практически полностью теряется |
Полное переписывание смысла своими словами |
Метка стирается почти целиком — 0,5% сохранившихся окон контекста |
Перефразирование через слабую LLM |
Метка стирается, но качество текста падает до уровня модели-прачечной |

Но чтобы не скатиться в другую крайность, и тут тоже не всё так однозначно —. Команда Kirchenbauer et al. в своей работе для ICLR 2024 показала обратное: при определённых условиях сигнал держится куда устойчивее, чем интуитивно кажется — оставаясь детектируемым в среднем после примерно 800 токенов даже при сильном перефразировании человеком, а не машиной. То есть лёгкая правка своими руками — совсем не гарантия чистоты. Парадокс в том, что чем устойчивее метка к редактуре (что вроде бы хорошо для надёжности системы), тем выше риск, что она прилипнет к тексту, смысл которого уже сильно изменился — вплоть до клеветнического или ложного. Это подметили ещё Pang и коллеги на NeurIPS 2024: робастная метка может «переехать» на текст с несколькими точечными изменениями и остаться пришитой к контенту, который уже не отражает оригинал.
Ещё есть чисто математическая слабость небольших и «жёстких» текстов. Если у модели на каждом шаге реально есть выбор из нескольких равноценных слов — метку спрятать легко. А вот в коде, в таблицах, в списках дат, в имени, которое пишется ровно одним способом — выбирать особо не из чего. Меньше развилок — меньше места для сигнала. Поэтому короткий твит или строчка кода почти никогда не несёт надёжной метки, а вот длинное эссе — почти всегда (ну или почти).
Один из авторов провёл свлй эксперимент: сгенерировал у Claude Sonnet 5 пару абзацев про своих котов, прогнал через сторонний детектор Pangram — и получил вердикт «100% написано человеком». Захватывающая иллюстрация того, насколько это всё пока далеко от «безупречной технологии слежки», которую рисуют паникующие скриншоты в соцсетях.


Для сравнения — вот как выглядит принцип работы конкурирующей технологии Google, SynthID, с которой чаще всего сравнивают подход Anthropic:
(Официальное видео Google DeepMind про SynthID)
Независимый бенчмарк WaterPark дал ещё более наглядные цифры: SynthID-Text от Google распознавала нетронутый текст в 99,8% случаев. Но стоило прогнать тот же текст через один-единственный проход перефразирования — точность обнаружения по всем протестированным методам рухнула ниже 30%. Отдельное июльское исследование пошло дальше: после лёгкого переписывания, сохранившего смысл, два из тестированных методов не поймали вообще ничего — ровно ноль процентов.
(SynthID-детекция)
Удалением сигнала через «атаки»
Раз уж заговорили про снятие меток — стоит упомянуть работу под названием RLCracker, которая наделала шума ещё в 2025 году. Авторы обучили относительно небольшую модель на сотне примеров, без доступа к самой системе детекции, и заявили об удалении сигнала в 98,5% исследованных текстов — причём атака сработала сразу против десяти разных схем маркировки. Цифра впечатляющая, но интереснее не она сама, а скорость: закон обсуждают и согласовывают годами, а способ обойти техническую защиту иногда появляется через считаные недели после её внедрения. У того, кто хочет обмануть систему, есть встроенное преимущество — можно наблюдать за поведением системы и подстраиваться под неё, пока защита остаётся статичной.
Тут поневоле вспоминается вечный цикл «замок — отмычка — новый замок». Только вместо стальных дверей — миллиарды токенов текста, и вместо фомки — другая нейросеть.
Что всё это значит
Метка не значит «написано ИИ» — она значит «прошло через ИИ». Это КРИТИЧЕСКАЯ разница, и сама Anthropic прописала её в списке ограничений. Если вы попросили Claude вычитать грамматику в собственном тексте, перевести абзац или сделать суммаризацию документа — метка появится, даже если идеи, структура и сама суть текста целиком ваши. Обработка — это не авторство.
Отсутствие метки тоже ничего не доказывает. Модели до 2 августа 2026 года маркировки не имеют. Модели до 2 августа 2026 года маркировки не имеют. Альтернативные фронтиры, такие как Grok 4.6 или Qwen3.8 Max, пока тоже не внедрили подобные глобальные схемы. Сильно отредактированный, переведённый или смешанный с другим текстом контент может потерять метку естественным путём— просто в силу того, как устроена сама технология.
Короткие тексты почти не маркируются надёжно. Твит, заголовок, комментарий — статистике банально не хватает объёма, чтобы отличить настоящий сигнал от случайного шума.
Файлы — совсем другая история, чем текст. Изображения, PDF, презентации получают C2PA-метаданные — это открытый, проверяемый стандарт, но он слетает от банальной пересохранки, конвертации формата или простого скриншота. То, что работает для картинки, не работает для текста, и наоборот.
Вместо заключения
И, возвращаясь к мельникам Фабриано: возможно, самый честный вывод из всей этой истории в том, что мы путаем два разных вопроса. Мы хотим знать, “писала ли это машина’ — но метка отвечает лишь на вопрос, что происходило внутри одной конкретной сессии одного конкретного инструмента. Кто придумал идею, кто выстроил аргумент, кто в итоге готов поставить своё имя под текстом и нести за него ответственность — эти вопросы метка никогда не решала и не решит. Она сигнал, а не подпись. И пока индустрия не разберётся, чего именно она хочет от «прозрачности» — процесса или ответственности, — водяные знаки так и останутся символическим жестом, который приятно провозгласить в пресс-релизе и почти невозможно довести до состояния настоящей защиты. Sapienti sat, как говорится.
Источники и дальнейшее чтение
Скрытый текст
How Claude marks AI-generated content — официальная документация Anthropic
AI ‘watermark removers’ flood the web. Almost none can prove they work — BleepingComputer
How AI text watermarking works — интерактивный разбор на declaude.org
Putting Claude’s watermarking to the test — независимое тестирование
The Watermark and the Stigma — исторический и этический разбор
Claude Got Invisible Watermarks. The Open-Source Community Responded in 24 Hours
Kirchenbauer et al., A Watermark for Large Language Models (ICML 2023)
Kirchenbauer et al., On the Reliability of Watermarks for Large Language Models (ICLR 2024)
Pang et al., No Free Lunch in LLM Watermarking (NeurIPS 2024)
Комментарии (19)

Sap_ru
14.08.2026 20:05Если метка появляется при проверке грамматики, то - хе-хе - её можно выделить и научиться удалять (достаточно найти небольшой процент слов к которым "таготеет" ИИ.
Вы просите ИИ проверить грамматику, а он начинает заменять слова синонимами - это должно очень неплохо статистически детектироваться.

Notrado
14.08.2026 20:05Нейронка что-то напридумывала. Не Геродоту обрили голову, а Геродот в своей «Истории» сообщает о таком (книга 5):
«Все эти опасения внушили Аристагору мысль поднять восстание против персов. А как раз в это время прибыл к Аристагору из Сус вестник от Гистиея (на голове у вестника были написаны письмена) с советом отложиться от царя. Ведь Гистией желал склонить Аристагора к восстанию, но не мог найти другого безопасного способа [передать свой совет], так как все дороги [из Сус] охранялись.
Тогда Гистией велел обрить голову своему верному слуге, наколол на голове татуировкой знаки, а затем, подождав, пока волосы отрастут, отослал его в Милет. Гистией дал слуге только одно поручение: прибыв в Милет, просить Аристагора обрить ему волосы и осмотреть голову. Знаки же на голове слуги, как я уже сказал, призывали к восстанию».

Master_AI Автор
14.08.2026 20:05Спасибо! На самом деле там сначала было правильно, но при редактуре решил убрать некоторые слова предложения, получилась опечатка)

mc_introvert
14.08.2026 20:05Меня в этой истории смущает вот что. Если после переформулирования выживает 99,5% сигнала, то метку получит и тот текст, который человек честно переписал под себя.
У нас на профильных площадках сейчас правила вида «сгенерированное нейросетью без существенной переработки — бан». И вот сидишь, переписываешь абзацы своими словами, добавляешь свои замеры и примеры — а с точки зрения детектора это всё ещё «прошло через ИИ». Формально верно, по сути нет.
Получается, метка отвечает на вопрос «касался ли текст модели», а площадкам нужен ответ на другой — «есть ли тут работа автора». Это разные вещи, и подменять одно другим будет больно именно тем, кто пользуется ИИ как редактором, а не как генератором.

shirsb81
14.08.2026 20:05На некоторых форумах даже запрещено этим заниматься (редактирование любым образом через ИИ.), если вы про проверку орфографии/пунктуации, то как-будто бы сейчас лучше дать текст ИИ на проверку именно, и вручную уже самостоятельно исправлять ошибки. (Имхо додумают ещё как и в пунктуацию засунуть ИИ-метки)

pushistikovdelavega
14.08.2026 20:05А смысл? Дать этот текст зарерайтить другой ИИ и метки разваляться.

sol369
14.08.2026 20:05Ну так в тексте был аргумент, типа зачем писать дорогой моделью, если потом переписываете не клаудом, который плохой.

InsiderCrush
14.08.2026 20:05Ну вот я статью пишу, дал, например, проверить ошибки и запятые. Куда там прятать такую метку? Я модели строго запретил менять слов и мой стиль. Кто в курсе?

alrei4
14.08.2026 20:05На вскидку через тире и кавычки кодировать слово или знак. Порядок и расположение символов, число переносов и пробелов тоже могут быть меткой.

kenomimi
14.08.2026 20:05Большой вопрос - зачем все это... Ответы нейросети сохраняются у провайдера всегда. Дальше публичная форма типа антиплагиата, с нечетким поиском и десинонимайзером - если, условно, две трети текстов совпало, значит "оно наше". И никакой автоматический рерайт не скроет похожесть текста.
А вот эта метка - security by obscurity, сейчас все из любопытства ринутся ее искать, и найдут, конечно же.

CAHbKA_IV
14.08.2026 20:05Разгадка в том, что модель никогда не “печатает” текст, как машинистка. Она на каждом шаге держит в голове список кандидатов на следующее слово — с вероятностями.
На самом деле не слово, а токен. Соответственно, не зная словаря токенизатора реверс описанной системы фактически невозможен. Непонятно, к каким наборам символов привязываться при расчёте вероятностной метки. Токенами могут быть как буквы и слоги, так и слова, а в теории даже и целые абзацы...

vLaZoV
14.08.2026 20:05Опенсорс-сообщество попыталось взломать уже через 48 часов
What took them so long?

oYASo
14.08.2026 20:05Не уверен, что это в конечном итоге будет хорошо реализовано.
Дело в том, что все эти Anthropic и прочие OpenAI как будто пока не смогли побороть обратную проблему - генерировать текст, который будет максимально похож на текст, который пишет человек. Шутки про длинное тире и списки всем уже давно известны, и для многих это явные маркеры. Но даже просто текст часто написан так, как человек не напишет в email или в отчете каком-то. Вот как со скриншота - я крайне сомневаюсь, что вне каких-то специфических отчетов люди будут писать про substantial проблемы.
Так что даже сейчас нужно приложить значимые усилия, чтобы текст выглядел относительно похожим на то, что мог написать человек. У тех, кто работает с текстом, точно будет какая-то большая и строгая инструкция, которую скорее всего будет тяжело обойти всем этим ватермаркам. Что уж там, если от инъекций даже еще не полностью вылечились.

Lastor
14.08.2026 20:05Есть тут какая-то логическая западня.
Почему люди ищут в тексте признаки ИИ?
Потому что сгенерированный текст недостаточно качественный.
Что делает его некачественным?
Признаки ИИ.
Error: циклическая зависимость.
Если текст плохой, какая разница из-за ИИ он плохой или нет. А если хороший, то какая разница ИИ это или нет?
kenomimi
14.08.2026 20:05Кроме качества, которое сейчас весьма спорное, есть чисто социальный момент.
Во-первых, часть кожаных еще обладает первобытным мистическим мышлением - у них сделаное человеком вручную "имеет душу".
Во-вторых, еще большей части кожаных важен не сам продукт, а хайп вокруг него, авторитет, который его создал, либо "понтовая" география происхождения. Были эксперименты, когда в крупные сообщества набрасывали якобы работы ИИ, их бешено хейтили, а потом автор раскрывал правду - это не ИИ, а известный художник прошлого. Или еще - налейте в бутылку от сверхдорого именитого вина обычный масс-маркет, и вам 99 из 100 выдадут тираду про "отчетливый запах виноградников маленькой итальянской деревушки с милыми домиками"... ИИ не может быть авторитетом, потому его хейтят.
В-третьих, ИИ вызвал сильный передел рынка, и "старички", плотно сидящие на какой-то теме, почувствовали, что у них из-под задницы выбивают стул. Само собой, они начали протестовать и плеваться ядом. Плюс задело часть корпораций, которые включили машину пропаганды на полную можность, пытаясь отсрочить уход прибыли из своих рук. Две трети якобы негатива против ИИ - заказной спам за авторством крупных холдингов по производству контента, чтобы скандалами оттянуть сроки прихода ИИ и получить время на перестройку процессов. Примерно та же история, как хайп "опасности ГМО", который подняли агрохолдинги в свое время...
Foreststander
“В американскую школу дети запустили трёх свиней, с номерами 1, 2 и 4. Полиция неделю искала свинью с номером 3”