← На главную

Anthropic ставит водяные знаки на тексты Claude, критики: портит

16.08.2026 21:53 · hackernews

Anthropic объявила, что все модели Claude по всему миру начнут «водяные знаки» на всём генерируемом тексте — во исполнение EU Code of Practice. Сначала компания не объяснила механизм, и автор предположил невидимые Unicode-символы. Но оказалось, это семантическая стеганография: при генерации каждого токена модель слегка перекашивает выбор в сторону «зелёного» или «красного» списка слов. По статистике отклонений можно потом с определённой вероятностью сказать, что текст сгенерирован именно Claude. Ключи секретные, поэтому проверять способна только Anthropic. Чем длиннее текст, тем надёжнее детект.

Главная претензия: это портит текст. Синонимы не совпадают по смыслу, а модель должна выбирать лучшее слово, а не слово из списка ради маркировки. Anthropic заявляет, что качество не страдает, но по определению алгоритм иногда должен выбрать худший вариант. Автор возмущается, что даже приватные переписки с Claude будут искажены. Про EU-регламент: правило касается текста длиннее 200 токенов, требует запрета на удаление маркировки и устойчивости к скриншотам, OCR, пересказу. Падолси называет это слабой защитой слабого закона, а его сервис Declaude снимает метку одной вставкой.

Google уже делает похожее: SynthID в Gemini. В статье из Nature утверждается, что разница незаметна — лайки и дизлайки отличаются на сотые доли процента. Но автор не верит: оценки по кнопкам не показывают ухудшение, а пример с бананами и ананасами как раз доказывает, что выбор слова искажается. Правка текста человеком — отдельная беда: если Claude лишь слегка отредактировал текст, его вклад может оказаться достаточным для ложного обвинения, что всё сгенерировано. Код почти не маркируется, а вот проза — да.

Anthropic ссылается на EU AI Act и говорит, что нет способа включать маркировку только для ЕС, поэтому она глобальная. Автор не верит: компания готовится к IPO на $2 трлн, а не может ограничить регион? OpenAI лишь туманно обещает provenance signals. Другие авторы называют стратегию Anthropic «агрессивно враждебной писателям» и «ядом». Водяной знак переживает даже перевод на другой язык, так что копирование цитаты с сайта может пометить твой собственный текст как ИИ-сгенерированный.

Читать оригинал →