Описание: Anthropic внедряет скрытый статистический водяной знак в модели Claude для идентификации текстов, созданных искусственным интеллектом. Метод не добавляет символы и не влияет на качество текста.
Вскоре тексты, написанные нейросетью Claude, можно будет распознать благодаря встроенному скрытому водяному знаку. Компания Anthropic разработала технологию, которая не требует видимых символов, специальных отметок или изменений метаданных. Читатель не заметит никаких отличий, но человек с доступом к специальному ключу сможет определить степень вероятности участия Claude в создании текста.
Эта инициатива реализуется в соответствии с европейским законодательством об искусственном интеллекте. В июле 2026 года Anthropic вместе с другими компаниями подписала Кодекс практики по открытости контента, сгенерированного ИИ. Механизм маркировки будет применяться по всему миру, так как компания не может ограничить его действие только европейскими клиентами.
Система работает по другому принципу, чем обычные подписи на фотографиях. Во время генерации текста Claude последовательно выбирает каждый следующий токен из доступных вариантов. Когда несколько слов одинаково подходят по смыслу, обычная модель выбирает их случайно. Водяной знак изменяет механизм случайного выбора, связывая его с секретным ключом и контекстом предыдущих слов.
В результате длинный текст получает скрытый статистический паттерн. Слова остаются обычными, без каких-либо скрытых кодов. Специальный детектор, имея доступ к ключу, может оценить, насколько выбор слов соответствует работе Claude с активированным водяным знаком. Технология основана на методе SynthID-Text, разработанном Google DeepMind и описанном в журнале Nature в 2024 году.
По результатам внутреннего тестирования Anthropic, эта система не влияет на качество, понятность или творческий потенциал модели. Технология также была опробована на части трафика Gemini. Google DeepMind не выявила значительных различий в оценках пользователей между текстами с водяным знаком и без него. Система не создает дополнительные токены, поэтому стоимость генерации не возрастает, а замедление работы минимально.
Водяной знак не содержит информации о пользователе, организации или конкретной переписке. По найденной метке невозможно определить, кто выполнил запрос и из какого аккаунта был получен текст. Детектор может только указать на вероятность того, что Claude участвовала в создании фрагмента.
У этого метода есть существенные недостатки. Короткие тексты сложнее проверить с высокой надежностью. В информационных ответах диапазон выбора слов тоже ограничен. Когда Claude пишет точное название, например "Principia Mathematica" Ньютона, модель не может заменить нужное слово другим ради сохранения водяного знака. Аналогичные трудности возникают с исходным кодом, математическими формулами и другими фрагментами, где каждое слово влияет на правильность.
Наименее эффективен водяной знак при незначительном редактировании текста человеком. Если пользователь просит исправить несколько ошибок и знаков препинания, Claude изменяет слишком мало слов, чтобы детектор уверенно обнаружил характерную последовательность. При переводе результат обратный. Модель переформулирует практически каждое слово, поэтому переводной текст получает полноценный водяной знак.
Эта защита также уязвима для переписывания. Небольшое редактирование, по мнению Anthropic, обычно не полностью стирает сигнал, но полная переработка текста его уничтожит. При этом детектор не сможет различить текст, полностью написанный Claude, и материал, который модель значительно переработала.
Пока обычные пользователи не смогут проверять тексты самостоятельно. Anthropic разрабатывает отдельный API для обнаружения водяных знаков и обещает поделиться подробностями позже. Ранние версии Claude, выпущенные до 2 августа 2026 года, получат переходный период. Компания планирует постепенно добавить маркировку для них в течение нескольких месяцев.
Для изображений и других типов файлов Anthropic применила другую стратегию. Файлы PNG, JPG и SVG, созданные или изменённые Claude, будут содержать криптографически подписанные данные C2PA в служебной информации файла. Такая подпись указывает на участие Claude, но не меняет саму картинку и не сохраняет данные о пользователе.
В итоге существующие сервисы, пытающиеся определить происхождение текста по языковому стилю и типичным выражениям нейросетей, встречают совершенно иного противника. Водяной знак Anthropic анализирует не типичный язык Claude, а скрытую статистическую последовательность выборов, внедренную во время генерации. Хотя этот метод не может окончательно доказать авторство, длинные, практически неотредактированные тексты станет значительно проще связать с Claude.
