Anthropic будет встраивать скрытую цифровую подпись в каждый текст и файл, созданный моделями Claude. Этот шаг направлен на соблюдение новых правил прозрачности ИИ в Европейском союзе. Изменение вступает в силу для всех моделей, выпущенных после вступления в действие Кодекса прозрачности EU AI Act 2 августа, и будет автоматически применяться во всех интерфейсах Claude: API, Code, Cowork и Tag.

Почему правила ЕС имеют значение

Кодекс прозрачности обязывает разработчиков помечать контент, созданный или отредактированный ИИ, чтобы последующие системы могли распознать его синтетическое происхождение. Правило направлено на борьбу с дезинформацией и предоставление пользователям четкого сигнала о том, что они имеют дело с материалом, созданным машиной. Ответ Anthropic — внедрение водяных знаков на уровне модели — позволяет помещать маркер непосредственно в результат работы, а не просто добавлять его в пользовательский интерфейс продукта.

Другие гиганты в сфере ИИ дают аналогичные обещания. Google, Meta, Microsoft, OpenAI и Black Forest Labs заявили, что будут соблюдать стандарты ЕС. Для нетекстовых активов Anthropic будет использовать открытый стандарт C2PA — публично документированный метод встраивания данных о происхождении в изображения, видео и другие медиафайлы. Следуя открытой спецификации, Anthropic надеется, что их маркировка будет совместима с инструментами, которые уже используют журналисты, платформы и фактчекеры.

Как работает водяной знак

Anthropic утверждает, что водяной знак встроен непосредственно в процесс генерации текста моделью. На практике подпись становится частью потока токенов, который выдает модель. Когда пользователь копирует текст в текстовый редактор, электронное письмо или пост в социальных сетях, скрытый паттерн перемещается вместе с ним. Компания отмечает, что водяной знак может сохраниться даже при умеренном редактировании, но не раскрывает, сколько символов должно измениться, прежде чем метка исчезнет.

Опасения по поводу «Claudefishing»

Внедрение технологии Anthropic происходит на фоне растущей тревоги по поводу неправомерного использования больших языковых моделей (LLM). Генеральный директор Substack Крис Бест недавно ввел термин «Claudefishing», чтобы описать использование ИИ для создания обманного контента, имитирующего стиль конкретного автора. Поскольку синтетический текст становится всё труднее отличить от написанного человеком, автоматическое определение происхождения становится важнейшим рубежом обороны.

Anthropic не одинока в создании защитных механизмов. Платформа для генерации музыки Suno и сервис рассылок Substack внедрили механизмы маркировки, которые оповещают читателей, если материал был создан ИИ. Встраивая водяной знак в первоисточник, Anthropic стремится сделать так, чтобы сигнал было сложнее удалить и проще распознать последующим фильтрам.

Основные выводы

  • Соблюдение нормативных требований: Anthropic внедряет водяные знаки для соответствия Кодексу прозрачности EU AI Act, который вступил в силу 2 августа.
  • Интеграция на уровне модели: Водяные знаки применяются на уровне модели, поэтому они сохраняются во всех продуктах (API, Claude Code и т. д.) и не исчезают при копировании и вставке.
  • Стандартизированная маркировка файлов: Для файлов Anthropic будет использовать открытый стандарт C2PA, чтобы обеспечить совместимость и прозрачность цифрового контента.