Anthropic впроваджуватиме прихований цифровий підпис у кожному тексті та файлі, створеному її моделями Claude. Цей крок спрямований на виконання нових правил ЄС щодо прозорості ШІ. Зміни набувають чинності для всіх моделей, випущених після того, як Кодекс прозорості (Transparency Code) в межах Закону ЄС про ШІ (EU AI Act) набув чинності 2 серпня, і вони з'являтимуться автоматично в інтерфейсах Claude API, Code, Cowork та Tag.
Чому правило ЄС має значення
Кодекс прозорості зобов'язує розробників маркувати контент, створений або відредагований ШІ, щоб подальші системи могли розпізнати його синтетичне походження. Правило має на меті стримувати дезінформацію та давати користувачам чіткий сигнал, коли вони мають справу з матеріалом, створеним машиною. Відповідь Anthropic — водяні знаки на рівні моделі — вбудовує маркер безпосередньо у вихідні дані, а не просто додає його в інтерфейс продукту.
Інші гіганти ШІ дають подібні обіцянки. Google, Meta, Microsoft, OpenAI та Black Forest Labs заявили, що дотримуватимуться стандартів ЄС. Для нетекстових активів Anthropic використовуватиме відкритий стандарт C2PA — публічно задокументований метод вбудовування даних про походження в зображення, відео та інші медіафайли. Дотримуючись відкритої специфікації, Anthropic сподівається, що її маркування працюватиме з інструментами, які вже використовують журналісти, платформи та фактчекери.
Як працює водяний знак
Anthropic заявляє, що водяний знак вбудований безпосередньо в процес генерації тексту моделлю. На практиці підпис стає частиною потоку токенів, який видає модель. Коли користувач копіює текст у текстовий процесор, електронний лист або допис у соціальних мережах, прихований патерн переноситься разом із ним. Компанія зазначає, що водяний знак може витримати незначне редагування, проте вона не розкрила, скільки символів має змінитися, перш ніж маркування зникне.
Побоювання щодо «Claudefishing»
Впровадження Anthropic відбувається на тлі зростаючого занепокоєння щодо зловживання великими мовними моделями (LLM). Генеральний директор Substack Кріс Бест нещодавно ввів термін «Claudefishing», щоб описати використання ШІ для створення оманливого контенту, який імітує голос конкретного автора. Оскільки синтетичний текст стає все важче відрізнити від написаного людиною, автоматичне виявлення походження стає критично важливим рубежем захисту.
Anthropic не єдина, хто додає заходи безпеки. Платформа для генерації музики Suno та сервіс розсилок Substack запровадили механізми маркування, які сповіщають читачів, якщо матеріал був створений ШІ. Вбудовуючи водяний знак у джерело, Anthropic прагне зробити так, щоб сигнал було важче видалити та легше обробити фільтрам на наступних етапах.
Основні висновки
- Відповідність нормативним вимогам: Anthropic впроваджує водяні знаки, щоб відповідати Кодексу прозорості Закону ЄС про ШІ, який набув чинності 2 серпня.
- Інтеграція на рівні моделі: Водяні знаки застосовуються на рівні моделі, тому вони зберігаються в усіх продуктах (API, Claude Code тощо) і не зникають під час копіювання та вставки.
- Стандартизоване маркування файлів: Для файлів Anthropic використовуватиме відкритий стандарт C2PA, щоб забезпечити взаємосумісність і прозорість цифрового контенту.
