Anthropic тепер вбудовує прихований статистичний патерн — SynthID-Text — у кожну відповідь Claude. Компанія заявляє, що цей крок відповідає Кодексу прозорості (Transparency Code) Закону ЄС про ШІ (EU AI Act) і дає розробникам можливість довести, що текст був створений моделлю ШІ. Водяний знак зберігається навіть після нескладного редагування, не змінюючи при цьому текст для читачів-людей.
Чому додається водяний знак
Європейські регулятори тиснули на постачальників великих мовних моделей (LLM), щоб зробити контент, створений ШІ, відмінним від текстів, написаних людьми. Кодекс прозорості EU AI Act, який незабаром набуде чинності в усьому блоці, зобов'язує розробників надавати надійний метод виявлення для будь-якого тексту, який створюють їхні моделі. Anthropic відповіла на це, впровадивши технологію SynthID-Text, вперше описану Google DeepMind минулого року.
Це рішення викликало хвилю обговорень у Reddit та X, де користувачі висловили занепокоєння, що водяний знак може погіршити якість результатів або стати «бекдором» для стеження. Anthropic заперечує це, стверджуючи, що патерн невидимий для читачів, не додає затримок (latency) і може бути вимкнений для приватних розгортань. Опублікувавши технічні деталі, компанія сподівається заспокоїти спекуляції та встановити стандарт для галузі.
Як працює SynthID-Text
Традиційні детектори ШІ шукають лінгвістичні особливості — повторювані фрази, дивну пунктуацію або статистичні відхилення від людського письма. Ці сигнали зникають, щойно людина переписує абзац, що робить детектори ненадійними. SynthID-Text, навпаки, вбудовує прихований сигнал під час етапу вибору токенів моделлю.
Коли Claude обирає між двома однаково ймовірними токенами — наприклад, «overcast» (похмуро) проти «grey» (сірий) — система підштовхує рішення до того варіанту, який відповідає попередньо обчисленому бінарному патерну. Протягом усього документа ці підштовхування створюють послідовність бітів, яку пізніше може витягнути detection API. Патерн навмисно має низький вплив: обраний синонім залишається цілком природним словом, тому потік тексту не змінюється. Оскільки водяний знак знаходиться в потоці токенів, а не в поверхневому тексті, він витримує більшу частину подальшої обробки, яка не замінює кожен токен.
Стійкість до редагування: що зберігається, а що ні
Поширеною критикою є те, що користувачі можуть просто відредагувати текст, створений ШІ, щоб видалити водяний знак. Внутрішнє тестування Anthropic виділяє три сценарії редагування:
- Легке редагування — виправлення друкарських помилок, заміна кількох прикметників або зміна порядку речень. Статистична сигнатура водяного знака залишається переважно недоторканою, оскільки більшість токенів не змінюються.
- Інтенсивне редагування за допомогою Claude — використання Claude для переписування чернетки, яка вже містить речення, створені ШІ. Якщо користувач зберігає контроль над більшою частиною формулювань, сигнал водяного знака слабшає пропорційно до обсягу нового тексту, обраного людиною.
- Повне переписування — заміна кожного токена новою генерацією або ручним переписуванням. У такому разі оригінальний водяний знак знищується, але отриманий текст більше не відповідає визначенню «створеного ШІ» згідно з нормами ЄС, оскільки жодного сліду вихідних даних моделі не залишається.
Висновок: водяний знак стійкий до легкого шліфування, але не до повної регенерації контенту.
Генерація коду: де знаходиться водяний знак
Claude широко використовується як помічник у програмуванні, створюючи все: від однорядкових фрагментів до повностекових модулів. Мови програмування залишають мало місця для вибору синонімів; заміна токена, наприклад, «for» на «while», змінить логіку. Тому Anthropic очікує, що водяний знак з'являтиметься майже виключно в тих частинах, де модель має свободу вибору слів — у коментарях, docstrings та пояснювальному тексті, що супроводжує код.
Оскільки функціональна частина коду залишається недоторканою, розробники не повинні помітити зниження коректності або продуктивності. Наявність водяного знака обмежується допоміжним текстом, який допомагає людям зрозуміти код, що задовольняє вимогу прозорості без шкоди для функціональності.
Наслідки для галузі
Anthropic діє не самотужки. Кілька інших розробників LLM підписали той самий Кодекс практики (Code of Practice), який закликає до стандартизованого detection API. Якщо графік впровадження правил ЄС відбуватиметься згідно з планом, водяні знаки можуть стати стандартним рівнем у стеку LLM, подібно до того, як шифрування є стандартом для передачі даних сьогодні. Компанії, які ігноруватимуть цю вимогу, ризикують отримати штрафи, втратити доступ до ринку Європи або бути змушеними припинити надання своїх послуг.
Суперечливі моменти
Критики стверджують, що прихований підпис, навіть якщо він невидимий, може бути використаний для відстеження або атрибуції поза межами відповідності нормативним вимогам. Вони також побоюються хибнопозитивних результатів: API виявлення, який помилково маркує текст, написаний людиною, може підірвати довіру до платформ, що покладаються на цей сигнал. Anthropic визнає ці ризики та заявляє, що алгоритм виявлення буде з відкритим вихідним кодом, що дозволить проводити незалежні аудити та калібрування.
Ще одним практичним занепокоєнням є обчислювальні витрати на створення водяного знака. Anthropic повідомляє, що додаткова обробка додає менше ніж частку відсотка до часу інференсу, і це твердження незабаром перевірять сторонні бенчмарки.
На що варто звернути увагу далі
- Впровадження API – Anthropic планує випустити публічну кінцеву точку, яка витягує прихований бітовий патерн із будь-якого результату Claude. Розробники зможуть інтегрувати цю перевірку в конвеєри модерації контенту.
- Зусилля зі стандартизації – Регуляторні органи та галузеві групи розробляють спільний формат метаданих водяного знака, що може полегшити міжмодельне виявлення.
- Емпіричні дослідження – Незалежні дослідники починають перевіряти стійкість SynthID-Text до інструментів зловмисного перефразування. Їхні висновки визначать, наскільки платформи зможуть довіряти цьому сигналу.
Підсумок
Впровадження SynthID-Text компанією Anthropic надає AI-спільноті конкретний інструмент для відповідності майбутнім європейським правилам прозорості, зберігаючи при цьому якість результатів Claude. Водяний знак зберігається під час звичайного корегування, але зникає, коли текст повністю перегенеровується, і він розміщується в не-кодових частинах програмного виводу, де не заважає функціональності. Те, чи стане цей підхід галузевою нормою, залежить від того, наскільки ефективно API виявлення працюватиме в реальних умовах і чи вдасться вирішити питання приватності та хибних тривог.
