Anthropic یک واترمارک برای متن‌های تولیدشده توسط Claude ارائه کرده است تا الزامات قانون هوش مصنوعی اتحادیه اروپا (EU AI Act) مبنی بر اینکه محتوای مصنوعی باید به شکلی ماشین‌خوان به‌وضوح مشخص شود را برآورده کند. این شرکت می‌گوید این تکنیک بدون کند کردن مدل یا استفاده از توکن‌های اضافی، متن‌های نوشته‌شده توسط هوش مصنوعی را مشخص می‌کند؛ ادعایی که به‌زودی توسط نهادهای نظارتی و رقبا مورد آزمایش قرار خواهد گرفت.

چرا این واترمارک اهمیت دارد

این واترمارک، تصمیمات مربوط به انتخاب کلمات را با استفاده از یک کلید خصوصی و بافتار (context) پیرامون، بذرگذاری می‌کند. خوانندگان نمی‌توانند این الگو را ببینند، اما ابزاری که کلید را می‌شناسد می‌تواند آن را تشخیص دهد. در عمل، یک ابزار پایین‌دستی (downstream) یک سند را اسکن کرده و گزارش می‌دهد که آیا Claude آن را تولید کرده است یا خیر.

فشارهای نظارتی

قانون هوش مصنوعی اتحادیه اروپا، ارائه‌دهندگان سیستم‌های مولد را مجبور می‌کند تا سیگنال‌های قابل تشخیص را در محتوای مصنوعی بگنجانند.

موازنه‌های تجاری

شرکت‌ها هنگام تصمیم‌گیری برای پذیرش چنین علامت‌گذاری‌هایی، با سه دغدغه روبرو هستند:

  • محدودیت‌های ردیابی – واترمارک تأیید می‌کند که متن از یک مدل هوش مصنوعی منشأ گرفته است، اما نمی‌تواند خروجی را به یک کاربر یا حساب کاربری خاص مرتبط کند. این شکاف باعث می‌شود در صورت سوءاستفاده از محتوای تولیدشده توسط هوش مصنوعی، مسئله مسئولیت‌پذیری با ابهام مواجه شود.
  • ریسک درآمدی – برخی از ارائه‌دهندگان بیم آن دارند که واترمارک‌های قابل مشاهده، تا یک‌سوم مشتریان خود را که به دلایل رقابتی یا حریم خصوصی متن‌های بدون علامت را ترجیح می‌دهند، فراری دهد.
  • محدودیت‌های فنی – گنجاندن یک الگو می‌تواند کمی از خلاقیت خروجی مدل بکاهد، به‌ویژه در قطعات بسیار کوتاه که واترمارک کلمات کمتری برای کار کردن دارد. همچنین کاربران می‌توانند با بازنویسی دستی بخش‌هایی از متن، سیگنال را تضعیف کرده و تشخیص آن را دشوارتر کنند.

Anthropic شرط می‌بندد که رویکردش از اکثر این نقاط ضعف جلوگیری می‌کند. این شرکت ادعا می‌کند که با بافتن کلید در فرآیند انتخاب توکن، هیچ جریمه‌ای از نظر تأخیر (latency) و هیچ هزینه اضافی برای توکن‌ها وجود نخواهد داشت و تجربه کاربری مورد انتظار مشتریان پولی حفظ می‌شود.

چالش‌های فنی

قابلیت تشخیص به این بستگی دارد که ابزار تأییدکننده، همان کلید خصوصی استفاده‌شده در زمان تولید را داشته باشد. متن‌های کوتاه همچنان یک نقطه ضعف محسوب می‌شوند، زیرا الگوی آماری در آن‌ها کمتر برجسته است و این امر نرخ منفی کاذب (false-negative) را افزایش می‌دهد. همچنین واترمارک مانع از ویرایش‌های پایین‌دستی نمی‌شود؛ کاربری که نیمی از پاراگراف را بازنویسی کند، می‌تواند به‌طور مؤثری نشان را پاک کند.

نکته کلیدی: واترمارک Anthropic به یک الزام قانونی جدید پاسخ می‌دهد، اما تأثیر آن به این بستگی دارد که چقدر می‌تواند بین قابلیت تشخیص، کاهش انعطاف‌پذیری و خطر دور زده شدن، تعادل برقرار کند.