Anthropic sẽ nhúng một chữ ký số ẩn vào mọi văn bản và tệp tin do các mô hình Claude của mình tạo ra, một động thái nhằm đáp ứng các quy định mới về tính minh bạch AI của Liên minh Châu Âu. Thay đổi này có hiệu lực đối với tất cả các mô hình được phát hành sau khi Bộ Quy tắc Minh bạch của Đạo luật AI EU có hiệu lực vào ngày 2 tháng 8, và nó sẽ xuất hiện tự động trên các giao diện API, Code, Cowork và Tag của Claude.

Tại sao quy định của EU lại quan trọng

Bộ Quy tắc Minh bạch bắt buộc các nhà phát triển phải đánh dấu nội dung do AI tạo ra hoặc chỉnh sửa để các hệ thống hạ nguồn có thể nhận biết nguồn gốc tổng hợp của nó. Quy định này nhằm hạn chế thông tin sai lệch và cung cấp cho người dùng một tín hiệu rõ ràng khi họ đang tiếp xúc với các tài liệu do máy tính tạo ra. Phản ứng của Anthropic—watermarking ở cấp độ mô hình—đưa dấu hiệu trực tiếp vào đầu ra thay vì gắn thêm vào giao diện người dùng (UI) của sản phẩm.

Các gã khổng lồ AI khác cũng đang đưa ra những cam kết tương tự. Google, Meta, Microsoft, OpenAI và Black Forest Labs đều cho biết họ sẽ đáp ứng các tiêu chuẩn của EU. Đối với các tài sản không phải văn bản, Anthropic sẽ sử dụng tiêu chuẩn mở C2PA, một phương pháp được tài liệu hóa công khai để nhúng dữ liệu nguồn gốc vào hình ảnh, video và các phương tiện truyền thông khác. Bằng cách tuân theo một đặc tả mở, Anthropic hy vọng các dấu hiệu của mình sẽ hoạt động tương thích với các công cụ mà các nhà báo, nền tảng và những người kiểm chứng sự thật đang sử dụng.

Cách thức hoạt động của watermark

Anthropic cho biết watermark được tích hợp trực tiếp vào quá trình tạo văn bản của mô hình. Trên thực tế, chữ ký này trở thành một phần của luồng token mà mô hình phát ra. Khi người dùng sao chép văn bản vào trình xử lý văn bản, email hoặc bài đăng trên mạng xã hội, mẫu ẩn này sẽ đi kèm theo đó. Công ty lưu ý rằng watermark có thể tồn tại sau những chỉnh sửa nhỏ, nhưng họ chưa tiết lộ cần phải thay đổi bao nhiêu ký tự trước khi dấu hiệu này biến mất.

Mối lo ngại về “Claudefishing”

Việc triển khai của Anthropic diễn ra trong bối cảnh sự lo ngại về việc lạm dụng các mô hình ngôn ngữ lớn (LLM) ngày càng tăng. CEO của Substack, Chris Best, gần đây đã đặt ra thuật ngữ “Claudefishing” để mô tả việc sử dụng AI để tạo ra nội dung lừa đảo mô phỏng giọng văn của một tác giả cụ thể. Khi văn bản tổng hợp ngày càng khó phân biệt với văn bản do con người viết, việc phát hiện tự động nguồn gốc trở thành một tuyến phòng thủ quan trọng.

Anthropic không đơn độc trong việc bổ sung các biện pháp bảo vệ. Nền tảng tạo nhạc Suno và dịch vụ bản tin Substack đã giới thiệu các cơ chế gắn cờ để cảnh báo người đọc khi một nội dung được tạo bởi AI. Bằng cách nhúng watermark ngay tại nguồn, Anthropic đặt mục tiêu khiến tín hiệu này khó bị gỡ bỏ hơn và giúp các bộ lọc hạ nguồn dễ dàng xử lý hơn.

Các điểm chính cần lưu ý

  • Tuân thủ quy định: Anthropic đang triển khai việc đóng dấu watermark để đáp ứng Bộ Quy tắc Minh bạch của Đạo luật AI EU, có hiệu lực từ ngày 2 tháng 8.
  • Tích hợp ở cấp độ mô hình: Watermark được áp dụng ở cấp độ mô hình, vì vậy chúng sẽ duy trì trên tất cả các sản phẩm (API, Claude Code, v.v.) và tồn tại sau các thao tác sao chép-dán.
  • Đánh dấu tệp tiêu chuẩn hóa: Đối với các tệp tin, Anthropic sẽ sử dụng tiêu chuẩn mở C2PA để đảm bảo khả năng tương tác và tính minh bạch trong nội dung kỹ thuật số.