Anthropic vừa công bố một bước chuyển mình lớn về tính minh bạch của AI bằng cách cam kết đóng dấu watermark cho tất cả các đầu ra của mô hình Claude trên phạm vi toàn cầu. Động thái này, được thúc đẩy bởi Bộ Quy tắc Thực hành của Đạo luật AI EU (EU AI Act Code of Practice), nhằm cung cấp nguồn gốc rõ ràng cho văn bản và tệp tin do AI tạo ra trong toàn bộ hệ sinh thái sản phẩm của hãng.
Tiêu chuẩn Toàn cầu về Nguồn gốc và Tính minh bạch
Mặc dù quy định này bắt nguồn từ Đạo luật AI EU, Anthropic không giới hạn các biện pháp bảo vệ này cho riêng người dùng châu Âu. Bắt đầu từ tháng 8 năm 2026, tất cả các mô hình Claude mới sẽ tích hợp sẵn tính năng dán nhãn. Việc triển khai này sẽ bao gồm toàn bộ bộ sản phẩm Claude, bao gồm Claude API, Claude Code, Claude Cowork và Claude Tag.
Chiến lược này bao gồm một phương pháp tiếp cận hai lớp để nhận dạng. Đối với văn bản, Anthropic sẽ triển khai một dấu watermark ẩn được áp dụng ở cấp độ mô hình. Dấu watermark này được thiết kế để không gây phiền hà, đảm bảo rằng ý nghĩa, chất lượng và khả năng đọc của văn bản vẫn được giữ nguyên. Quan trọng hơn, Anthropic khẳng định rằng các dấu này có thể tồn tại ngay cả sau khi văn bản đã được sao chép, dán hoặc trải qua các chỉnh sửa nhỏ.
Đối với dữ liệu hình ảnh và dữ liệu có cấu trúc, Anthropic sẽ sử dụng tiêu chuẩn mở C2PA (Coalition for Content Provenance and Authenticity). Các định dạng tệp được hỗ trợ như .svg, .png và .jpg sẽ mang siêu dữ liệu (metadata) về nguồn gốc được ký kỹ thuật số. Chữ ký này đóng vai trò là một hồ sơ có thể xác minh rằng Claude đã xử lý tệp và có thể giúp phát hiện các hành vi giả mạo sau đó.
Thách thức Kỹ thuật và Giới hạn Phát hiện
Bất chấp khung kỹ thuật mạnh mẽ, Anthropic vẫn giữ thái độ thực tế về những hạn chế của việc đóng dấu watermark. Một dấu watermark được phát hiện không mặc nhiên chứng minh rằng Claude là tác giả của nội dung đó; người dùng thường xuyên sử dụng Claude cho các tác vụ phụ như dịch thuật, tóm tắt hoặc hiệu đính, điều này có thể kích hoạt dấu watermark trên các ý tưởng vốn do con người khởi xướng.
Ngược lại, việc thiếu dấu watermark không phải là sự đảm bảo cho quyền tác giả của con người. Một số yếu tố có thể loại bỏ hoặc làm mờ các tín hiệu này, bao gồm:
- Chỉnh sửa thủ công nhiều hoặc dịch lại trên diện rộng.
- Các đoạn văn bản quá ngắn để có thể phát hiện thống kê một cách đáng tin cậy.
- Việc loại bỏ siêu dữ liệu trong quá trình chuyển đổi định dạng hoặc thông qua ảnh chụp màn hình.
Điều này tạo ra một bối cảnh phức tạp cho các nhà phát triển. Những người tích hợp Claude vào các dịch vụ bên thứ ba phải đánh giá cẩn thận xem các yêu cầu của Điều 50 trong Đạo luật AI EU áp dụng như thế nào cho việc triển khai cụ thể của họ.
Bối cảnh AI Rộng lớn hơn: Cạnh tranh và Đạo đức
Động thái của Anthropic đặt hãng vào thế cạnh tranh trực tiếp với các gã khổng lồ khác trong ngành về vấn đề an toàn và tính minh bạch. Google DeepMind đã tích hợp hệ thống SynthID của mình vào các mô hình Gemini, hệ thống này điều chỉnh xác suất dự đoán token để nhúng các dấu watermark. Trong khi đó, OpenAI đã trì hoãn việc phát hành công cụ phát hiện văn bản có độ chính xác cao của riêng mình, với lý do lo ngại về các trường hợp dương tính giả và việc người dùng có thể dễ dàng vượt qua các công cụ đó thông qua việc viết lại văn bản.
Các rủi ro đặc biệt cao trong lĩnh vực giáo dục. Khi các tổ chức đang phải vật lộn với tình trạng đạo văn có sự hỗ trợ của AI và các vụ lừa đảo "do AI điều khiển" liên quan đến gian lận hỗ trợ tài chính, nhu cầu về khả năng phát hiện đáng tin cậy là vô cùng cấp thiết. Tuy nhiên, ngành công nghiệp phải cân bằng nhu cầu này với rủi ro đưa ra những cáo buộc sai lầm. Bằng cách phát hành các công cụ xác minh cho bên thứ ba, Anthropic đang cố gắng đưa ngành công nghiệp hướng tới một phương pháp xác thực nội dung chuẩn hóa và có thể kiểm chứng được.
Các Điểm chính cần Lưu ý
- Triển khai Toàn cầu: Việc đóng dấu watermark của Anthropic sẽ áp dụng cho tất cả các sản phẩm Claude trên toàn cầu, bao gồm cả API, chứ không chỉ trong phạm vi EU.
- Phương pháp Tiếp cận Hai lớp: Công ty sẽ sử dụng dấu watermark văn bản ẩn và siêu dữ liệu được ký theo tiêu chuẩn C2PA cho các tệp hình ảnh (.png, .jpg, .svg).
- Tính Bền vững so với Độ tin cậy: Mặc dù các dấu watermark được thiết kế để tồn tại sau khi sao chép và chỉnh sửa nhỏ, chúng không phải là tuyệt đối và có thể bị vượt qua bằng cách định dạng lại mạnh mẽ hoặc dịch thuật.
