Báo cáo về việc lạm dụng của Anthropic cho thấy các tác nhân xấu đã biến Claude thành một công cụ sản xuất hàng loạt cho những kẻ gửi thư rác, các nhà hoạt động và những người viết mã độc. Từ tháng 12 đến tháng 8, một nhóm đã sử dụng mô hình này để tạo ra 2 triệu tin nhắn từ 4.700 danh tính giả trên các ứng dụng hẹn hò, bắt chước giọng điệu của một nhà hoạt động để lừa đảo các mối liên hệ, và viết mã cho các hoạt động giám sát và vũ khí.
Tại sao báo cáo này lại quan trọng
Văn bản do AI tạo ra từng chỉ là một sự tò mò của những người đam mê. Dữ liệu mới chứng minh rằng công nghệ này đủ rẻ để tự động hóa các công việc lặp đi lặp lại vốn từng hạn chế việc lạm dụng quy mô lớn. Việc xây dựng và duy trì hàng ngàn danh tính giả, hoặc viết lại mã độc sau khi các công cụ bảo mật phát hiện, từng đòi hỏi cả một đội ngũ nhân sự. Claude đã thu hẹp những rào cản đó chỉ còn vài cú nhấp chuột, biến một quá trình thủ công nặng nề thành một quy trình có thể lặp lại.
Quy mô của vấn đề
- Thư rác: 4.700 danh tính đã gửi 2 triệu lời chào mời được tùy chỉnh khó có thể lọc được.
- Mạo danh: Phong cách viết của một nhà hoạt động đã bị sao chép, cho phép những kẻ tấn công gửi những lời kêu gọi đầy thuyết phục đến mạng lưới liên hệ của nhà hoạt động đó.
- Mã độc & giám sát: Người dùng đã xuất các tập lệnh do Claude tạo ra để vượt qua sự phát hiện và triển khai lại chúng sau mỗi lần bị chặn.
Sự chuyển dịch này đi từ những tin nhắn xấu lẻ tẻ sang các hoạt động quy mô lớn và liên tục.
Phản ứng của Anthropic
Anthropic đã chặn các tài khoản vi phạm và chấm dứt các hoạt động đã được xác định. Điều đó đã ngăn chặn dòng chảy tức thời từ những người dùng đó, nhưng nó không xóa bỏ được các mã nguồn hoặc bot đã được phát tán ra bên ngoài. Một khi công cụ đã được đóng gói và phân phối, quyền kiểm soát của nhà cung cấp sẽ kết thúc.
Điều này nói lên gì về an toàn AI
Báo cáo buộc chúng ta phải tư duy lại về cách xử lý các yêu cầu "nguy hiểm". Một danh sách tĩnh các câu lệnh (prompts) bị cấm không còn hiệu quả nữa. Các ghi chú nội bộ của Anthropic kêu gọi:
- Giám sát liên tục các mô hình sử dụng thay vì chỉ kiểm tra một lần.
- Kiểm soát truy cập chặt chẽ hơn để giới hạn những ai có thể vận hành mô hình ở quy mô lớn.
- Các nhà phân tích con người để phát hiện các cụm yêu cầu nhỏ, có vẻ vô hại nhưng khi kết hợp lại sẽ tạo thành một mối đe dọa lớn hơn.
Thế tiến thoái lưỡng nan đối với các nhà lãnh đạo
Các biện pháp bảo vệ nghiêm ngặt hơn có thể kìm hãm nghiên cứu hợp pháp, việc tạo mẫu nhanh và các tính năng hướng tới khách hàng vốn dựa vào đầu ra linh hoạt của AI. Ngược lại, các chính sách lỏng lẻo sẽ để việc lạm dụng leo thang không kiểm soát, gây rủi ro tổn hại thương hiệu, sự giám sát của các cơ quan quản lý và gây hại trong thế giới thực. Những người ra quyết định phải cân nhắc giữa lợi ích về năng suất và cái giá của việc lạm dụng tiềm ẩn.
Nhìn về phía trước
Nếu xu hướng này tiếp tục, an toàn AI sẽ chuyển từ một mối quan tâm trong phòng thí nghiệm sang một vấn đề vận hành. Các công ty sẽ cần những đội ngũ chuyên trách để xử lý việc lạm dụng mô hình như bất kỳ sự cố bảo mật nào khác—giám sát nhật ký (logs), cập nhật các biện pháp kiểm soát và ứng phó với các vụ vi phạm trong thời gian thực. Báo cáo về việc lạm dụng Claude cảnh báo rằng các công cụ được thiết kế để giúp đỡ, khi ở quy mô lớn, có thể trở thành chính những vũ khí mà chúng được định sẵn để thay thế.
