Cách thức phát hiện sự lạm dụng

Hệ thống giám sát nội bộ của Anthropic đã gắn cờ một loạt các truy vấn "lưỡng dụng" — những yêu cầu có thể hỗ trợ nghiên cứu hợp pháp nhưng cũng có thể tạo điều kiện cho các ứng dụng gây hại. Một nhà nghiên cứu đã yêu cầu Claude thiết kế các đột biến giúp virus Chikungunya có khả năng lây truyền mạnh hơn. Cách dùng từ của yêu cầu này và việc thử nghiệm lặp đi lặp lại trên động vật sống cho thấy đây là một bối cảnh nghiên cứu quân sự, chứ không phải nỗ lực y tế công cộng. Để che giấu ý đồ thực sự, người dùng đã sử dụng cách diễn đạt lừa dối, buộc Anthropic phải thắt chặt các biện pháp bảo vệ sinh học trên các mô hình mới hơn, mạnh mẽ hơn của mình.

Các cuộc điều tra song song đã phát hiện những nỗ lực tạo ra sơ đồ và mã nguồn cho súng, hệ thống dẫn đường tên lửa, máy bay không người lái vũ trang và các thành phần của bom. Sáu truy vấn được truy vết từ các địa chỉ IP tại Trung Quốc, Nga và Yemen; hoạt động tại Yemen có vẻ liên quan đến phong trào Houthi do Iran hậu thuẫn. Trong một nhánh khác, Anthropic đã xác định được các chiến dịch thông tin sai lệch do AI điều khiển: các tác nhân chính phủ Trung Quốc và Iran đã sử dụng Claude để giám sát các cộng đồng hải ngoại, trong khi truyền thông nhà nước Nga đã sử dụng mô hình này để sản xuất các bài báo "độc lập" nhằm lan truyền những tuyên bố sai sự thật về các cuộc bầu cử ở Moldova.

Tại sao báo cáo này lại quan trọng

Những tiết lộ này diễn ra trong bối cảnh các mô hình AI đang phát triển từ các chatbot thành các công cụ có khả năng lập luận khoa học. Đối với các chính phủ, rủi ro là kép. Thứ nhất, việc tiếp cận dễ dàng với AI tiên tiến làm giảm rào cản cho các tác nhân nhà nước hoặc phi nhà nước trong việc triển khai các chương trình vũ khí bất hợp pháp. Thứ hai, chính các mô hình này trở thành công cụ cho chiến tranh thông tin, cho phép thực hiện các chiến dịch tuyên truyền tinh vi và khó truy vết. Báo cáo này tạo thêm áp lực lên các nhà hoạch định chính sách trong việc coi AI là một công nghệ lưỡng dụng, phải chịu sự kiểm soát xuất khẩu, các quy định về an ninh sinh học và các chiến lược phòng thủ mạng.

Phản ứng của Anthropic và những căng thẳng nội bộ

Để phản ứng, Anthropic đã triển khai các biện pháp bảo vệ nghiêm ngặt hơn trên các dòng mô hình mới nhất của mình, chặn rõ ràng các truy vấn yêu cầu thao túng tác nhân gây bệnh hoặc thiết kế vũ khí.

Báo cáo này xuất hiện giữa lúc đang có những bất đồng nội bộ. Nhà nghiên cứu Jacob Coxon đã từ chức vào đầu năm nay, cảnh báo rằng sự thúc đẩy nhanh chóng của ngành hướng tới các hệ thống mạnh mẽ hơn đang vượt xa tốc độ phát triển của các mạng lưới an toàn. Sự ra đi của ông nhấn mạnh một cuộc tranh luận rộng lớn hơn: các công ty AI tư nhân đang đóng vai trò như những "cảnh sát kỹ thuật số" trên thực tế, quyết định điều gì được coi là mối đe dọa an ninh mà không có một khung pháp lý chính phủ rõ ràng. Các nhà phê bình lập luận rằng việc tự điều tiết không thể theo kịp sự tinh vi của các đối thủ, trong khi những người ủng hộ lại chỉ ra những thay đổi chính sách nhanh chóng của Anthropic như một minh chứng cho thấy ngành công nghiệp có thể thích nghi nhanh chóng.

Những phát hiện này có ý nghĩa gì đối với Ấn Độ

  • Cảnh giác về an ninh sinh học – Ngành công nghệ sinh học đang phát triển của Ấn Độ sẽ ngày càng dựa vào AI để tìm kiếm thuốc mới và phân tích tác nhân gây bệnh. Việc tích hợp giám sát do AI điều khiển vào các quy trình an ninh sinh học hiện có có thể phát hiện các nỗ lực lạm dụng các công cụ trong nước cho nghiên cứu lưỡng dụng.
  • Bảo vệ diễn ngôn dân chủ – Việc sử dụng Claude để giám sát các nhóm hải ngoại và lan truyền những thông tin sai lệch liên quan đến bầu cử cho thấy nhu cầu về các biện pháp phòng thủ mạng mạnh mẽ hơn và các chiến dịch nâng cao nhận thức cộng đồng để có thể phát hiện thông tin sai lệch do AI tạo ra.
  • Xây dựng năng lực AI tự chủ – Việc phụ thuộc vào các mô hình có trụ sở tại Hoa Kỳ cho các công việc khoa học quan trọng cho thấy một khoảng cách chiến lược. Việc phát triển các mô hình nội địa tích hợp các tiêu chuẩn an ninh và hướng dẫn đạo đức của Ấn Độ có thể giảm thiểu sự tiếp xúc với ảnh hưởng nước ngoài và kiểm soát dòng chảy của các khả năng AI nhạy cảm.

Quan điểm đối lập: lập luận cho việc tự điều tiết

Việc Anthropic nhanh chóng triển khai các bộ lọc mới cho thấy các công ty tư nhân có thể hành động nhanh hơn nhiều cơ quan lập pháp. Công ty lập luận rằng các chính sách "sử dụng có trách nhiệm" của mình, kết hợp với các thử nghiệm red-team đang diễn ra, cung cấp một giải pháp tạm thời thực tế trong khi các chính phủ tranh luận về các quy định chính thức. Những người ủng hộ lưu ý rằng các luật lệ quá khắt khe có thể kìm hãm sự đổi mới, đặc biệt là trong các lĩnh vực mà AI thúc đẩy các đột phá y học. Thách thức là phải đạt được sự cân bằng, nơi các biện pháp bảo vệ của ngành phải minh bạch và có thể kiểm chứng, mà không làm cản trở các ứng dụng có lợi mà AI hứa hẹn mang lại.

Những điều cần theo dõi tiếp theo

  • Các động thái quản lý – Dự kiến sẽ có sự giám sát chặt chẽ hơn từ các cơ quan kiểm soát xuất khẩu và các cơ quan quản lý an ninh sinh học, có khả năng dẫn đến các hướng dẫn mới coi các mô hình tạo sinh tiên tiến là các công nghệ bị kiểm soát.
  • Sự hợp tác trong ngành – Anthropic có thể tham gia hoặc mở rộng các liên minh an toàn AI hiện có để chia sẻ thông tin tình báo về mối đe dọa, một bước đi có thể tiêu chuẩn hóa việc báo cáo các nỗ lực sử dụng lưỡng dụng trong toàn ngành.
  • Phản ứng của các quốc gia – Các quốc gia được nêu tên trong báo cáo có khả năng sẽ phủ nhận sự liên quan và có thể đẩy nhanh các chương trình phát triển AI của riêng họ, tạo ra một vòng lặp phản hồi có thể làm mờ thêm ranh giới giữa việc sử dụng AI cho mục đích phòng thủ và tấn công.

Báo cáo của Anthropic cho thấy chính sức mạnh tạo sinh giúp các nhà khoa học mô hình hóa protein cũng có thể bị vũ khí hóa, và an toàn AI hiện đang nằm ngay trong phạm vi địa chính trị. Những tháng tới sẽ là bài kiểm tra xem liệu sự tự điều tiết, chính sách của chính phủ, hay một cách tiếp cận hỗn hợp có thể ngăn chặn công nghệ này trở thành một công cụ của xung đột hay không.