Anthropic đã triển khai một bản cập nhật quan trọng cho mô hình Fable 5 của mình, giúp giảm đáng kể số lượng các truy vấn sinh học lành tính bị chặn bởi các lớp bảo mật. Sự điều chỉnh chiến lược này nhằm khôi phục tính hữu dụng cho nghiên cứu khoa học hợp pháp trong khi vẫn duy trì các biện pháp bảo vệ nghiêm ngặt chống lại các mối đe dọa sinh học rủi ro cao.
Giảm thiểu rào cản cho nghiên cứu khoa học
Trước những chỉ trích từ cộng đồng khoa học, Anthropic đã giảm thành công tỷ lệ dương tính giả trong các bộ lọc an toàn sinh học của Fable 5 xuống khoảng 85%. Trước đây, bộ phân loại an toàn của mô hình này quá cứng nhắc, thường xuyên chặn các truy vấn khoa học hợp pháp và chuyển hướng người dùng sang mô hình Opus 5 kém năng lực hơn.
Bản cập nhật này cho phép các nhà nghiên cứu và chuyên gia y tế tận dụng toàn bộ khả năng suy luận của Fable 5 cho một loạt các tác vụ lành tính. Giờ đây, người dùng có thể thực hiện các thao tác phức tạp như giải thích kết quả xét nghiệm, phân tích các triệu chứng lâm sàng và trả lời các câu hỏi y khoa chuyên sâu mà không gặp phải "bức tường an toàn" vốn từng cản trở năng suất trước đây.
Duy trì các rào cản đối với rủi ro lưỡng dụng
Mặc dù đã nới lỏng các hạn chế sinh học nói chung, Anthropic vẫn duy trì lập trường cứng rắn đối với các nghiên cứu "lưỡng dụng" (dual-use)—những thông tin có thể bị lợi dụng để gây hại. Công ty không dỡ bỏ các hạn chế đối với các chủ đề cực kỳ nhạy cảm bao gồm vi rút học, độc chất học và thiết kế phân tử tiên tiến.
Lập luận của Anthropic dựa trên bản chất đặc thù của các mối đe dọa sinh học. Không giống như một cuộc tấn công mạng có thể được giảm thiểu thông qua các bản vá và tắt hệ thống, một tác nhân sinh học khi đã phát tán thì gần như không thể "tắt đi" một khi nó bắt đầu lây lan. Công ty đã dẫn ra một số mối quan ngại mang tính sống còn thúc đẩy sự thận trọng này, bao gồm:
- Phân tích từ các cơ quan tình báo Hoa Kỳ về các rủi ro sinh học.
- Nghiên cứu chứng minh rằng AI có thể được sử dụng để thiết kế các loại virus tổng hợp hoàn toàn.
- Các nỗ lực đã được ghi nhận của người dùng nhằm yêu cầu hướng dẫn chế tạo vũ khí sinh học từ các LLM hiện có.
Cân bằng giữa an toàn và quyền truy cập chuyên biệt
Thách thức đối với các phòng thí nghiệm AI là điều hướng sự căng thẳng giữa tiến bộ khoa học mở và việc ngăn chặn sự lạm dụng thảm khốc. Anthropic đang cố gắng giải quyết vấn đề này bằng cách phát triển các chương trình truy cập chuyên biệt. Các chương trình này được thiết kế để cho phép các nhà nghiên cứu đã được xác minh truy cập vào các tính năng bị hạn chế—chẳng hạn như các tính năng liên quan đến vi rút học hoặc mô hình hóa phân tử—trong một môi trường được kiểm soát và kiểm toán.
Bằng cách phân biệt giữa truy vấn y tế lành tính và nghiên cứu lưỡng dụng nguy hiểm, Anthropic đang cố gắng thiết lập một tiền lệ về cách các mô hình tiên phong xử lý "biên giới sinh học", đảm bảo rằng các công cụ của y học hiện đại không vô tình trở thành công cụ của khủng bố sinh học.
Các điểm chính cần lưu ý
- Giảm 85% tỷ lệ dương tính giả: Anthropic đã hạ thấp đáng kể rào cản đối với các truy vấn sinh học hợp pháp, giúp người dùng không còn phải sử dụng mô hình Opus 5 bị hạ cấp.
- Rào cản nghiêm ngặt đối với các lĩnh vực rủi ro cao: Các hạn chế nghiêm ngặt vẫn được duy trì đối với vi rút học, độc chất học và thiết kế phân tử để ngăn chặn việc tạo ra vũ khí sinh học.
- Truy cập có kiểm soát cho các nhà nghiên cứu: Anthropic đang xây dựng các chương trình truy cập cụ thể để cung cấp cho các nhà khoa học đã qua kiểm duyệt các khả năng bị hạn chế mà họ cần cho nghiên cứu hợp pháp.
Anthropic đã cắt giảm các trường hợp chặn dương tính giả đối với các truy vấn sinh học lành tính trong mô hình Fable 5 khoảng 85%, khôi phục quyền truy cập vào toàn bộ khả năng suy luận của mô hình cho các nhà nghiên cứu. Thay đổi này vẫn duy trì các biện pháp bảo vệ nghiêm ngặt đối với các chủ đề sinh học lưỡng dụng, ngăn chặn mô hình cung cấp các hướng dẫn có thể hỗ trợ chế tạo vũ khí sinh học.
Tại sao bản cập nhật này lại quan trọng
Lớp bảo mật của Fable 5 ban đầu được hiệu chỉnh theo hướng thận trọng quá mức, đánh dấu một loạt các câu hỏi khoa học hợp pháp là rủi ro cao. Những người dùng yêu cầu giải thích kết quả xét nghiệm thông thường hoặc phân tích triệu chứng lâm sàng thường xuyên bị chuyển hướng sang mô hình Opus 5 kém năng lực hơn. Việc chặn quá mức đã gây ra sự chỉ trích từ cộng đồng khoa học, những người cho rằng sự cản trở này đã làm kìm hãm nghiên cứu thực sự và làm chậm quá trình đưa ra quyết định y tế. Bằng cách cắt giảm tỷ lệ dương tính giả xuống còn khoảng 1/5, Anthropic đặt mục tiêu đưa khả năng suy luận tiên tiến của mô hình trở lại với các bác sĩ, nhà sinh học và các chuyên gia khác, những người cần nó cho các tác vụ hàng ngày.
Các bộ lọc đã được thay đổi như thế nào
Sự cải tiến này bắt nguồn từ một bộ phân loại được tinh chỉnh để phân biệt giữa các truy vấn y sinh thông thường và các truy vấn liên quan đến nghiên cứu "lưỡng dụng" — những thông tin có thể bị chuyển đổi mục đích để gây hại. Bộ phân loại mới vẫn ngăn chặn các yêu cầu liên quan đến vi rút học, độc chất học và thiết kế phân tử nâng cao, nhưng cho phép các câu hỏi về chẩn đoán tiêu chuẩn, phân loại triệu chứng và giải thích dữ liệu đi qua.
Các kỹ sư của Anthropic lưu ý rằng các mối đe dọa sinh học khác với các mối đe dọa mạng: một khi mầm bệnh đã được phát tán, nó không thể được "vá lỗi" hay ngắt kết nối. Thực tế đó đã thúc đẩy quyết định giữ vững lập trường cứng rắn đối với các lĩnh vực rủi ro cao, đồng thời nới lỏng sự kiểm soát đối với các truy vấn y tế thông thường.
Những gì vẫn nằm trong danh mục cấm
Mô hình tiếp tục từ chối các yêu cầu có thể tạo điều kiện cho việc tạo ra các tác nhân gây hại. Cụ thể, bất kỳ câu lệnh nào tìm kiếm:
- các quy trình vi rút học chi tiết có thể hỗ trợ tổng hợp vi rút,
- các con đường độc chất học cho các hóa chất có thể chế tạo vũ khí, hoặc
- các hướng dẫn kỹ thuật phân tử từng bước một.
Anthropic đã dẫn chứng ba nguồn cho sự thận trọng của mình: các phân tích từ các cơ quan tình báo Hoa Kỳ nhấn mạnh rủi ro sinh học, nghiên cứu cho thấy AI có thể thiết kế các vi rút tổng hợp hoàn toàn, và các nỗ lực đã được ghi nhận của người dùng nhằm tìm kiếm hướng dẫn chế tạo vũ khí sinh học từ các mô hình ngôn ngữ hiện có.
Chương trình tiếp cận dành cho các nhà khoa học đã qua kiểm duyệt
Để cân bằng giữa nghiên cứu mở và an ninh, Anthropic đang triển khai một chương trình tiếp cận chuyên biệt. Các nhà nghiên cứu đã được xác minh có thể đăng ký tham gia một môi trường được kiểm soát, nơi các khả năng bị hạn chế sẽ được mở khóa dưới sự giám sát. Chương trình được thiết kế để cho phép các nhà khoa học chính thống khám phá các chủ đề rủi ro cao — chẳng hạn như các nền tảng vắc-xin mới hoặc mô hình hóa mầm bệnh — mà không làm cho công chúng tiếp cận với các hướng dẫn nguy hiểm.
Điểm mấu chốt
Bằng cách cắt giảm 85% các trường hợp chặn nhầm trong khi vẫn duy trì các lệnh cấm lưỡng dụng nghiêm ngặt, Anthropic đặt mục tiêu cung cấp cho các nhà nghiên cứu sức mạnh từ mô hình có khả năng nhất của mình mà không mở cửa cho việc thiết kế vũ khí sinh học. Sự thành công của chiến lược an toàn được hiệu chỉnh này có thể tạo ra một khuôn mẫu cho cách các mô hình AI tiên phong xử lý các lĩnh vực khoa học quan trọng khác.
