Hãy tưởng tượng bạn là một kỹ sư bảo mật ứng dụng cấp cao tại một công ty dịch vụ tài chính. Bạn đưa một đoạn mã xác thực được phát triển nội bộ vào một mô hình AI tiên tiến và yêu cầu nó xác định các lỗi logic. Thay vì phân tích, bạn lại nhận được một bài giảng. Mô hình từ chối với lý do rằng bạn có thể sử dụng thông tin đó để “khai thác một hệ thống”. Bạn không phải là tội phạm. Bạn là người được thuê để ngăn chặn tội phạm. Tuy nhiên, rào chắn bảo vệ lại coi cả hai vai trò này là không thể phân biệt được.
Kịch bản này đang trở nên phổ biến. Khi các phòng thí nghiệm AI lớn thắt chặt các giao thức an toàn để ngăn chặn việc lạm dụng ác ý, họ đang va chạm trực diện với quy trình làm việc của các chuyên gia an ninh mạng hợp pháp. Kết quả là một nghịch lý đang gia tăng: chính những công cụ được quảng bá là đòn bẩy sức mạnh cho kỹ thuật phần mềm lại đang bị từ chối cung cấp cho các chuyên gia – những người bảo vệ cơ sở hạ tầng trọng yếu.
Sự ma sát giữa An toàn (Safety) và An ninh (Security)
Các nhà phát triển AI lớn không hoàn toàn phớt lờ cộng đồng an ninh mạng. OpenAI vận hành một chương trình có tên là Trusted Access for Cyber. Anthropic vận hành một Cyber Verification Program. Cả hai đều được thiết kế để cho phép những người dùng đã qua kiểm duyệt bỏ qua một số cơ chế từ chối nhất định nhằm thực hiện các nghiên cứu hợp pháp. Về lý thuyết, những cánh cửa này giúp phân tách các tác nhân tốt và xấu.
Trên thực tế, nhiều nhà nghiên cứu bảo mật tấn công và những người phòng thủ mạng trải nghiệm chúng như những rào cản hành chính phiền hà. Quy trình xác minh có thể thiếu minh bạch. Thời gian phê duyệt không rõ ràng. Ngay cả sau khi được chấp nhận, các nhà nghiên cứu báo cáo rằng quyền truy cập nâng cao không phải lúc nào cũng hoạt động ổn định trên các phiên bản mô hình hoặc các luồng hội thoại khác nhau. Đối với các đội ngũ đang chạy đua để vá các lỗ hổng đang bị khai thác tích cực, sự ma sát đó thực sự quan trọng.
Sự căng thẳng giữa Washington và Thung lũng Silicon đã đạt đến một điểm nóng đáng chú ý khi chính phủ Hoa Kỳ áp đặt các biện pháp kiểm soát xuất khẩu đối với các mô hình Mythos và Fable của Anthropic. Các hạn chế này được đưa ra sau các báo cáo cho thấy các cá nhân đã vượt qua các rào chắn an toàn của mô hình để tạo điều kiện cho các cuộc tấn công mạng. Các cơ quan quản lý đã nhanh chóng hành động để coi các hệ thống này là những hàng hóa xuất khẩu đặc biệt nguy hiểm. Các biện pháp kiểm soát sau đó đã được dỡ bỏ hoặc sửa đổi, nhưng sự kiện này đã gửi đi một tín hiệu rõ ràng: các mô hình AI có năng lực cao đang ngày càng bị coi là những thiết bị tận thế tiềm năng thay vì là các công cụ kỹ thuật đa năng. Đối với những người phòng thủ dựa vào chúng, nhận thức đó chuyển hóa thành sự giám sát chặt chẽ hơn, quyền truy cập chậm hơn và một sự nghi ngờ tiềm ẩn rằng nghiên cứu bảo mật thực chất chỉ là hành vi hack dưới một cái tên khác.
Tại sao Phòng thủ và Tấn công là không thể tách rời
Cốt lõi của xung đột không nằm ở vấn đề hành chính. Nó nằm ở vấn đề kỹ thuật. Những khả năng cần thiết để bảo vệ một mạng lưới gần như đồng nhất với những khả năng cần thiết để tấn công nó.
Chris Anley, Nhà khoa học trưởng tại NCC Group, sử dụng một phép ẩn dụ đơn giản: AI là một chiếc búa. Bạn có thể dùng nó để xây nhà hoặc để đập vỡ cửa sổ. Bản thân công cụ không biết sự khác biệt. Trong an ninh mạng, tính lưỡng dụng này là không thể tránh khỏi. Khi một chuyên gia yêu cầu mô hình “sửa đoạn mã này”, yêu cầu đó kích hoạt một hành động phòng thủ. Nhưng quá trình suy luận tạo ra bản sửa lỗi đó—như xác định các hàm không an toàn, truy vết dữ liệu đầu vào không đáng tin cậy, lập bản đồ luồng thực thi—chắc chắn sẽ tiết lộ cách thức lỗ hổng có thể bị kích hoạt. Lời giải thích đó đóng vai trò như một lộ trình để khai thác.
Vì các đội ngũ an toàn AI thường huấn luyện các mô hình để từ chối bất kỳ câu lệnh nào có dấu hiệu khai thác, các hệ thống này thường xuyên phản ứng quá mức. Một nhà nghiên cứu hỏi cách làm sạch dữ liệu đầu vào của người dùng sẽ nhận được câu trả lời. Một nhà nghiên cứu hỏi cách một
