Anthropic và OpenAI đều đã mở ra một lộ trình nghiên cứu mới cho phép các đội ngũ bảo mật đã được kiểm duyệt làm việc với các mô hình AI đã được loại bỏ hầu hết các bộ lọc an toàn. "Cyber Verification Program" của Anthropic và "Trusted Access for Cyber" của OpenAI cung cấp cho các nhà nghiên cứu được phê duyệt quyền truy cập trực tiếp vào các mô hình ngôn ngữ mạnh mẽ có khả năng tạo ra mã nguồn, câu lệnh (prompts) và hướng dẫn không bị hạn chế. Động thái này quan trọng vì nó tạo ra một sự phân tách rõ rệt trong chuỗi cung ứng AI: một nhóm nhỏ những người nội bộ có thể thăm dò các phiên bản yếu nhất, trong khi phần còn lại của thế giới vẫn phải ở sau các rào chắn bảo vệ mạnh mẽ hơn.

Lý do các chương trình này xuất hiện

Cả hai công ty đều cho biết các sáng kiến này nhằm mục đích đẩy nhanh việc phát hiện các lỗ hổng có thể bị vũ khí hóa để tấn công các dịch vụ của họ. Bằng cách cung cấp cho một nhóm chuyên gia được kiểm soát một môi trường thử nghiệm (sandbox) với ít hạn chế hơn, họ hy vọng sẽ làm lộ ra các vectơ tấn công trước khi những kẻ tấn công có ý đồ xấu tìm thấy chúng. Cách tiếp cận này tương tự như bảo mật phần mềm truyền thống, nơi các nhà phát triển phát hành các bản dựng "bug-bounty" cho một nhóm đối tượng được lựa chọn.

Cách tính toán rủi ro mới cho những người phòng thủ

Mặt trái là mô hình truy cập hai tầng, buộc mọi tổ chức phải vạch ra một ranh giới giữa "nhà nghiên cứu" và "hacker". Ranh giới đó giờ đây trở thành một bề mặt tấn công tiềm năng. Nếu một kẻ tấn công đánh cắp thông tin xác thực, khai thác quyền truy cập của người nội bộ hoặc đánh lừa quy trình kiểm duyệt, chúng có thể vượt qua các rào chắn bảo vệ vốn đang bảo vệ hầu hết người dùng. Một khi đã vào được bên trong, mô hình không bị hạn chế có thể bị dụ dỗ để:

  • Tạo các kịch bản lừa đảo (phishing) nhằm tránh sự phát hiện
  • Xây dựng các khai thác zero-day với các đoạn mã chi tiết
  • Tạo ra các câu lệnh thao túng tâm lý (social-engineering) đầy thuyết phục được tùy chỉnh cho các mục tiêu cụ thể

Các đội ngũ bảo mật vốn xây dựng hệ thống phòng thủ dựa trên giả định rằng đầu ra của AI luôn được lọc phải xem xét lại tiền đề đó.

Cách các bên phòng thủ có thể ứng phó

  • Coi các chương trình này là một vectơ đe dọa. Giả định rằng các đối thủ sẽ cố gắng xâm nhập vào quy trình kiểm duyệt và theo dõi các mẫu đăng nhập bất thường trên các nền tảng AI.
  • Mở rộng phạm vi phát hiện ra ngoài đám mây. Tìm kiếm mã hoặc văn bản do AI tạo ra trong lưu lượng truy cập đi ra (outbound traffic), đặc biệt là từ các tài khoản có đặc quyền.
  • Thiết lập cứng các kiểm soát chính sách. Thực thi các quy tắc "quyền hạn tối thiểu" (least-privilege) nghiêm ngặt cho bất kỳ việc sử dụng dịch vụ AI bên ngoài nào trong nội bộ, và phân tách các môi trường có thể bị tiếp cận bởi một thông tin xác thực bị xâm phạm.
  • Hợp tác với các nhà cung cấp. Duy trì kết nối với các kênh liên lạc bảo mật của Anthropic và OpenAI để nhận cảnh báo về những thay đổi trong tiêu chí truy cập hoặc các hành vi lạm dụng được phát hiện.

Quan điểm đối lập

Những người ủng hộ lập luận rằng nếu không có một kênh an toàn để thăm dò sâu, các lỗ hổng sẽ vẫn bị ẩn giấu cho đến khi chúng bị khai thác trong thực tế. Do đó, các chương trình này có thể giảm tổng bề mặt tấn công bằng cách làm lộ các khiếm khuyết sớm. Sự đánh đổi là một tầng "ít được bảo vệ hơn" sẽ mời gọi sự lạm dụng mang tính cơ hội.

Những điều cần theo dõi

  • Các cập nhật đối với quy trình kiểm duyệt từ cả hai công ty
  • Các báo cáo về việc lạm dụng bắt nguồn từ các chương trình này
  • Những thay đổi trong toàn ngành về cách phân loại các bề mặt tấn công liên quan đến AI

Điểm mấu chốt là: các lộ trình nghiên cứu mới cung cấp cho các nhà nghiên cứu bảo mật những công cụ mạnh mẽ, nhưng chúng cũng trao chính những công cụ đó cho bất kỳ ai có thể vượt qua cổng kiểm soát. Các đội ngũ phòng thủ phải coi các chương trình này vừa là một nguồn thông tin chuyên sâu, vừa là một con đường tấn công mới.