Nghiên cứu bảo mật “Friendly Fire” cho thấy một tác nhân AI có thể bị lừa chỉ bằng cách chèn một chỉ dẫn độc hại vào tệp README, và tác nhân đó sẽ tuân theo mà không hề xem xét mã nguồn bên dưới. Lỗ hổng tương tự cũng xuất hiện trong một quy trình tự động hóa blog cá nhân vốn dựa vào một cờ “tự động phê duyệt” (auto-approve) trong giai đoạn tạo nội dung không có sự giám sát, làm lộ ra một bề mặt tấn công tiềm ẩn.

Nghiên cứu Friendly Fire vạch trần một vectơ tấn công tiềm ẩn

Các nhà nghiên cứu đứng sau báo cáo Friendly Fire đã chứng minh một phương thức khai thác nhỏ nhưng đầy sức mạnh: kẻ tấn công nhúng một lệnh vào tệp tài liệu mà AI sẽ đọc như một phần của quy trình làm việc thông thường. Vì tác nhân AI tin tưởng nội dung của tệp, nó sẽ thực thi lệnh ẩn đó như thể đó là một chỉ dẫn hợp lệ. Cuộc tấn công này không yêu cầu phải xâm nhập vào chính mô hình AI; nó chỉ cần tác động đến dữ liệu mà mô hình xử lý trong khi không có sự giám sát của con người.

Đóng góp chính của nghiên cứu không nằm ở tính mới lạ của payload mà ở việc tiết lộ rằng các chế độ “tự động phê duyệt” — các thiết lập yêu cầu AI hành động theo bất cứ thứ gì nó đọc được mà không cần kiểm tra lại — sẽ tạo ra một mối quan hệ tin cậy ngầm định với các nguồn dữ liệu bên ngoài. Khi sự tin tưởng đó là mù quáng, quy trình sẽ trở thành cửa ngõ cho việc thực thi mã tùy ý.

Quy trình blog không người giám sát đã sụp đổ như thế nào

Tác giả của nghiên cứu đã áp dụng logic tương tự vào một hệ thống tự động hóa blog cá nhân. Quy trình này bao gồm ba giai đoạn:

  1. Giai đoạn tạo nội dung (Generation stretch) – AI viết bài mà không có sự giám sát của con người.
  2. Cổng kiểm định chất lượng (QA gate) – một bước kiểm tra điểm chất lượng tự động để đánh giá đầu ra.
  3. Nút Telegram – con người phải nhấn một nút để xuất bản bài viết.

Trong giai đoạn tạo nội dung, tác giả đã bật một cờ có tên là dangerously-skip-permissions, lệnh này yêu cầu AI coi mọi đầu vào đều đã được phê duyệt. Cờ này về bản chất tái hiện lại chế độ “tự động phê duyệt” đã được cảnh báo trong báo cáo Friendly Fire.

Một cuộc kiểm tra sau đó đã phát hiện ra một lỗ hổng sâu rộng: nếu kẻ tấn công có thể tác động đến bất kỳ tệp nào mà AI đọc trong khoảng thời gian đó, chúng có thể điều khiển toàn bộ quy trình. Hệ thống của chính tác giả đã gặp phải các lỗi âm thầm trong 5 trên 6 lần thử nghiệm vì một kịch bản cấu hình đã vô tình ghi đè lên các thiết lập của một kịch bản khác. Do không có việc ghi nhật ký (logging) các mã thoát (exit codes) hoặc điểm QA, vấn đề đã kéo dài suốt ba ngày trước khi được phát hiện.

Sự cố này chứng minh rằng sự an toàn không đến từ việc tin tưởng vào đầu ra của AI, mà đến từ ba điểm kiểm soát rõ ràng bao quanh giai đoạn tạo nội dung.

Sự an toàn thực sự nằm ở đâu

Nghiên cứu và thất bại của hệ thống tự động hóa blog cùng hội tụ tại một điểm duy nhất: sự bảo vệ phải nằm ngoài quá trình tạo nội dung. AI có thể bị dụ dỗ thực hiện bất kỳ hành vi nào khi nó hoạt động ở trạng thái tự động phê duyệt; chỉ có các biện pháp kiểm soát xung quanh mới có thể phát hiện và ngăn chặn các hành động không mong muốn.

Các quan sát chính:

  • Phê duyệt bởi con người ở bước cuối cùng có hiệu quả vì nó xem xét sản phẩm cuối cùng, chứ không phải các bước trung gian vốn diễn ra quá nhanh và quá nhiều để có thể giám sát trong thời gian thực.
  • Ngưỡng chất lượng được áp dụng sau khi tạo nội dung nhưng trước khi xuất bản sẽ giúp chặn các đầu ra có độ tin cậy thấp vốn có thể đã bị thao túng.
  • Ghi nhật ký toàn diện mọi mã thoát, điểm QA và mọi thay đổi cấu hình giúp các lỗi âm thầm trở nên hiển hiện trước khi chúng gây ra tác động dây chuyền.

Bài học cho bất kỳ ai đang vận hành các tác nhân tự động phê duyệt

  1. Ghi nhật ký mọi thứ – hãy lưu lại các mã thoát, điểm QA và bất kỳ thay đổi nào đối với các tệp cấu hình. Bạn không thể khắc phục những gì bạn không thể nhìn thấy.
  2. Áp dụng một cổng chất lượng nghiêm ngặt – thiết lập một ngưỡng không thể thương lượng mà quy trình phải đạt được trước khi có thể tiến tới giai đoạn tiếp theo.
  3. Chỉ dành việc phê duyệt của con người cho bước cuối cùng – việc cố gắng theo dõi AI trong khi nó đang tạo nội dung là điều không thực tế; một lần nhấn nút duy nhất sau khi đã hoàn tất mọi bước kiểm tra sẽ đáng tin cậy hơn nhiều.
  4. Bảo vệ các tệp cấu hình – hãy cách ly chúng khỏi các công cụ khác có thể ghi đè thiết lập, và thường xuyên kiểm tra (audit) bất kỳ quyền ghi nào.

Kết luận

Các tác nhân AI không có người giám sát chỉ an toàn tương ứng với những lỗ hổng mà bạn đã lấp đầy xung quanh chúng. Một cờ “tự động phê duyệt” sẽ biến sự tiện lợi thành một cửa sau (backdoor) âm thầm; việc ghi nhật ký kỹ lưỡng, các cổng chất lượng nghiêm ngặt và sự phê duyệt cuối cùng của con người là những biện pháp phòng thủ thực tế để giữ cho quy trình không trở thành một vectơ tấn công.