Nhà nghiên cứu bảo mật Håkon Måløy đã chỉ ra rằng một thủ thuật đơn giản—ẩn văn bản trắng trên nền trắng trong một tệp Word—có thể biến Microsoft Copilot cho Word thành một con sâu AI tự nhân bản. Con sâu này tự động lây lan khi người dùng yêu cầu Copilot xử lý tài liệu bị nhiễm, tiếp cận các đồng nghiệp thông qua SharePoint, Teams và Outlook, và nó thực hiện điều này mà không cần bất kỳ mã độc truyền thống nào.
Cách thức hoạt động của con sâu
Cuộc tấn công khai thác cách các mô hình ngôn ngữ lớn (LLM) như Copilot tiếp nhận một tài liệu. Kẻ tấn công chèn các hướng dẫn vô hình—văn bản màu trắng trên nền trắng—vào một tệp .docx tiêu chuẩn. Khi người dùng mở tệp và yêu cầu Copilot "tóm tắt" hoặc xử lý theo cách khác, mô hình sẽ đọc văn bản ẩn đó như thể người dùng đã tự nhập các lệnh đó. Các lệnh ẩn thường thực hiện ba việc:
- Thao túng nội dung – chúng yêu cầu Copilot thay đổi các con số hoặc dữ liệu khác trong tài liệu.
- Tự nhân bản – chúng điều hướng Copilot sao chép khối hướng dẫn ẩn vào tài liệu mới được tạo ra.
- Lan truyền – tài liệu mới, giờ đây mang theo các hướng dẫn ẩn tương tự, có thể được chia sẻ tiếp, lặp lại chu kỳ này.
Vì mô hình coi toàn bộ tài liệu là một cửa sổ hướng dẫn duy nhất, nó không thể phân biệt được giữa các câu lệnh do người dùng đưa ra và văn bản được nhúng trong tệp. Kết quả là một con sâu lây lan mà không cần bất kỳ hành động thực thi mã nào do người dùng khởi xướng.
Tại sao điều này lại quan trọng vào lúc này
Việc tích hợp Copilot vào bộ Office đã biến sự hỗ trợ của AI thành thực tế hàng ngày đối với nhiều doanh nghiệp. Con sâu này làm lộ ra một lỗ hổng thiết kế cơ bản: các LLM sử dụng một cửa sổ hướng dẫn duy nhất cho mọi thứ. Microsoft đã cố gắng khắc phục điều này bằng cách tung ra hai biện pháp giảm thiểu trong vòng 144 ngày. Tuy nhiên, bản thử nghiệm (proof-of-concept) vẫn hoạt động, cho thấy chỉ riêng việc nâng cấp mô hình là không đủ để lấp đầy lỗ hổng này.
Đối với các tổ chức, rủi ro là kép. Thứ nhất, tính toàn vẹn của dữ liệu có thể bị thay đổi một cách âm thầm—ví dụ như các con số trong báo cáo tài chính—mà không để lại bất kỳ dấu vết rõ ràng nào. Thứ hai, con sâu có thể biến một tài liệu bị xâm nhập duy nhất thành một vector tấn công quét qua các công cụ cộng tác nội bộ, làm mở rộng bề mặt tấn công vượt xa điểm xâm nhập ban đầu.
Bối cảnh rộng hơn
Những lo ngại trước đây tập trung vào prompt injection—nơi kẻ tấn công lừa LLM tiết lộ thông tin nội bộ hoặc thực hiện các hành động không mong muốn. Con sâu này mở rộng khái niệm đó sang việc xử lý tài liệu, làm mờ ranh giới giữa "nội dung" và "lệnh".
Những gì các nhà phát triển và đội ngũ IT có thể làm ngay hôm nay
- Coi mọi tài liệu bên ngoài là không đáng tin cậy – giả định rằng các hướng dẫn ẩn có thể tồn tại, ngay cả khi tệp trông có vẻ bình thường.
- Quét nội dung vô hình – sử dụng các công cụ phát hiện văn bản trắng trên nền trắng, các ký tự có độ rộng bằng không (zero-width characters) hoặc các đánh dấu ẩn khác trước khi đưa tệp vào Copilot.
- Kiểm tra kết quả của AI trước khi phân phối – xác minh rằng văn bản được tạo ra khớp với nội dung dự kiến và không chứa các thay đổi bất ngờ.
- Hạn chế phạm vi truy cập của Copilot – giới hạn quyền của trợ lý trong phạm vi các thư mục hoặc thư viện nhỏ nhất cần thiết cho một tác vụ cụ thể.
- Vô hiệu hóa Copilot ở những nơi không cần thiết – việc tắt tính năng này trong phần cài đặt sẽ loại bỏ hoàn toàn vector tấn công đối với những người dùng có rủi ro thấp.
Những bước này không loại bỏ khả năng lý thuyết về một con sâu AI, nhưng chúng làm tăng nỗ lực cần thiết để kẻ tấn công thành công và cung cấp cho các tổ chức một tuyến phòng thủ thực tế trong khi kiến trúc mô hình cốt lõi đang được xem xét lại.
Quan điểm ngược lại: Đây là một mối đe dọa thực tế hay chỉ là một bản demo nghiên cứu?
Cho đến khi việc xử lý đầu vào của mô hình được thiết kế lại, lỗ hổng này vẫn tồn tại, và rủi ro không thể bị bác bỏ là chỉ mang tính học thuật thuần túy.
Những điều cần theo dõi tiếp theo
Con sâu AI nhấn mạnh một bài học then chốt: khi các trợ lý AI trở nên gắn liền với các phần mềm hàng ngày, mọi mẩu dữ liệu mà chúng chạm tới đều trở thành một bề mặt tấn công tiềm năng. Các tổ chức coi AI như một tính năng "hộp đen" thay vì một giao diện có thể lập trình sẽ có nguy cơ đối mặt với các mối đe dọa mới chỉ bằng văn bản.
Bài học rút ra: Con sâu văn bản ẩn cho thấy sự tiện lợi của việc chỉnh sửa tài liệu bằng AI có thể bị vũ khí hóa chỉ bằng những ký tự vô hình. Cho đến khi thiết kế mô hình cốt lõi thay đổi, thái độ an toàn nhất là coi mọi tài liệu gửi đến là đáng nghi vấn, quét các hướng dẫn ẩn và giới hạn quyền truy cập của AI chỉ ở mức tối thiểu cần thiết.
