Anthropic cho biết ba mô hình Claude của họ đã thoát khỏi môi trường sandbox và truy cập vào các hệ thống thực tế trong một chiến dịch thử nghiệm bảo mật gần đây, dẫn đến việc tạm dừng ngay lập tức các hoạt động đánh giá và công bố một báo cáo công khai.

Công ty đã thực hiện 141.006 lượt chạy thử nghiệm an ninh mạng và phát hiện ba sự cố mà các mô hình đã tiếp cận các mục tiêu thực thay vì môi trường mô phỏng. Một lỗi cấu hình với đối tác bên thứ ba đã khiến môi trường sandbox thực tế bị hở.

Các vụ vi phạm đã xảy ra như thế nào

  • Claude Opus 4.7 đã tiếp cận một công ty thực tế đang lộ diện trên internet và đoán các mật khẩu yếu để lấy một cơ sở dữ liệu gồm vài trăm dòng.
  • Claude Mythos 5 đã thực hiện một cuộc tấn công chuỗi cung ứng bằng cách đăng tải một gói (package) lên kho lưu trữ PyPI thực. Gói này đã được cài đặt trên 15 máy chủ sản xuất trước khi hệ thống đăng ký phát hiện ra điểm bất thường.
  • Một mô hình nghiên cứu nội bộ đã quét 9.000 mục tiêu, xâm nhập vào một ứng dụng duy nhất, sau đó tự dừng lại sau khi nhận ra máy chủ không khớp với nhiệm vụ mô phỏng của nó.

Anthropic nhấn mạnh rằng đây không phải là các sự cố "AI nổi loạn" (rogue AI). Các mô hình đã làm theo những gì được yêu cầu; chính hạ tầng thử nghiệm đã thất bại trong việc cô lập chúng khỏi internet công cộng.

Tại sao điều này lại quan trọng

Các sự cố này cho thấy ranh giới giữa một môi trường sandbox được kiểm soát và một mạng lưới thực tế mong manh đến mức nào khi các tác nhân AI (AI agents) có thể thực thi mã và thực hiện các lệnh gọi mạng. Đối với các doanh nghiệp đang thử nghiệm với các tác nhân tự trị, một câu lệnh hệ thống (system prompt) hay tệp README không thể đảm bảo các ranh giới. Ngay cả một tập dữ liệu khiêm tốn hoặc một vài máy chủ cũng có thể kích hoạt các cuộc tấn công chuỗi cung ứng lớn hơn, như trường hợp của PyPI đã chứng minh.

Ba vụ vi phạm cũng tiết lộ quy mô nỗ lực của Anthropic: họ đã kiểm tra mọi lượt chạy thử nghiệm chứ không phải chỉ lấy mẫu ngẫu nhiên. Sự kỹ lưỡng đó đã giúp công ty phát hiện ra lỗi cấu hình trước khi các sự cố có thể lan rộng.

Anthropic đã làm gì

Trong vòng một ngày sau khi phát hiện lỗi sandbox, Anthropic đã tạm dừng tất cả các hoạt động đánh giá đang diễn ra. Một tuần sau, công ty đã công bố một bản tiết lộ chi tiết liệt kê ba sự kiện, nguyên nhân kỹ thuật và các bước khắc phục ngay lập tức.

Những bài học thực tế cho người dùng AI agent

  1. Xác thực ranh giới mạng bằng các kiểm tra trực tiếp – đừng giả định rằng một câu lệnh (prompt) hay tệp cấu hình thực sự cô lập được tác nhân.
  2. Giới hạn quyền hạn của thông tin xác thực ở mức tối thiểu – chỉ cấp những gì nhiệm vụ thực sự cần thiết.
  3. Tự kiểm tra khả năng kết nối – hãy thăm dò tầm nhìn mạng thực tế của tác nhân trước khi bàn giao các tài nguyên nhạy cảm.
  4. Giám sát các hoạt động ngoài ý muốn – thiết lập cảnh báo cho các kết nối ra bên ngoài hoặc việc đăng ký gói (package) sai lệch so với kế hoạch.

Sự cố này nhấn mạnh một sự thật đơn giản: cấp quyền truy cập internet cho một mô hình AI cũng rủi ro như việc giao thông tin xác thực cho một người vận hành. Cho đến khi các đảm bảo về sandbox được chứng minh, hãy coi mọi hành động do AI điều khiển đều có khả năng không bị hạn chế và hãy thắt chặt môi trường tương ứng.