SpaceXAI’s Grok Build AI coding tool đã vấp phải sự chỉ trích sau khi các nhà nghiên cứu phát hiện nó tải toàn bộ kho lưu trữ (repository) của người dùng lên Google Cloud storage. Vụ vi phạm đã gây ra sự lo ngại về việc các trợ lý AI có thể thu thập và lưu giữ bao nhiêu dữ liệu độc quyền.

Lưu trữ dữ liệu quá mức và các rủi ro bảo mật

Phân tích của Cereblab cho thấy giao diện dòng lệnh (CLI) của Grok Build đã đóng gói và gửi toàn bộ mã nguồn (codebase) lên đám mây. Đáng lo ngại hơn, công cụ này còn mở các tệp mà nó đã được yêu cầu bỏ qua và truy xuất các thông tin bí mật (secrets) mà các nhà phát triển đã xóa khỏi lịch sử git.

Mức độ thu thập dữ liệu đó vượt xa các đối thủ cạnh tranh như Claude Code. Tiến sĩ Lukasz Olejnik, một nhà nghiên cứu bảo mật tại King’s College London, cảnh báo rằng việc thu thập như vậy có thể làm lộ mã nguồn, sơ đồ hạ tầng, các lỗ hổng và thông tin xác thực lên các máy chủ từ xa.

Phản hồi từ SpaceXAI và Elon Musk

SpaceXAI đã tắt tính năng tải lên. Các nhà nghiên cứu hiện thấy một cờ disable_codebase_upload: true trên các máy chủ của Grok, xác nhận rằng việc tự động đẩy dữ liệu không còn diễn ra nữa.

Elon Musk đã đăng trên X rằng tất cả dữ liệu đã tải lên trước đó sẽ được "xóa bỏ hoàn toàn và triệt để". Ông cũng thúc giục người dùng cho phép SpaceXAI giữ lại dữ liệu để "khắc phục các lỗi (debugging issues)", một yêu cầu mà nhiều người coi là mâu thuẫn.

Công ty đã đề xuất lệnh CLI /privacy để quản lý việc lưu trữ, nhưng Cereblab lưu ý rằng lệnh này chỉ bật/tắt việc lưu trữ theo từng phiên (per-session)—nó không ngăn chặn việc tải lên các kho lưu trữ một cách có hệ thống vốn đã gây ra vụ bê bối.

Tại sao điều này lại quan trọng đối với các nhà phát triển và doanh nghiệp

Sự việc này cảnh báo các nhà phát triển và doanh nghiệp rằng các tác nhân lập trình (coding agents) dựa trên AI không còn là những công cụ tự động hoàn thành (autocomplete) đơn thuần; chúng có thể tự đọc, sửa đổi và commit mã nguồn. Khi một tác nhân bỏ qua các tệp ignore hoặc khôi phục các bí mật đã bị xóa, bất kỳ tuyên bố nào về "không lưu trữ dữ liệu" (zero data retention) đều phải được chứng minh bằng các bài kiểm tra kỹ thuật, chứ không phải bằng những lời hứa trên giao diện người dùng (UI).

Đối với các CTO và chủ sở hữu sản phẩm, sự cố này nhấn mạnh nhu cầu về:

  • Kiểm toán độc lập các công cụ AI trên các mã nguồn thực tế.
  • Các điều khoản hợp đồng quy định rõ ràng về việc xử lý dữ liệu, thời gian lưu trữ và các cam kết xóa dữ liệu.
  • Các biện pháp bảo vệ trong thời gian chạy (runtime safeguards) nhằm thực thi quyền truy cập ở cấp độ tệp, đặc biệt là đối với các kho lưu trữ chứa thông tin xác thực hoặc các thuật toán đã được cấp bằng sáng chế.

Các điểm chính cần lưu ý

  • Phạm vi dữ liệu không mong muốn: Grok Build đã tải toàn bộ các kho lưu trữ, bao gồm cả các tệp bị hạn chế và các bí mật đã xóa, lên Google Cloud.
  • Tình trạng khắc phục: SpaceXAI đã vô hiệu hóa tính năng tải lên tự động và cam kết xóa dữ liệu đã thu thập được.
  • Hệ lụy bảo mật: Vụ vi phạm làm nổi bật nguy cơ của việc lưu trữ dữ liệu quá mức trong các tác nhân lập trình AI, điều có thể làm rò rỉ logic độc quyền và thông tin xác thực.

Công cụ Grok Build của SpaceXAI đã bị phát hiện âm thầm tải toàn bộ mã nguồn của người dùng lên Google Cloud, làm lộ các tệp nguồn độc quyền và các bí mật đã bị xóa.

Chuyện gì đã xảy ra

Cereblab đã truy vết lưu lượng mạng của Grok Build CLI đến một Google Cloud bucket và phát hiện nó tự động đóng gói toàn bộ các kho lưu trữ git để tải lên. Nói tóm lại, trợ lý này đã lấy dữ liệu mà nó đã được yêu cầu bỏ qua.

Vụ vi phạm được phát hiện như thế nào

Các nhà nghiên cứu đã kiểm tra các gói dữ liệu (payloads) và thấy rằng cờ tải lên được bật theo mặc định, mà không có tùy chọn từ chối (opt-out) trên toàn cầu. Tiến sĩ Lukasz Olejnik cảnh báo rằng việc "lưu trữ dữ liệu quá mức" như vậy có thể làm rò rỉ logic kinh doanh, chi tiết hạ tầng và các mã thông báo xác thực (authentication tokens). So với các trợ lý lập trình AI khác—với Claude Code là một điểm tham chiếu—hành vi của Grok Build xâm phạm rõ rệt hơn nhiều.

Phản hồi của SpaceXAI

Sau khi báo cáo được công khai, SpaceXAI đã tung ra một bản cập nhật trả về cờ disable_codebase_upload: true, về cơ bản là tắt tính năng này. Elon Musk đã thông báo trên X rằng tất cả dữ liệu đã tải lên sẽ được "xóa bỏ hoàn toàn và triệt để" và nhắc lại rằng "các cài đặt quyền riêng tư luôn được tôn trọng". Ông cũng yêu cầu người dùng cho phép công ty giữ lại dữ liệu để "khắc phục các lỗi (debugging issues)", một yêu cầu mà nhiều người coi là mâu thuẫn.

Công ty đã đề xuất lệnh CLI /privacy để kiểm soát việc lưu trữ, nhưng các nhà nghiên cứu chỉ ra rằng nó chỉ bật/tắt việc lưu trữ theo từng phiên và không ngăn chặn việc tải lên các kho lưu trữ một cách có hệ thống.

Tại sao điều này lại quan trọng đối với các nhà phát triển và doanh nghiệp

Các tác nhân lập trình dựa trên AI đang phát triển từ các công cụ tự động hoàn thành thành các công cụ tự trị có thể đọc, sửa đổi và commit mã nguồn. Khi một tác nhân có thể bỏ qua các tệp ignore cục bộ hoặc khôi phục các bí mật đã bị xóa, bất kỳ lời hứa nào về “không lưu trữ dữ liệu” (zero data retention) đều phải được xác minh bằng các bài kiểm tra kỹ thuật, chứ không chỉ bằng các cài đặt trên giao diện người dùng. Các CTO và chủ sở hữu sản phẩm nên:

  • Ủy thác kiểm toán độc lập về hành vi của các công cụ AI trên các kho mã nguồn thực tế.
  • Thương lượng các hợp đồng rõ ràng quy định về xử lý dữ liệu, thời gian lưu trữ và cam kết xóa dữ liệu.
  • Triển khai các biện pháp bảo vệ runtime nhằm thực thi quyền truy cập ở cấp độ tệp cho các kho lưu trữ nhạy cảm.

Vụ vi phạm cũng đặt ra một câu hỏi rộng hơn về sự đánh đổi giữa sự tiện lợi của AI và tính bảo mật. SpaceXAI khẳng định rằng tính năng tải lên được sử dụng để thu thập các chỉ số sử dụng nhằm cải thiện mô hình, và họ đã vô hiệu hóa tính năng này cũng như hứa sẽ xóa các dữ liệu đã tải lên trước đó. Các nhà phê bình lưu ý rằng thiết kế ban đầu thiếu cơ chế từ chối (opt-out) minh bạch và lệnh bảo mật sau sự cố không có tác dụng bảo vệ hồi tố đối với dữ liệu đã nằm trên đám mây.

Quan điểm phản biện từ SpaceXAI

SpaceXAI lập luận rằng tính năng tải lên nhằm mục đích thu thập các chỉ số sử dụng để cải thiện mô hình. Họ chỉ ra việc nhanh chóng vô hiệu hóa tính năng và lời hứa xóa các dữ liệu đã tải lên là minh chứng cho một phản ứng có trách nhiệm. Các nhà phê bình phản bác rằng thiết kế ban đầu không cung cấp tùy chọn từ chối rõ ràng và lệnh bảo mật không thể bảo vệ dữ liệu đã được lưu trữ trên đám mây.

Bài học rút ra

Khi một trợ lý lập trình AI có thể âm thầm lấy đi toàn bộ một kho lưu trữ, niềm tin trở thành một vấn đề kỹ thuật chứ không còn là vấn đề tiếp thị. Các tổ chức phải yêu cầu các biện pháp kiểm soát có thể xác minh và thực thi được nhằm ngăn chặn việc rò rỉ dữ liệu ngầm, nếu không sẽ đối mặt với rủi ro làm lộ chính mã nguồn tạo nên lợi thế cạnh tranh của họ.