SpaceXAI’s Grok Build AI coding tool ถูกวิพากษ์วิจารณ์อย่างหนักหลังจากนักวิจัยพบว่ามีการอัปโหลด repository ทั้งหมดของผู้ใช้ไปยัง Google Cloud storage การรั่วไหลครั้งนี้สร้างความตื่นตระหนกเกี่ยวกับปริมาณข้อมูลที่เป็นกรรมสิทธิ์ (proprietary data) ที่ผู้ช่วย AI สามารถดูดซับและจัดเก็บไว้ได้

การจัดเก็บข้อมูลที่เกินความจำเป็นและความเสี่ยงด้านความปลอดภัย

การวิเคราะห์ของ Cereblab แสดงให้เห็นว่า command-line interface (CLI) ของ Grok Build ได้ทำการแพ็กและส่ง codebase ทั้งหมดไปยังคลาวด์ สิ่งที่น่ากังวลยิ่งกว่านั้นคือ เครื่องมือนี้ได้เปิดไฟล์ที่ได้รับคำสั่งให้ข้าม (ignore) และดึงข้อมูลความลับ (secrets) ที่นักพัฒนาเคยลบออกจาก git history ไปแล้วออกมาด้วย

ระดับการกักตุนข้อมูลเช่นนี้ถือว่ารุนแรงกว่าคู่แข่งอย่าง Claude Code มาก ดร. Lukasz Olejnik นักวิจัยด้านความปลอดภัยจาก King’s College London เตือนว่าการเก็บข้อมูลในลักษณะนี้อาจทำให้ซอร์สโค้ด (source code), แผนผังโครงสร้างพื้นฐาน (infrastructure diagrams), ช่องโหว่ (vulnerabilities) และข้อมูลประจำตัว (credentials) ถูกเปิดเผยไปยังเซิร์ฟเวอร์ระยะไกลได้

การตอบรับจาก SpaceXAI และ Elon Musk

SpaceXAI ได้สั่งปิดฟีเจอร์การอัปโหลดแล้ว ขณะนี้นักวิจัยพบ flag disable_codebase_upload: true บนเซิร์ฟเวอร์ของ Grok ซึ่งเป็นการยืนยันว่าการส่งข้อมูลอัตโนมัติไม่ได้ทำงานอีกต่อไป

Elon Musk โพสต์ผ่าน X ว่าข้อมูลทั้งหมดที่เคยอัปโหลดไปแล้วจะถูก "ลบออกอย่างสิ้นเชิงและโดยสิ้นเชิง" นอกจากนี้เขายังกระตุ้นให้ผู้ใช้ยอมให้ SpaceXAI เก็บข้อมูลไว้เพื่อ "การแก้ไขปัญหา (debugging issues)" ซึ่งเป็นคำขอที่หลายคนมองว่าย้อนแย้งกันเอง

บริษัทได้แนะนำให้ใช้คำสั่ง CLI /privacy เพื่อจัดการการจัดเก็บข้อมูล แต่ Cereblab ตั้งข้อสังเกตว่าคำสั่งดังกล่าวทำหน้าที่เพียงแค่สลับการจัดเก็บข้อมูลแบบรายเซสชัน (per-session storage) เท่านั้น แต่ไม่ได้หยุดการอัปโหลด repository อย่างเป็นระบบที่เป็นต้นเหตุของเรื่องอื้อฉาวนี้

ทำไมเรื่องนี้จึงสำคัญสำหรับนักพัฒนาและองค์กร

เหตุการณ์นี้เป็นคำเตือนแก่นักพัฒนาและองค์กรว่า AI-driven coding agents ไม่ใช่แค่เครื่องมือ autocomplete ธรรมดาอีกต่อไป แต่พวกมันสามารถอ่าน แก้ไข และ commit โค้ดได้ด้วยตัวเอง เมื่อ agent สามารถข้ามไฟล์ ignore หรือดึงความลับที่ถูกลบไปแล้วกลับมาได้ คำกล่าวอ้างเรื่อง "zero data retention" (การไม่จัดเก็บข้อมูลเลย) จึงต้องได้รับการพิสูจน์ด้วยการทดสอบทางเทคนิค ไม่ใช่แค่คำสัญญาผ่านหน้า UI

สำหรับ CTO และเจ้าของผลิตภัณฑ์ เหตุการณ์นี้เน้นย้ำถึงความจำเป็นในเรื่อง:

  • การตรวจสอบที่เป็นอิสระ (Independent audits) ของเครื่องมือ AI บน codebase จริง
  • ข้อกำหนดในสัญญา (Contractual clauses) ที่ระบุรายละเอียดการจัดการข้อมูล ระยะเวลาการจัดเก็บ และการรับประกันการลบข้อมูล
  • มาตรการป้องกันขณะทำงาน (Runtime safeguards) ที่บังคับใช้การอนุญาตในระดับไฟล์ (file-level permissions) โดยเฉพาะสำหรับ repository ที่เก็บข้อมูลประจำตัวหรืออัลกอริทึมที่มีสิทธิบัตร

สรุปประเด็นสำคัญ

  • ขอบเขตข้อมูลที่ไม่ตั้งใจ (Unintended Data Scoping): Grok Build อัปโหลด repository ทั้งหมด รวมถึงไฟล์ที่ถูกจำกัดและข้อมูลความลับที่ถูกลบไปแล้วไปยัง Google Cloud
  • สถานะการบรรเทาปัญหา (Mitigation Status): SpaceXAI ได้ปิดการอัปโหลดอัตโนมัติและให้คำมั่นว่าจะลบข้อมูลที่ถูกเก็บรวบรวมไปแล้ว
  • ผลกระทบด้านความปลอดภัย (Security Implications): การรั่วไหลครั้งนี้ชี้ให้เห็นถึงอันตรายของการจัดเก็บข้อมูลที่เกินความจำเป็นใน AI coding agents ซึ่งอาจทำให้ตรรกะที่เป็นกรรมสิทธิ์และข้อมูลประจำตัวรั่วไหลได้

เครื่องมือ Grok Build ของ SpaceXAI ถูกตรวจพบว่าแอบอัปโหลด codebase ทั้งหมดของผู้ใช้ไปยัง Google Cloud อย่างเงียบๆ ซึ่งทำให้ไฟล์ซอร์สโค้ดที่เป็นกรรมสิทธิ์และข้อมูลความลับที่ถูกลบไปแล้วถูกเปิดเผย

เกิดอะไรขึ้น

Cereblab ได้ติดตามการรับส่งข้อมูลเครือข่าย (network traffic) ของ Grok Build CLI ไปยัง Google Cloud bucket และพบว่ามันทำการแพ็ก git repositories ฉบับเต็มเพื่ออัปโหลดโดยอัตโนมัติ สรุปสั้นๆ คือ ผู้ช่วยตัวนี้ได้ดึงข้อมูลที่ได้รับคำสั่งให้ข้ามไปมาใช้งาน

การค้นพบการรั่วไหล

นักวิจัยได้ตรวจสอบ payload และพบว่า flag การอัปโหลดถูกเปิดใช้งานไว้เป็นค่าเริ่มต้น โดยไม่มีตัวเลือกในการยกเลิก (opt-out) ในระดับสากล ดร. Lukasz Olejnik เตือนว่า "การจัดเก็บข้อมูลที่เกินความจำเป็น" เช่นนี้อาจทำให้ตรรกะทางธุรกิจ (business logic), รายละเอียดโครงสร้างพื้นฐาน และ authentication tokens รั่วไหลได้ เมื่อเปรียบเทียบกับผู้ช่วยเขียนโค้ด AI อื่นๆ โดยมี Claude Code เป็นจุดอ้างอิง พฤติกรรมของ Grok Build นั้นถือว่ารุกล้ำความเป็นส่วนตัวมากกว่าอย่างเห็นได้ชัด

การตอบรับจาก SpaceXAI

หลังจากรายงานถูกเผยแพร่สู่สาธารณะ SpaceXAI ได้ออกอัปเดตที่ส่งค่า flag disable_codebase_upload: true กลับมา ซึ่งเป็นการปิดฟีเจอร์ดังกล่าวอย่างมีประสิทธิภาพ Elon Musk ประกาศผ่าน X ว่าข้อมูลที่อัปโหลดไปทั้งหมดจะถูก "ลบออกอย่างสิ้นเชิงและโดยสิ้นเชิง" และย้ำว่า "การตั้งค่าความเป็นส่วนตัวจะได้รับการเคารพเสมอ" นอกจากนี้เขายังขอให้ผู้ใช้ยอมให้บริษัทเก็บข้อมูลไว้เพื่อ "การแก้ไขปัญหา (debugging issues)" ซึ่งเป็นคำขอที่หลายคนมองว่าย้อนแย้งกันเอง

บริษัทแนะนำให้ใช้คำสั่ง CLI /privacy เพื่อควบคุมการจัดเก็บข้อมูล แต่นักวิจัยชี้ให้เห็นว่ามันทำหน้าที่เพียงแค่สลับการจัดเก็บข้อมูลแบบรายเซสชัน (per-session storage) และไม่ได้หยุดการอัปโหลด repository อย่างเป็นระบบ

ทำไมเรื่องนี้จึงสำคัญสำหรับนักพัฒนาและองค์กร

AI-driven coding agents กำลังวิวัฒนาการจาก autocomplete ไปสู่เครื่องมืออัตโนมัติ (autonomous tools) ที่สามารถอ่าน แก้ไข และ commit โค้ดได้ เมื่อ agent สามารถข้ามไฟล์ ignore ในเครื่องหรือดึงความลับที่ถูกลบไปแล้วกลับมาได้ คำสัญญาเรื่อง “zero data retention” ใดๆ ก็ตามต้องได้รับการตรวจสอบด้วยการทดสอบทางเทคนิค ไม่ใช่แค่การตั้งค่าผ่าน UI เท่านั้น CTO และเจ้าของผลิตภัณฑ์ควร:

  • Commission independent audits of AI tool behavior on real codebases.
  • Negotiate clear contracts defining data handling, retention periods and deletion guarantees.
  • Implement runtime safeguards that enforce file-level permissions for sensitive repositories.

The breach also raises a broader question about the trade-off between AI convenience and security. SpaceXAI claims the upload feature collected usage metrics to improve the model, and it disabled the feature and promised to erase existing uploads. Critics note the original design lacked a transparent opt-out and that the post-incident privacy command does not retroactively protect data already in the cloud.

Counter-point from SpaceXAI

SpaceXAI argues the upload feature was meant to gather usage metrics for model improvement. It points to the swift disabling of the feature and its promise to erase existing uploads as evidence of a responsible response. Critics counter that the initial design offered no clear opt-out and that the privacy command fails to protect data already stored in the cloud.

Takeaway

When an AI coding assistant can silently siphon an entire repository, trust becomes a technical issue, not a marketing one. Organizations must demand verifiable, enforceable controls that prevent hidden data exfiltration, or risk exposing the very code that gives them a competitive edge.