SpaceXAI के Grok Build AI कोडिंग टूल की आलोचना तब हुई जब शोधकर्ताओं ने पाया कि यह उपयोगकर्ता के पूरे रिपॉजिटरी (repositories) को Google Cloud स्टोरेज पर अपलोड कर रहा था। इस उल्लंघन ने इस बात पर चिंता पैदा कर दी है कि AI असिस्टेंट कितना मालिकाना डेटा (proprietary data) इकट्ठा कर सकते हैं और रख सकते हैं।
अत्यधिक डेटा रिटेंशन और सुरक्षा जोखिम
Cereblab के विश्लेषण से पता चला कि Grok Build कमांड-लाइन इंटरफ़ेस (CLI) पूरे कोडबेस को पैक करके क्लाउड पर भेज रहा था। इससे भी अधिक चिंताजनक बात यह है कि टूल ने उन फाइलों को भी खोल दिया जिन्हें अनदेखा करने के लिए कहा गया था और उन सीक्रेट्स (secrets) को भी निकाल लिया जिन्हें डेवलपर्स ने git हिस्ट्री से हटा दिया था।
डेटा इकट्ठा करने का यह स्तर Claude Code जैसे प्रतिस्पर्धियों की तुलना में बहुत अधिक है। King’s College London के सुरक्षा शोधकर्ता डॉ. Lukasz Olejnik ने चेतावनी दी कि इस तरह का संग्रह सोर्स कोड, इंफ्रास्ट्रक्चर डायग्राम, कमजोरियों (vulnerabilities) और क्रेडेंशियल्स (credentials) को रिमोट सर्वर पर उजागर कर सकता है।
SpaceXAI और Elon Musk की प्रतिक्रिया
SpaceXAI ने अपलोड फीचर को बंद कर दिया है। शोधकर्ता अब Grok के सर्वर पर disable_codebase_upload: true फ्लैग देख रहे हैं, जो इस बात की पुष्टि करता है कि ऑटोमैटिक पुश अब नहीं चलता है।
Elon Musk ने X पर पोस्ट किया कि पहले अपलोड किया गया सारा डेटा "पूरी तरह से और पूरी तरह से हटा दिया जाएगा।" उन्होंने उपयोगकर्ताओं से यह भी आग्रह किया कि वे "डिबगिंग समस्याओं" (debugging issues) के लिए SpaceXAI को डेटा रखने दें, एक ऐसा अनुरोध जिसे कई लोग विरोधाभासी मानते हैं।
कंपनी ने रिटेंशन को मैनेज करने के लिए /privacy CLI कमांड का सुझाव दिया, लेकिन Cereblab ने नोट किया कि यह कमांड केवल प्रति-सेशन (per-session) स्टोरेज को टॉगल करता है—यह उन व्यवस्थित रिपॉजिटरी अपलोड को नहीं रोकता है जिनकी वजह से यह विवाद शुरू हुआ।
डेवलपर्स और उद्यमों (Enterprises) के लिए यह क्यों महत्वपूर्ण है
यह घटना डेवलपर्स और उद्यमों को चेतावनी देती है कि AI-संचालित कोडिंग एजेंट अब केवल साधारण ऑटो-कम्प्लीट टूल नहीं रह गए हैं; वे अपने आप कोड पढ़ सकते हैं, संशोधित कर सकते हैं और कमिट (commit) कर सकते हैं। जब कोई एजेंट 'इग्नोर' फाइलों को बायपास करता है या हटाए गए सीक्रेट्स को फिर से जीवित कर देता है, तो "जीरो डेटा रिटेंशन" के किसी भी दावे को तकनीकी परीक्षणों के साथ साबित किया जाना चाहिए, न कि केवल UI वादों के साथ।
CTOs और प्रोडक्ट ओनर्स के लिए, यह घटना निम्नलिखित की आवश्यकता पर जोर देती है:
- वास्तविक कोडबेस पर AI टूल्स के स्वतंत्र ऑडिट।
- अनुबंधात्मक क्लॉज (Contractual clauses) जो डेटा हैंडलिंग, रिटेंशन अवधि और डिलीशन की गारंटी को स्पष्ट रूप से बताते हों।
- रनटाइम सुरक्षा उपाय (Runtime safeguards) जो फाइल-लेवल परमिशन लागू करते हों, विशेष रूप से उन रिपॉजिटरी के लिए जिनमें क्रेडेंशियल्स या पेटेंट एल्गोरिदम हों।
मुख्य बातें (Key Takeaways)
- अनपेक्षित डेटा स्कोपिंग: Grok Build ने प्रतिबंधित फाइलों और हटाए गए सीक्रेट्स सहित पूरी रिपॉजिटरी को Google Cloud पर अपलोड कर दिया।
- शमन स्थिति (Mitigation Status): SpaceXAI ने ऑटोमैटिक अपलोड को अक्षम कर दिया है और पहले से एकत्र किए गए डेटा को मिटाने का वादा किया है।
- सुरक्षा निहितार्थ: यह उल्लंघन AI कोडिंग एजेंटों में अत्यधिक डेटा रिटेंशन के खतरे को उजागर करता है, जिससे मालिकाना लॉजिक और क्रेडेंशियल्स लीक हो सकते हैं।
SpaceXAI का Grok Build टूल चुपचाप उपयोगकर्ता के पूरे कोडबेस को Google Cloud पर अपलोड करते हुए पकड़ा गया, जिससे मालिकाना सोर्स फाइलें और हटाए गए सीक्रेट्स उजागर हो गए।
क्या हुआ
Cereblab ने Grok Build CLI के नेटवर्क ट्रैफिक को Google Cloud बकेट तक ट्रैक किया और पाया कि यह अपलोड के लिए पूरी git रिपॉजिटरी को स्वचालित रूप से पैक कर रहा था। संक्षेप में, असिस्टेंट ने वह डेटा निकाल लिया जिसे उसे अनदेखा करने के लिए कहा गया था।
उल्लंघन का पता कैसे चला
शोधकर्ताओं ने पेलोड (payloads) का निरीक्षण किया और देखा कि अपलोड फ्लैग डिफ़ॉल्ट रूप से सक्षम था, जिसमें कोई ग्लोबल ऑप्ट-आउट (opt-out) विकल्प नहीं था। डॉ. Lukasz Olejnik ने चेतावनी दी कि इस तरह का "अत्यधिक डेटा रिटेंशन" बिजनेस लॉजिक, इंफ्रास्ट्रक्चर विवरण और ऑथेंटिकेशन टोकन को लीक कर सकता है। अन्य AI कोडिंग असिस्टेंट—जिसमें Claude Code एक संदर्भ बिंदु है—की तुलना में, Grok Build का व्यवहार काफी अधिक आक्रामक (invasive) है।
SpaceXAI की प्रतिक्रिया
रिपोर्ट सार्वजनिक होने के बाद, SpaceXAI ने एक अपडेट जारी किया जो disable_codebase_upload: true फ्लैग लौटाता है, जिससे प्रभावी रूप से यह फीचर बंद हो जाता है। Elon Musk ने X पर घोषणा की कि सभी अपलोड किए गए डेटा को "पूरी तरह से और पूरी तरह से हटा दिया जाएगा" और दोहराया कि "प्राइवेसी सेटिंग्स का हमेशा सम्मान किया जाता है।" उन्होंने उपयोगकर्ताओं से यह भी कहा कि वे "डिबगिंग समस्याओं" के लिए कंपनी को डेटा रखने दें, एक ऐसा अनुरोध जिसे कई लोग विरोधाभासी मानते हैं।
फर्म ने रिटेंशन को नियंत्रित करने के लिए /privacy CLI कमांड की सिफारिश की, लेकिन शोधकर्ताओं ने बताया कि यह केवल प्रति-सेशन स्टोरेज को टॉगल करता है और व्यवस्थित रिपॉजिटरी अपलोड को नहीं रोकता है।
डेवलपर्स और उद्यमों के लिए यह क्यों महत्वपूर्ण है
AI-संचालित कोडिंग एजेंट ऑटो-कम्प्लीट से स्वायत्त (autonomous) टूल्स के रूप में विकसित हो रहे हैं जो कोड पढ़ सकते हैं, संशोधित कर सकते हैं और कमिट कर सकते हैं। जब कोई एजेंट स्थानीय 'इग्नोर' फाइलों को बायपास कर सकता है या हटाए गए सीक्रेट्स को फिर से जीवित कर सकता है, तो "जीरो डेटा रिटेंशन" के किसी भी वादे को केवल UI सेटिंग्स से नहीं, बल्कि तकनीकी परीक्षणों के साथ सत्यापित किया जाना चाहिए। CTOs और प्रोडक्ट ओनर्स को चाहिए कि वे:
- Commission independent audits of AI tool behavior on real codebases.
- Negotiate clear contracts defining data handling, retention periods and deletion guarantees.
- Implement runtime safeguards that enforce file-level permissions for sensitive repositories.
The breach also raises a broader question about the trade-off between AI convenience and security. SpaceXAI claims the upload feature collected usage metrics to improve the model, and it disabled the feature and promised to erase existing uploads. Critics note the original design lacked a transparent opt-out and that the post-incident privacy command does not retroactively protect data already in the cloud.
Counter-point from SpaceXAI
SpaceXAI argues the upload feature was meant to gather usage metrics for model improvement. It points to the swift disabling of the feature and its promise to erase existing uploads as evidence of a responsible response. Critics counter that the initial design offered no clear opt-out and that the privacy command fails to protect data already stored in the cloud.
Takeaway
When an AI coding assistant can silently siphon an entire repository, trust becomes a technical issue, not a marketing one. Organizations must demand verifiable, enforceable controls that prevent hidden data exfiltration, or risk exposing the very code that gives them a competitive edge.
