SpaceXAI-ன் Grok Build AI கோடிங் கருவி, பயனர்களின் முழுமையான ரெபாசிட்டரிகளை (repositories) Google Cloud சேமிப்பகத்திற்குப் பதிவேற்றுவதை ஆராய்ச்சியாளர்கள் கண்டறிந்த பிறகு கடும் விமர்சனங்களைச் சந்தித்தது. AI உதவியாளர்கள் எவ்வளவு காப்புரிமை பெற்ற தரவுகளை (proprietary data) உள்வாங்கிக் கொள்ள முடியும் மற்றும் சேமித்து வைக்க முடியும் என்பது குறித்த அச்சத்தை இந்தத் தரவு மீறல் ஏற்படுத்தியுள்ளது.
அதிகப்படியான தரவுத் தக்கவைப்பு மற்றும் பாதுகாப்பு அபாயங்கள்
Cereblab-ன் பகுப்பாய்வு, Grok Build command-line interface (CLI), முழுமையான codebase-களைத் தொகுத்து மேகக்கணிமைக்கு (cloud) அனுப்புவதைக் காட்டியது. இன்னும் கவலைக்குரிய விஷயம் என்னவென்றால், தவிர்க்கப்பட வேண்டும் என்று அறிவுறுத்தப்பட்ட கோப்புகளைக் கூட இந்தக் கருவி திறந்து பார்த்ததுடன், டெவலப்பர்கள் git வரலாற்றிலிருந்து நீக்கிய ரகசியத் தகவல்களையும் (secrets) மீட்டெடுத்தது.
இத்தகைய தரவுச் சேகரிப்பு, Claude Code போன்ற போட்டியாளர்களை விடப் பல மடங்கு பெரியது. லண்டனில் உள்ள King’s College-ன் பாதுகாப்பு ஆராய்ச்சியாளர் டாக்டர் Lukasz Olejnik, இத்தகைய சேகரிப்பு மூலக் குறியீடு (source code), உள்கட்டமைப்பு வரைபடங்கள் (infrastructure diagrams), பாதிப்புகள் (vulnerabilities) மற்றும் சான்றுகளை (credentials) தொலைதூரச் சேவையகங்களுக்கு (remote servers) வெளிப்படுத்தக்கூடும் என்று எச்சரித்தார்.
SpaceXAI மற்றும் Elon Musk-ன் பதில்
SpaceXAI பதிவேற்றும் வசதியை நிறுத்தியது. ஆராய்ச்சியாளர்கள் இப்போது Grok-ன் சேவையகங்களில் disable_codebase_upload: true என்ற ஃபிளாக் (flag)-ஐக் காண்கின்றனர், இது தானியங்கி பதிவேற்றம் இனி நடைபெறாது என்பதை உறுதிப்படுத்துகிறது.
ஏற்கனவே பதிவேற்றப்பட்ட அனைத்துத் தரவுகளும் "முழுமையாகவும் முற்றிலும் நீக்கப்படும்" என்று Elon Musk X தளத்தில் பதிவிட்டிருந்தார். மேலும், "பிழைத்திருத்தப் பிரச்சனைகளுக்காக" (debugging issues) SpaceXAI தரவுகளைத் தக்கவைத்துக் கொள்ளுமாறு அவர் பயனர்களைக் கேட்டுக்கொண்டார்; இந்த வேண்டுகோள் முரண்பாடானது என்று பலர் கருதுகின்றனர்.
தரவைத் தக்கவைப்பைப் நிர்வகிக்க /privacy CLI கட்டளையைப் பயன்படுத்துமாறு நிறுவனம் பரிந்துரைத்தது, ஆனால் அந்தத் தரவு மீறலுக்குக் காரணமான முறையான ரெபாசிட்டரி பதிவேற்றங்களைத் தடுக்காமல், அந்தத் தற்காலிகச் சேமிப்பை (per-session storage) மட்டுமே அந்தத் தளம் மாற்றியமைக்கிறது என்று Cereblab குறிப்பிட்டது.
டெவலப்பர்கள் மற்றும் நிறுவனங்களுக்கு இது ஏன் முக்கியமானது
AI மூலம் இயங்கும் கோடிங் ஏஜெண்டுகள் (coding agents) இனி வெறும் 'autocomplete' கருவிகள் மட்டுமல்ல; அவை தாங்களாகவே குறியீடுகளைப் படிக்கவும், மாற்றவும் மற்றும் commit செய்யவும் முடியும் என்று இந்தச் சம்பவம் டெவலப்பர்களுக்கும் நிறுவனங்களுக்கும் எச்சரிக்கை விடுக்கிறது. ஒரு ஏஜென்ட் 'ignore' கோப்புகளைத் தவிர்த்து அல்லது நீக்கப்பட்ட ரகசியங்களைத் மீட்டெடுக்கும்போது, "பூஜ்ஜிய தரவுத் தக்கவைப்பு" (zero data retention) என்ற எந்தவொரு கூற்றும் UI வாக்குறுதிகளால் அல்லாமல், தொழில்நுட்பச் சோதனைகள் மூலம் நிரூபிக்கப்பட வேண்டும்.
CTO-க்கள் மற்றும் தயாரிப்பு உரிமையாளர்களுக்கு (product owners), இந்தச் சம்பவம் கீழ்க்கண்டவைகளின் அவசியத்தை வலியுறுத்துகிறது:
- சுயாதீனத் தணிக்கைகள் (Independent audits) - உண்மையான codebase-களில் AI கருவிகளைச் சோதித்தல்.
- ஒப்பந்தக்clauses (Contractual clauses) - தரவு கையாளுதல், தக்கவைப்பு காலங்கள் மற்றும் நீக்க உத்தரவாதங்களை விவரித்தல்.
- Runtime பாதுகாப்புகள் (Runtime safeguards) - கோப்பு-நிலை அனுமதிகளை (file-level permissions) அமல்படுத்துதல், குறிப்பாக சான்றுகள் அல்லது காப்புரிமை பெற்ற அல்காரிதம்களைக் கொண்ட ரெபாசிட்டரிகளுக்கு.
முக்கியக் குறிப்புகள்
- தவறான தரவு எல்லை (Unintended Data Scoping): Grok Build, கட்டுப்பாடான கோப்புகள் மற்றும் நீக்கப்பட்ட ரகசியங்கள் உட்பட முழுமையான ரெபாசிட்டரிகளை Google Cloud-க்கு பதிவேற்றியது.
- தணிப்பு நிலை (Mitigation Status): SpaceXAI தானியங்கி பதிவேற்றத்தை நிறுத்தியது மற்றும் ஏற்கனவே சேகரிக்கப்பட்ட தரவை அழிப்பதாக உறுதியளித்தது.
- பாதுகாப்பு தாக்கங்கள் (Security Implications): இந்தத் தரவு மீறல், AI கோடிங் ஏஜெண்டுகளில் அதிகப்படியான தரவுத் தக்கவைப்பினால் ஏற்படும் ஆபத்தை எடுத்துக்காட்டுகிறது, இது காப்புரிமை பெற்ற லாஜிக் மற்றும் சான்றுகளை கசியவிடக்கூடும்.
SpaceXAI-ன் Grok Build கருவி, பயனர்களின் முழுமையான codebase-களை அமைதியுடன் Google Cloud-க்கு பதிவேற்றுவதாகவும், அதன் மூலம் காப்புரிமை பெற்ற மூலக் கோப்புகள் மற்றும் நீக்கப்பட்ட ரகசியங்களை வெளிப்படுத்துவதாகவும் கண்டறியப்பட்டது.
என்ன நடந்தது
Cereblab, Grok Build CLI-ன் நெட்வொர்க் டிராஃபிக்கை (network traffic) ஒரு Google Cloud bucket-க்குத் தொடர்புபடுத்திப் பார்த்தபோது, அது முழுமையான git ரெபாசிட்டரிகளைத் தானாகவே தொகுத்து பதிவேற்றுவதைக் கண்டறிந்தது. சுருக்கமாகச் சொன்னால், தவிர்க்கப்பட வேண்டும் என்று அறிவுறுத்தப்பட்ட தரவுகளை அந்த உதவியாளர் எடுத்தது.
தரவு மீறல் எவ்வாறு கண்டறியப்பட்டது
ஆராய்ச்சியாளர்கள் பேலோட்களை (payloads) ஆய்வு செய்தபோது, பதிவேற்ற ஃபிளாக் (upload flag) இயல்பாகவே (by default) செயல்படுத்தப்பட்டிருப்பதையும், உலகளாவிய அளவில் அதைத் தவிர்க்க (global opt-out) வசதி இல்லை என்பதையும் கண்டறிந்தனர். இத்தகைய "அதிகப்படியான தரவுத் தக்கவைப்பு" வணிக லாஜிக், உள்கட்டமைப்பு விவரங்கள் மற்றும் அங்கீகார டோக்கன்களை (authentication tokens) கசியவிடக்கூடும் என்று டாக்டர் Lukasz Olejnik எச்சரித்தார். பிற AI கோடிங் உதவியாளர்களுடன் ஒப்பிடும்போது—Claude Code ஒரு ஒப்பீட்டுப் புள்ளியாகக் கொள்ளப்பட்டால்—Grok Build-ன் செயல்பாடு மிகவும் ஊடுருவும் தன்மையுடன் (invasive) உள்ளது.
SpaceXAI-ன் பதில்
அறிக்கை பொதுமக்களுக்குத் தெரியவந்த பிறகு, SpaceXAI ஒரு புதிய அப்டேட்டை வெளியிட்டது, இது disable_codebase_upload: true என்ற ஃபிளாக்கை வழங்குகிறது, இதன் மூலம் அந்த வசதி நடைமுறையில் நிறுத்தப்பட்டுள்ளது. பதிவேற்றப்பட்ட அனைத்துத் தரவுகளும் "முழுமையாகவும் முற்றிலும் நீக்கப்படும்" என்று Elon Musk X தளத்தில் அறிவித்ததுடன், "தனியுரிமை அமைப்புகள் எப்போதும் மதிக்கப்படுகின்றன" என்றும் மீண்டும் வலியுறுத்தினார். மேலும், "பிழைத்திருத்தப் பிரச்சனைகளுக்காக" தரவுகளைத் தக்கவைத்துக் கொள்ளுமாறு அவர் பயனர்களைக் கேட்டுக்கொண்டார்; இந்த வேண்டுகோள் முரண்பாடானது என்று பலர் கருதுகின்றனர்.
தரவைத் தக்கவைப்பைக் கட்டுப்படுத்த /privacy CLI கட்டளையைப் பயன்படுத்துமாறு நிறுவனம் பரிந்துரைத்தது, ஆனால் அது தற்காலிகச் சேமிப்பை (per-session storage) மட்டுமே மாற்றியமைக்கும் என்றும், முறையான ரெபாசிட்டரி பதிவேற்றங்களைத் தடுக்காது என்றும் ஆராய்ச்சியாளர்கள் சுட்டிக்காட்டினர்.
டெவலப்பர்கள் மற்றும் நிறுவனங்களுக்கு இது ஏன் முக்கியமானது
AI மூலம் இயங்கும் கோடிங் ஏஜெண்டுகள், வெறும் 'autocomplete' கருவிகளிலிருந்து குறியீடுகளைப் படிக்கவும், மாற்றவும் மற்றும் commit செய்யவும் கூடிய தன்னாட்சி கருவிகளாக (autonomous tools) பரிணமித்து வருகின்றன. ஒரு ஏஜென்ட் உள்ளூர் 'ignore' கோப்புகளைத் தவிர்க்கவோ அல்லது நீக்கப்பட்ட ரகசியங்களைத் மீட்டெடுக்கவோ முடியும் போது, "பூஜ்ஜிய தரவுத் தக்கவைப்பு" (zero data retention) என்ற எந்தவொரு வாக்குறுத்தும் வெறும் UI அமைப்புகளால் மட்டுமல்லாமல், தொழில்நுட்பச் சோதனைகள் மூலம் சரிபார்க்கப்பட வேண்டும். CTO-க்கள் மற்றும் தயாரிப்பு உரிமையாளர்கள் செய்ய வேண்டியவை:
- Commission independent audits of AI tool behavior on real codebases.
- Negotiate clear contracts defining data handling, retention periods and deletion guarantees.
- Implement runtime safeguards that enforce file-level permissions for sensitive repositories.
The breach also raises a broader question about the trade-off between AI convenience and security. SpaceXAI claims the upload feature collected usage metrics to improve the model, and it disabled the feature and promised to erase existing uploads. Critics note the original design lacked a transparent opt-out and that the post-incident privacy command does not retroactively protect data already in the cloud.
Counter-point from SpaceXAI
SpaceXAI argues the upload feature was meant to gather usage metrics for model improvement. It points to the swift disabling of the feature and its promise to erase existing uploads as evidence of a responsible response. Critics counter that the initial design offered no clear opt-out and that the privacy command fails to protect data already stored in the cloud.
Takeaway
When an AI coding assistant can silently siphon an entire repository, trust becomes a technical issue, not a marketing one. Organizations must demand verifiable, enforceable controls that prevent hidden data exfiltration, or risk exposing the very code that gives them a competitive edge.
