SpaceXAI’s Grok Build AI coding tool kilikabiliwa na ukosoaji mkali baada ya watafiti kugundua kikipakia repositori nzima za watumiaji kwenye hifadhi ya Google Cloud. Uvunjaji huo ulizua wasiwasi kuhusu kiasi cha data za umiliki ambacho wasaidizi wa AI wanaweza kukusanya na kuhifadhi.
Uhifadhi wa Data uliopitiliza na Hatari za Usalama
Uchambuzi wa Cereblab ulionyesha kuwa kiolesura cha mstari wa amri (CLI) cha Grok Build kilikusanya na kutuma misingi ya kodi (codebases) nzima kwenye wingu (cloud). Jambo la kusikitisha zaidi, chombo hicho kilifungua faili ambazo kilikuwa kimeambiwa kuzipuuza na kikapata siri ambazo watengenezaji walikuwa wamezifuta kwenye historia ya git.
Kiwango hicho cha ukusanyaji wa data kinazidi sana washindani kama Claude Code. Dkt. Lukasz Olejnik, mtafiti wa usalama katika King’s College London, alionya kuwa ukusanyaji huo unaweza kuweka wazi kodi chanzo (source code), michoro ya miundombinu, udhaifu, na sifa za ufikiaji (credentials) kwenye seva za mbali.
Itikio kutoka SpaceXAI na Elon Musk
SpaceXAI ilizima kipengele cha kupakia (upload). Watafiti sasa wanaona alama ya disable_codebase_upload: true kwenye seva za Grok, ikithibitisha kuwa uwasilishaji wa kiotomatiki haufanyi kazi tena.
Elon Musk alichapisha kwenye X kwamba data zote zilizopakiwa hapo awali "zitafutwa kabisa na kikamilifu." Pia aliwahimiza watumiaji kuruhusu SpaceXAI kuhifadhi data kwa ajili ya "matatizo ya kurekebisha makosa" (debugging issues), ombi ambalo wengi huliona kama linalopingana.
Kampuni ilipendekeza amri ya CLI ya /privacy ili kudhibiti uhifadhi, lakini Cereblab ilibainisha kuwa amri hiyo inabadilisha tu uhifadhi wa kila kikao (per-session storage)—haizuia upakiaji wa kimfumo wa repositori uliosababisha kashfa hiyo.
Kwa Nini Hili ni Muhimu kwa Watengenezaji na Mashirika
Tukio hili linawaonya watengenezaji na mashirika kwamba mawakala wa uandishi wa kodi wanaongozwa na AI si zana rahisi za kujaza maneno (autocomplete) tena; wanaweza kusoma, kurekebisha na kuweka (commit) kodi wenyewe. Wakala anapopuuza faili za kupuuzwa (ignore files) au kufufua siri zilizofutwa, dai lolote la "uhifadhi wa data sifuri" lazima lithibitishwe kwa majaribio ya kiufundi, si kwa ahadi za UI.
Kwa CTOs na wamiliki wa bidhaa, tukio hili linasisitiza hitaji la:
- Ukaguzi huru wa zana za AI kwenye misingi ya kodi halisi.
- Vipengele vya kimkataba vinavyoeleza wazi ushughulikiaji wa data, vipindi vya uhifadhi na dhamana za kufuta.
- Kinga za wakati wa utendaji (Runtime safeguards) zinazozuia ruhusa za kiwango cha faili, hasa kwa repositori zinazoshikilia sifa za ufikiaji au kanuni zilizopewa hati miliki.
Mambo Muhimu ya Kuzingatia
- Upeo wa Data Usiotarajiwa: Grok Build ilipakia repositori nzima, ikiwa ni pamoja na faili zilizozuiliwa na siri zilizofutwa, kwenye Google Cloud.
- Hali ya Upunguzaji Athari: SpaceXAI ilizima upakiaji wa kiotomatiki na kuahidi kufuta data zilizokwisha kukusanywa.
- Athari za Usalama: Uvunjaji huo unaangazia hatari ya uhifadhi wa data uliopitiliza katika mawakala wa uandishi wa kodi wa AI, ambao wanaweza kuvuja mantiki ya kipekee na sifa za ufikiaji.
Chombo cha Grok Build cha SpaceXAI kilinaswa kikipakia kimya kimya misingi ya kodi nzima ya mtumiaji kwenye Google Cloud, kikivuja faili za chanzo za umiliki na siri zilizofutwa.
Nini Kilitokea
Cereblab ilifuatilia trafiki ya mtandao ya CLI ya Grok Build hadi kwenye Google Cloud bucket na kukuta inapakata repositori kamili za git kwa ajili ya kupakia. Kwa kifupi, msaidizi huyo alivuta data ambayo alikuwa ameambiwa aipuuze.
Jinsi Uvunjaji Ulivyogunduliwa
Watafiti walikagua mizigo ya data (payloads) na kuona alama ya upakiaji ikiwa imewashwa kwa kutoa chaguo la kawaida, bila uwezekano wa kujiondoa kimataifa. Dkt. Lukasz Olejnik alionya kuwa "uhifadhi wa data uliopitiliza" kama huo unaweza kuvuja mantiki ya biashara, maelezo ya miundombinu na tokeni za uthibitishaji. Ikilinganishwa na wasaidizi wengine wa uandishi wa kodi wa AI—Claude Code ikiwa kielelezo—tabia ya Grok Build ni ya kuingilia faragha zaidi kwa kiasi kikubwa.
Itikio la SpaceXAI
Baada ya ripoti hiyo kuwa hadhara, SpaceXAI ilitoa sasisho ambalo linarudisha alama ya disable_codebase_upload: true, hivyo kuzima kipengele hicho kwa ufanisi. Elon Musk alitangaza kwenye X kwamba data zote zilizopakiwa "zitafutwa kabisa na kikamilifu" na alisisitiza kwamba "mipangilio ya faragha kila wakati inaheshimiwa." Pia aliwaomba watumiaji kuruhusu kampuni kuhifadhi data kwa ajili ya "matatizo ya kurekebisha makosa," ombi ambalo wengi huliona kama linalopingana.
Kampuni ilipendekeza amri ya CLI ya /privacy ili kudhibiti uhifadhi, lakini watafiti walibainisha kuwa inabadilisha tu uhifadhi wa kila kikao na haizuia upakiaji wa kimfumo wa repositori.
Kwa Nini Hili ni Muhimu kwa Watengenezaji na Mashirika
Mawakala wa uandishi wa kodi wanaongozwa na AI yanabadilika kutoka kwenye autocomplete hadi kuwa zana zinazojitegemea ambazo zinaweza kusoma, kurekebisha na kuweka kodi. Wakala anapoweza kupuuza faili za ndani za kupuuzwa au kufufua siri zilizofutwa, ahadi yoyote ya “uhifadhi wa data sifuri” lazima ithibitishwe kwa majaribio ya kiufundi, si tu mipangilio ya UI. CTOs na wamiliki wa bidhaa wanapaswa:
- Commission independent audits of AI tool behavior on real codebases.
- Negotiate clear contracts defining data handling, retention periods and deletion guarantees.
- Implement runtime safeguards that enforce file-level permissions for sensitive repositories.
The breach also raises a broader question about the trade-off between AI convenience and security. SpaceXAI claims the upload feature collected usage metrics to improve the model, and it disabled the feature and promised to erase existing uploads. Critics note the original design lacked a transparent opt-out and that the post-incident privacy command does not retroactively protect data already in the cloud.
Counter-point from SpaceXAI
SpaceXAI argues the upload feature was meant to gather usage metrics for model improvement. It points to the swift disabling of the feature and its promise to erase existing uploads as evidence of a responsible response. Critics counter that the initial design offered no clear opt-out and that the privacy command fails to protect data already stored in the cloud.
Takeaway
When an AI coding assistant can silently siphon an entire repository, trust becomes a technical issue, not a marketing one. Organizations must demand verifiable, enforceable controls that prevent hidden data exfiltration, or risk exposing the very code that gives them a competitive edge.
