Lo strumento di coding AI Grok Build di SpaceXAI è finito sotto accusa dopo che dei ricercatori hanno scoperto che caricava interi repository degli utenti su Google Cloud storage. La violazione ha scatenato l'allarme su quanta quantità di dati proprietari gli assistenti AI possano assorbire e conservare.

Conservazione eccessiva dei dati e rischi per la sicurezza

L'analisi di Cereblab ha mostrato che l'interfaccia a riga di comando (CLI) di Grok Build impacchettava e inviava interi codebase al cloud. Ancora più preoccupante è che lo strumento apriva file che gli era stato ordinato di ignorare e recuperava segreti che gli sviluppatori avevano rimosso dalla cronologia git.

Tale livello di accumulo di dati mette in ombra i concorrenti come Claude Code. Il Dr. Lukasz Olejnik, ricercatore di sicurezza al King’s College di Londra, ha avvertito che una simile raccolta potrebbe esporre codice sorgente, diagrammi di infrastruttura, vulnerabilità e credenziali a server remoti.

La risposta di SpaceXAI ed Elon Musk

SpaceXAI ha disattivato la funzione di caricamento. I ricercatori vedono ora un flag disable_codebase_upload: true sui server di Grok, confermando che l'invio automatico non è più attivo.

Elon Musk ha postato su X che tutti i dati precedentemente caricati sarebbero stati "completamente e totalmente eliminati". Ha inoltre esortato gli utenti a consentire a SpaceXAI di conservare i dati per "problemi di debugging", una richiesta che molti considerano contraddittoria.

L'azienda ha suggerito il comando CLI /privacy per gestire la conservazione, ma Cereblab ha osservato che il comando attiva o disattiva solo l'archiviazione per sessione — non interrompe i caricamenti sistematici dei repository che hanno scatenato lo scandalo.

Perché questo è importante per sviluppatori e aziende

L'episodio avverte sviluppatori e aziende che gli agenti di coding basati su AI non sono più semplici strumenti di autocompletamento; possono leggere, modificare e fare il commit del codice autonomamente. Quando un agente bypassa i file di ignore o resuscita segreti eliminati, qualsiasi affermazione di "zero data retention" deve essere dimostrata con test tecnici, non con promesse dell'interfaccia utente.

Per CTO e product owner, l'incidente sottolinea la necessità di:

  • Audit indipendenti degli strumenti AI su codebase reali.
  • Clausole contrattuali che specifichino la gestione dei dati, i periodi di conservazione e le garanzie di eliminazione.
  • Salvaguardie a runtime che impongano permessi a livello di file, specialmente per i repository che contengono credenziali o algoritmi brevettati.

Punti chiave

  • Ambito dei dati non intenzionale: Grok Build ha caricato interi repository, inclusi file riservati e segreti eliminati, su Google Cloud.
  • Stato della mitigazione: SpaceXAI ha disabilitato il caricamento automatico e si è impegnata a cancellare i dati già raccolti.
  • Implicazioni per la sicurezza: La violazione evidenzia il pericolo di una conservazione eccessiva dei dati negli agenti di coding AI, che possono far trapelare logica proprietaria e credenziali.

Lo strumento Grok Build di SpaceXAI è stato colto a caricare silenziosamente interi codebase degli utenti su Google Cloud, esponendo file sorgente proprietari e segreti eliminati.

Cosa è successo

Cereblab ha tracciato il traffico di rete della CLI di Grok Build verso un bucket di Google Cloud e ha scoperto che impacchettava automaticamente interi repository git per il caricamento. In breve, l'assistente ha estratto dati che gli era stato ordinato di ignorare.

Come è stata scoperta la violazione

I ricercatori hanno ispezionato i payload e hanno visto che il flag di caricamento era abilitato per impostazione predefinita, senza alcuna opzione di disattivazione globale. Il Dr. Lukasz Olejnik ha avvertito che una tale "conservazione eccessiva dei dati" potrebbe far trapelare logica di business, dettagli dell'infrastruttura e token di autenticazione. Rispetto ad altri assistenti di coding AI — con Claude Code come punto di riferimento — il comportamento di Grok Build è marcatamente più invasivo.

La risposta di SpaceXAI

Dopo che il rapporto è diventato pubblico, SpaceXAI ha rilasciato un aggiornamento che restituisce un flag disable_codebase_upload: true, disattivando di fatto la funzione. Elon Musk ha annunciato su X che tutti i dati caricati sarebbero stati "completamente e totalmente eliminati" e ha ribadito che "le impostazioni sulla privacy sono sempre rispettate". Ha inoltre chiesto agli utenti di consentire all'azienda di conservare i dati per "problemi di debugging", una richiesta che molti considerano contraddittoria.

L'azienda ha raccomandato il comando CLI /privacy per controllare la conservazione, ma i ricercatori hanno sottolineato che esso attiva o disattiva solo l'archiviazione per sessione e non interrompe i caricamenti sistematici dei repository.

Perché è importante per sviluppatori e aziende

Gli agenti di coding basati su AI si stanno evolvendo da strumenti di autocompletamento a strumenti autonomi in grado di leggere, modificare e fare il commit del codice. Quando un agente può bypassare i file di ignore locali o far riemergere segreti eliminati, qualsiasi promessa di “zero data retention” deve essere verificata con test tecnici, non solo con le impostazioni dell'interfaccia utente. I CTO e i product owner dovrebbero:

  • Commission independent audits of AI tool behavior on real codebases.
  • Negotiate clear contracts defining data handling, retention periods and deletion guarantees.
  • Implement runtime safeguards that enforce file-level permissions for sensitive repositories.

The breach also raises a broader question about the trade-off between AI convenience and security. SpaceXAI claims the upload feature collected usage metrics to improve the model, and it disabled the feature and promised to erase existing uploads. Critics note the original design lacked a transparent opt-out and that the post-incident privacy command does not retroactively protect data already in the cloud.

Counter-point from SpaceXAI

SpaceXAI argues the upload feature was meant to gather usage metrics for model improvement. It points to the swift disabling of the feature and its promise to erase existing uploads as evidence of a responsible response. Critics counter that the initial design offered no clear opt-out and that the privacy command fails to protect data already stored in the cloud.

Takeaway

When an AI coding assistant can silently siphon an entire repository, trust becomes a technical issue, not a marketing one. Organizations must demand verifiable, enforceable controls that prevent hidden data exfiltration, or risk exposing the very code that gives them a competitive edge.