Narzędzie do programowania AI Grok Build od SpaceXAI wzbudziło kontrowersje po tym, jak badacze odkryli, że przesyła ono całe repozytoria użytkowników do pamięci masowej Google Cloud. Wyciek ten wywołał niepokój dotyczący tego, jak wiele zastrzeżonych danych asystenci AI mogą pochłonąć i zatrzymać.
Nadmierne przechowywanie danych i ryzyka bezpieczeństwa
Analiza Cereblab wykazała, że interfejs wiersza poleceń (CLI) Grok Build pakował i wysyłał całe bazy kodu do chmury. Jeszcze bardziej niepokojące jest to, że narzędzie otwierało pliki, które miały być ignorowane, oraz odzyskiwało sekrety, które programiści usunęli z historii git.
Taki poziom gromadzenia danych sprawia, że konkurenci tacy jak Claude Code wypadają przy nim blado. Dr Lukasz Olejnik, badacz bezpieczeństwa z King’s College London, ostrzegł, że taka kolekcja może wystawić kod źródłowy, diagramy infrastruktury, podatności i dane uwierzytelniające na serwery zdalne.
Reakcja SpaceXAI i Elona Muska
SpaceXAI wyłączyło funkcję przesyłania danych. Badacze widzą obecnie flagę disable_codebase_upload: true na serwerach Grok, co potwierdza, że automatyczne przesyłanie nie jest już realizowane.
Elon Musk opublikował na platformie X informację, że wszystkie wcześniej przesłane dane zostaną „całkowicie i bezpowrotnie usunięte”. Wezwał również użytkowników, aby pozwolili SpaceXAI zatrzymywać dane w celu „rozwiązywania problemów z debugowaniem”, co wielu uznaje za sprzeczne.
Firma zasugerowała użycie komendy CLI /privacy do zarządzania retencją danych, jednak Cereblab zauważył, że komenda ta jedynie przełącza przechowywanie w ramach danej sesji — nie zatrzymuje ona systematycznego przesyłania repozytoriów, które wywołało skandal.
Dlaczego ma to znaczenie dla programistów i przedsiębiorstw
Ten incydent jest ostrzeżeniem dla programistów i przedsiębiorstw, że oparte na AI agenty programistyczne nie są już prostymi narzędziami do autouzupełniania; mogą one samodzielnie czytać, modyfikować i zatwierdzać (commit) kod. Gdy agent omija pliki ignorowane lub przywraca usunięte sekrety, wszelkie zapewnienia o „braku retencji danych” muszą zostać udowodnione testami technicznymi, a nie obietnicami w interfejsie użytkownika.
Dla dyrektorów technicznych (CTO) i właścicieli produktów incydent ten podkreśla potrzebę:
- Niezależnych audytów narzędzi AI na rzeczywistych bazach kodu.
- Klauzul umownych, które precyzyjnie określają sposób przetwarzania danych, okresy retencji i gwarancje usunięcia.
- Zabezpieczeń w czasie rzeczywistym (runtime safeguards), które wymuszają uprawnienia na poziomie plików, szczególnie w przypadku repozytoriów zawierających dane uwierzytelniające lub opatentowane algorytmy.
Kluczowe wnioski
- Niezamierzone zakresowanie danych: Grok Build przesyłał do Google Cloud całe repozytoria, w tym pliki zastrzeżone i usunięte sekrety.
- Status mitygacji: SpaceXAI wyłączyło automatyczne przesyłanie i zobowiązało się do usunięcia już zebranych danych.
- Implikacje dla bezpieczeństwa: Wyciek uwypukla niebezpieczeństwo nadmiernego przechowywania danych przez agentów programistycznych AI, co może prowadzić do wycieku zastrzeżonej logiki i danych uwierzytelniających.
Narzędzie Grok Build od SpaceXAI zostało przyłapane na cichym przesyłaniu całych baz kodu użytkowników do Google Cloud, co naraziło zastrzeżone pliki źródłowe i usunięte sekrety.
Co się stało
Cereblab prześledził ruch sieciowy CLI Grok Build do zasobu (bucket) w Google Cloud i odkrył, że narzędzie automatycznie pakowało pełne repozytoria git do przesłania. W skrócie: asystent pobierał dane, które miał ignorować.
Jak wykryto wyciek
Badacze zbadali przesyłane dane (payloads) i zauważyli, że flaga przesyłania była włączona domyślnie, bez możliwości globalnej rezygnacji. Dr Lukasz Olejnik ostrzegł, że takie „nadmierne przechowywanie danych” może doprowadzić do wycieku logiki biznesowej, szczegółów infrastruktury i tokenów uwierzytelniających. W porównaniu z innymi asystentami programowania AI — gdzie punktem odniesienia jest Claude Code — zachowanie Grok Build jest wyraźnie bardziej inwazyjne.
Reakcja SpaceXAI
Po upublicznieniu raportu SpaceXAI wydało aktualizację, która zwraca flagę disable_codebase_upload: true, co w praktyce wyłącza tę funkcję. Elon Musk ogłosił na platformie X, że wszystkie przesłane dane zostaną „całkowicie i bezpowrotnie usunięte” i powtórzył, że „ustawienia prywatności są zawsze respektowane”. Poprosił również użytkowników, aby pozwolili firmie zatrzymywać dane w celu „rozwiązywania problemów z debugowaniem”, co wielu uznaje za sprzeczne.
Firma zarekomendowała użycie komendy CLI /privacy do kontrolowania retencji, ale badacze zwrócili uwagę, że służy ona jedynie do przełączania przechowywania w ramach danej sesji i nie zatrzymuje systematycznego przesyłania repozytoriów.
Dlaczego ma to znaczenie dla programistów i przedsiębiorstw
Agenty programistyczne oparte na AI ewoluują od prostego autouzupełniania do autonomicznych narzędzi, które potrafią czytać, modyfikować i zatwierdzać kod. Gdy agent może omijać lokalne pliki ignorowane lub przywracać usunięte sekrety, wszelkie obietnice „braku retencji danych” muszą zostać zweryfikowane testami technicznymi, a nie tylko ustawieniami w interfejsie użytkownika. Dyrektorzy techniczni (CTO) i właściciele produktów powinni:
- Zlecać niezależne audyty zachowania narzędzi AI na rzeczywistych bazach kodu.
- Negocjować jasne umowy określające zasady przetwarzania danych, okresy ich przechowywania oraz gwarancje usunięcia.
- Wdrażać zabezpieczenia w czasie rzeczywistym, które wymuszają uprawnienia na poziomie plików dla wrażliwych repozytoriów.
Naruszenie to rodzi również szersze pytanie o kompromis między wygodą korzystania z AI a bezpieczeństwem. SpaceXAI twierdzi, że funkcja przesyłania zbierała metryki użytkowania w celu ulepszenia modelu, i wyłączyła tę funkcję oraz obiecała usunąć dotychczasowe przesyłki. Krytycy zauważają, że pierwotny projekt nie posiadał przejrzystej opcji rezygnacji (opt-out), a wydana po incydencie komenda prywatności nie chroni wstecznie danych, które znajdują się już w chmurze.
Kontrargument SpaceXAI
SpaceXAI argumentuje, że funkcja przesyłania miała na celu gromadzenie metryk użytkowania w celu ulepszenia modelu. Wskazuje na szybkie wyłączenie funkcji oraz obietnicę usunięcia istniejących przesyłek jako dowód odpowiedzialnej reakcji. Krytycy odpowiadają, że początkowy projekt nie oferował jasnej możliwości rezygnacji, a komenda prywatności nie chroni danych już zapisanych w chmurze.
Wnioski
Gdy asystent programowania AI może po cichu wyprowadzić całe repozytorium, zaufanie staje się kwestią techniczną, a nie marketingową. Organizacje muszą żądać weryfikowalnych i egzekwowalnych mechanizmów kontrolnych, które zapobiegną ukrytej eksfiltracji danych, w przeciwnym razie ryzykują ujawnienie właśnie tego kodu, który daje im przewagę konkurencyjną.
