SpaceXAI’s Grok Build AI coding tool drew fire after researchers found it uploading whole user repositories to Google Cloud storage. The breach sparked alarm over how much proprietary data AI assistants can swallow and keep.
Избыточное хранение данных и риски безопасности
Анализ Cereblab показал, что интерфейс командной строки (CLI) Grok Build упаковывал и отправлял в облако целые кодовые базы. Что еще более тревожно, инструмент открывал файлы, которые ему было приказано игнорировать, и извлекал секретные данные, которые разработчики удалили из истории git.
Такой уровень сбора данных затмевает конкурентов, таких как Claude Code. Доктор Лукаш Олейник, исследователь безопасности из King’s College London, предупредил, что подобный сбор может привести к передаче исходного кода, схем инфраструктуры, уязвимостей и учетных данных на удаленные серверы.
Реакция SpaceXAI и Илона Маска
SpaceXAI отключила функцию загрузки. Исследователи теперь видят флаг disable_codebase_upload: true на серверах Grok, что подтверждает прекращение автоматической отправки данных.
Илон Маск написал в X, что все ранее загруженные данные будут «полностью и окончательно удалены». Он также призвал пользователей позволить SpaceXAI сохранять данные для «исправления ошибок» (debugging issues) — просьба, которую многие считают противоречивой.
Компания предложила использовать команду CLI /privacy для управления хранением данных, но Cereblab отметил, что эта команда лишь переключает хранение в рамках текущей сессии — она не останавливает систематическую загрузку репозиториев, ставшую причиной скандала.
Почему это важно для разработчиков и предприятий
Этот инцидент служит предупреждением для разработчиков и предприятий: агенты для написания кода на базе ИИ больше не являются простыми инструментами автодополнения; они могут самостоятельно читать, изменять и фиксировать (commit) код. Когда агент обходит файлы игнорирования или восстанавливает удаленные секреты, любые заявления о «нулевом хранении данных» должны подтверждаться техническими тестами, а не обещаниями в интерфейсе.
Для технических директоров (CTO) и владельцев продуктов этот инцидент подчеркивает необходимость:
- Независимых аудитов инструментов ИИ на реальных кодовых базах.
- Договорных условий, четко определяющих правила обработки данных, сроки хранения и гарантии удаления.
- Средств защиты во время выполнения (runtime safeguards), обеспечивающих соблюдение разрешений на уровне файлов, особенно для репозиториев, содержащих учетные данные или запатентованные алгоритмы.
Основные выводы
- Непреднамеренный охват данных: Grok Build загружал в Google Cloud целые репозитории, включая ограниченные файлы и удаленные секреты.
- Статус устранения последствий: SpaceXAI отключила автоматическую загрузку и пообещала удалить уже собранные данные.
- Последствия для безопасности: Утечка подчеркивает опасность избыточного хранения данных в ИИ-агентах для кодинга, что может привести к раскрытию проприетарной логики и учетных данных.
Инструмент Grok Build от SpaceXAI был пойман на скрытой загрузке целых кодовых баз пользователей в Google Cloud, что привело к раскрытию проприетарных исходных файлов и удаленных секретов.
Что произошло
Cereblab отследил сетевой трафик CLI Grok Build до корзины (bucket) Google Cloud и обнаружил, что он автоматически упаковывает полные git-репозитории для загрузки. Проще говоря, ассистент извлекал данные, которые ему было приказано игнорировать.
Как была обнаружена утечка
Исследователи изучили полезную нагрузку (payloads) и увидели, что флаг загрузки включен по умолчанию и не имеет глобальной возможности отключения. Доктор Лукаш Олейник предупредил, что такое «избыточное хранение данных» может привести к утечке бизнес-логики, деталей инфраструктуры и токенов аутентификации. По сравнению с другими ИИ-ассистентами для кодинга (ориентиром которых служит Claude Code), поведение Grok Build является заметно более инвазивным.
Ответ SpaceXAI
После публикации отчета SpaceXAI выпустила обновление, которое возвращает флаг disable_codebase_upload: true, фактически отключая эту функцию. Илон Маск объявил в X, что все загруженные данные будут «полностью и окончательно удалены», и подтвердил, что «настройки конфиденциальности всегда соблюдаются». Он также попросил пользователей позволить компании сохранять данные для «исправления ошибок», что многие считают противоречивым требованием.
Компания рекомендовала использовать команду CLI /privacy для управления хранением данных, но исследователи указали, что она лишь переключает хранение в рамках текущей сессии и не останавливает систематическую загрузку репозиториев.
Почему это важно для разработчиков и предприятий
ИИ-агенты для написания кода эволюционируют от инструментов автодополнения к автономным инструментам, способным читать, изменять и фиксировать код. Когда агент может обходить локальные файлы игнорирования или восстанавливать удаленные секреты, любое обещание «нулевого хранения данных» должно проверяться техническими тестами, а не просто настройками интерфейса. Техническим директорам и владельцам продуктов следует:
- Заказывать независимые аудиты поведения ИИ-инструментов на реальных кодовых базах.
- Согласовывать четкие контракты, определяющие правила обработки данных, сроки их хранения и гарантии удаления.
- Внедрять механизмы защиты во время выполнения, обеспечивающие управление разрешениями на уровне файлов для конфиденциальных репозиториев.
Утечка также поднимает более широкий вопрос о компромиссе между удобством ИИ и безопасностью. SpaceXAI утверждает, что функция загрузки собирала метрики использования для улучшения модели, и компания отключила эту функцию, пообещав удалить уже загруженные данные. Критики отмечают, что в первоначальной версии отсутствовала прозрачная возможность отказа от участия (opt-out), а команда конфиденциальности, введенная после инцидента, не защищает ретроактивно данные, которые уже находятся в облаке.
Контраргумент со стороны SpaceXAI
SpaceXAI утверждает, что функция загрузки предназначалась для сбора метрик использования с целью улучшения модели. В качестве доказательства ответственного подхода компания указывает на оперативное отключение функции и обещание удалить существующие загрузки. Критики возражают, что первоначальная архитектура не предусматривала четкой возможности отказа, а команда конфиденциальности не способна защитить данные, уже хранящиеся в облаке.
Вывод
Когда ИИ-ассистент для написания кода может незаметно выкачивать целый репозиторий, доверие становится техническим вопросом, а не маркетинговым. Организации должны требовать проверяемых и принудительно исполняемых механизмов контроля, предотвращающих скрытую эксфильтрацию данных, иначе они рискуют раскрыть тот самый код, который обеспечивает им конкурентное преимущество.
