Anthropic сообщила, что три её модели Claude вышли за пределы «песочницы» и получили доступ к реальным системам во время недавней кампании по тестированию безопасности, что привело к немедленной приостановке оценок и публикации публичного отчета.

Компания провела 141 006 тестов кибербезопасности и обнаружила три инцидента, когда модели обращались к реальным целям вместо симулированной среды. Ошибка в конфигурации стороннего партнера фактически оставила «песочницу» открытой.

Как произошли утечки

  • Claude Opus 4.7 получила доступ к реальной компании, доступной в интернете, и подобрала слабые пароли, чтобы выгрузить базу данных из нескольких сотен строк.
  • Claude Mythos 5 организовала атаку на цепочку поставок, опубликовав пакет в реальном репозитории PyPI. Пакет был установлен на 15 рабочих машинах, прежде чем реестр зафиксировал аномалию.
  • Внутренняя исследовательская модель просканировала 9 000 целей, скомпрометировала одно приложение, а затем остановилась сама, распознав, что хост не соответствует её симулированной задаче.

Anthropic подчеркивает, что это не были случаи «неуправляемого ИИ». Модели выполняли то, что им было велено; инфраструктура тестирования не смогла изолировать их от открытого интернета.

Почему это важно

Эти инциденты показывают, насколько тонка грань между контролируемой «песочницей» и реальной сетью, когда ИИ-агенты могут выполнять код и совершать сетевые вызовы. Для предприятий, экспериментирующих с автономными агентами, системный промпт или файл README не могут гарантировать соблюдение границ. Даже скромный набор данных или несколько машин могут спровоцировать масштабные компрометации цепочек поставок, как показывает случай с PyPI.

Три утечки также демонстрируют масштаб усилий Anthropic: компания провела аудит каждого запуска теста, а не случайной выборки. Такая тщательность позволила обнаружить ошибку конфигурации до того, как инциденты могли распространиться.

Что сделала Anthropic

В течение суток после обнаружения сбоя в «песочнице» Anthropic приостановила все текущие оценки. Неделю спустя компания опубликовала подробный отчет, в котором перечислила три события, техническую причину и немедленные шаги по устранению последствий.

Практические рекомендации для пользователей ИИ-агентов

  1. Проверяйте сетевые границы прямыми проверками — не полагайтесь на то, что промпт или конфигурационный файл действительно изолируют агента.
  2. Ограничивайте права доступа (scope) до минимума — предоставляйте только те полномочия, которые абсолютно необходимы для выполнения задачи.
  3. Тестируйте доступность самостоятельно — проверьте реальный сетевой обзор агента, прежде чем передавать ему конфиденциальные ресурсы.
  4. Отслеживайте непредусмотренную активность — настройте оповещения об исходящих соединениях или регистрациях пакетов, которые отклоняются от плана.

Этот эпизод подчеркивает простую истину: предоставление модели ИИ доступа в интернет так же рискованно, как передача учетных данных человеку-оператору. Пока гарантии «песочницы» не будут доказаны, относитесь к любому действию, управляемому ИИ, как к потенциально неограниченному и соответствующим образом защищайте среду.