Anthropic и OpenAI запустили новые направления исследований, которые позволяют проверенным командам специалистов по безопасности работать с моделями ИИ, лишенными большинства фильтров безопасности. Программа Anthropic «Cyber Verification Program» и программа OpenAI «Trusted Access for Cyber» предоставляют одобренным исследователям прямой доступ к мощным языковым моделям, способным генерировать неограниченный код, промпты и инструкции. Этот шаг важен, поскольку он создает четкое разделение в цепочке поставок ИИ: горстка инсайдеров может исследовать самые уязвимые версии, в то время как остальной мир остается за более строгими защитными барьерами.

Почему появились эти программы

Обе компании заявляют, что инициативы направлены на ускорение поиска уязвимостей, которые могут быть использованы против их сервисов. Предоставляя контролируемой группе экспертов «песочницу» с меньшим количеством ограничений, они надеются выявить векторы атак до того, как их обнаружат злоумышленники. Этот подход отражает традиционную модель безопасности программного обеспечения, когда разработчики выпускают сборки для программ Bug Bounty для ограниченного круга лиц.

Новый расчет рисков для защитников

Обратной стороной является двухуровневая модель доступа, которая заставляет каждую организацию проводить четкую грань между «исследователем» и «хакером». Эта грань теперь сама становится потенциальной поверхностью атаки. Если злоумышленник украдет учетные данные, воспользуется доступом инсайдера или обманет процесс проверки, он сможет обойти защитные барьеры, которые оберегают большинство пользователей. Оказавшись внутри, неограниченную модель можно заставить:

  • Генерировать фишинговые скрипты, обходящие системы обнаружения
  • Создавать эксплойты нулевого дня с подробными фрагментами кода
  • Создавать убедительные промпты для социальной инженерии, адаптированные под конкретные цели

Командам безопасности, которые строили защиту исходя из предположения, что ответы ИИ всегда фильтруются, придется пересмотреть этот тезис.

Как защитникам реагировать

  • Рассматривайте программы как вектор угрозы. Предполагайте, что противники попытаются проникнуть в процесс проверки, и отслеживайте аномальные паттерны входа в системы ИИ.
  • Расширяйте возможности обнаружения за пределами облака. Ищите сгенерированный ИИ код или текст в исходящем трафике, особенно с привилегированных учетных записей.
  • Внедряйте жесткие политики контроля. Обеспечьте соблюдение строгих правил «наименьших привилегий» при любом внутреннем использовании внешних ИИ-сервисов и сегментируйте среды, к которым может получить доступ скомпрометированная учетная запись.
  • Сотрудничайте с вендорами. Поддерживайте связь с каналами взаимодействия по вопросам безопасности Anthropic и OpenAI, чтобы получать оповещения об изменениях в критериях доступа или обнаруженных злоупотреблениях.

Контраргумент

Сторонники утверждают, что без безопасного канала для глубокого тестирования уязвимости будут оставаться скрытыми до тех пор, пока их не начнут использовать в реальных атаках. Таким образом, программы могут уменьшить общую поверхность атаки, выявляя недостатки на ранних стадиях. Обратной стороной является то, что «менее защищенный» уровень провоцирует возможности для ситуативного злоупотребления.

На что обратить внимание

  • Обновления процесса проверки со стороны любой из компаний
  • Сообщения о злоупотреблениях, связанных с этими программами
  • Общеотраслевые изменения в способах каталогизации поверхностей атак, связанных с ИИ

Итог: новые исследовательские направления дают специалистам по безопасности мощные инструменты, но они также передают эти же инструменты любому, кто сможет обойти заслон. Команды защиты должны рассматривать эти программы одновременно и как источник ценных сведений, и как новый путь для атак.