Представьте, что вы — ведущий инженер по безопасности приложений в финансовой компании. Вы загружаете фрагмент кода аутентификации собственной разработки в передовую модель ИИ и просите её найти логические ошибки. Вместо анализа вы получаете лекцию. Модель отказывается, аргументируя это тем, что вы можете использовать информацию для «эксплуатации системы». Вы не преступник. Вы — тот, кого наняли, чтобы останавливать преступников. Тем не менее, защитный барьер считает эти две роли неразличимыми.

Этот сценарий становится рутинным. По мере того как крупные лаборатории ИИ ужесточают протоколы безопасности для предотвращения злонамеренного использования, они вступают в прямое столкновение с рабочими процессами легитимных специалистов по кибербезопасности. Результатом становится растущий парадокс: те самые инструменты, которые позиционируются как средства, кратно повышающие эффективность программной инженерии, ограничиваются в доступе для специалистов, защищающих критически важную инфраструктуру.

Трение между безопасностью (Safety) и защитой (Security)

Крупные разработчики ИИ не игнорируют сообщество кибербезопасности полностью. OpenAI реализует программу под названием Trusted Access for Cyber. Anthropic управляет программой Cyber Verification Program. Обе программы предназначены для того, чтобы позволить проверенным пользователям обходить определенные механизмы отказа для проведения легитимных исследований. Теоретически, эти барьеры отделяют «хороших» игроков от «плохих».

На практике многие исследователи в области наступательной безопасности (offensive security) и специалисты по защите сетей воспринимают их как бюрократические препятствия. Процессы верификации могут быть непрозрачными. Сроки одобрения неясны. Даже после получения доступа исследователи сообщают, что расширенные привилегии не всегда работают надежно в разных версиях моделей или ветках диалогов. Для команд, спешащих закрыть уязвимости в условиях их активной эксплуатации, это трение имеет значение.

Напряженность между Вашингтоном и Кремниевой долиной достигла заметной точки кипения, когда правительство США ввело экспортный контроль на модели Mythos и Fable от Anthropic. Ограничения были введены после сообщений о том, что отдельные лица обходили защитные барьеры моделей для содействия кибератакам. Регуляторы быстро приняли решение рассматривать эти системы как уникально опасные экспортные товары. С тех пор контроль был снят или изменен, но этот эпизод послал четкий сигнал: высокопроизводительные модели ИИ всё чаще рассматриваются как потенциальные «устройства судного дня», а не как универсальные технические инструменты. Для защитников, которые полагаются на них, такое восприятие оборачивается усиленным контролем, замедлением доступа и скрытым подозрением, что исследования в области безопасности — это всего лишь хакерство под другим названием.

Почему защита и нападение неразделимы

Суть конфликта не административная. Она техническая. Те же возможности, которые необходимы для защиты сети, почти идентичны тем, что требуются для нападения на неё.

Крис Энли, главный ученый в NCC Group, использует простую аналогию: ИИ — это молоток. Вы можете использовать его, чтобы построить дом или разбить окно. Сам инструмент не видит разницы. В кибербезопасности эта двойственность неизбежна. Когда специалист просит модель «исправить этот код», запрос инициирует защитное действие. Но процесс рассуждения, который приводит к исправлению — выявление небезопасных функций, отслеживание недоверенных входных данных, построение схем потоков выполнения — неизбежно раскрывает, как именно может быть активирована уязвимость. Это объяснение служит дорожной картой для эксплуатации.

Поскольку команды по безопасности ИИ часто обучают модели отклонять любые запросы, в которых усматривается попытка эксплуатации, системы часто склонны к чрезмерному самоконтролю. Исследователь, спрашивающий, как очистить пользовательский ввод, получает ответ. Исследователь, спрашивающий, как...