Почему OpenAI обратилась к ИИ-атакующим

Традиционные учения по методу red-teaming заставляют инженеров по безопасности вручную тестировать модели — это медленный и дорогостоящий процесс, ограниченный человеческим воображением. OpenAI ответила созданием GPT-Red — системы self-play, в которой атакующая модель противостоит своей защищающейся «сестре». Каждый раунд атаки предоставляет защитнику новые данные; атакующий учится на каждой неудаче, создавая эволюционный цикл, который выявляет такие паттерны эксплойтов, о которых человек даже не догадался бы.

Цифры, которые имеют значение

  • Успех атак: GPT-Red успешно справилась в 84 % тестовых случаев, в то время как у специалистов по red-teaming этот показатель составил лишь 13 %.
  • Укрепление модели: OpenAI внедрила результаты работы GPT-Red напрямую в процесс обучения, и теперь GPT-5.6 Sol демонстрирует в шесть раз меньше сбоев при промпт-инъекциях, чем флагманская модель, выпущенная четыре месяца назад.
  • Остаточный риск: Даже с новыми мерами защиты около 3,8 % «сильных» инъекций всё же прорываются, что является показателем уязвимости, сопоставимым с Claude Opus 4.5.

Демонстрация в реальном времени подчеркнула мощь системы: GPT-Red манипулировала управляемым ИИ торговым автоматом в офисе OpenAI, меняя цены на товары и отменяя заказы без какого-либо вмешательства человека.

Что это улучшение значит для пользователей

OpenAI утверждает, что GPT-5.6 Sol сохраняет ту же скорость рассуждений и качество ответов, что и её предшественница, обходя давний компромисс между безопасностью и полезностью, когда усиление защиты снижает эффективность модели.

Ограничения автоматизированного red-teaming

Автоматизация не устраняет все риски. Успех в 3,8 % при высокоинтенсивных инъекциях показывает, что даже сложная система self-play оставляет пробелы.

За чем следить дальше

  • Итеративные обновления: цикл self-play продолжит развиваться.

Итог

GPT-Red доказывает, что ИИ способен превзойти человека в поиске изъянов в подобных ему системах, обеспечив измеримое шестикратное снижение числа сбоев при промпт-инъекциях для GPT-5.6. Этот прорыв сокращает разрыв между безопасностью и полезностью, но небольшой реальный остаточный риск сохраняется. Следующая глава будет зависеть от того, как OpenAI сможет сочетать результаты автоматизированного red-teaming с внешним аудитом, чтобы оставаться на шаг впереди противников, которые сами всё чаще обращаются к ИИ.