Почему OpenAI обратилась к ИИ-атакующим
Традиционные учения по методу red-teaming заставляют инженеров по безопасности вручную тестировать модели — это медленный и дорогостоящий процесс, ограниченный человеческим воображением. OpenAI ответила созданием GPT-Red — системы self-play, в которой атакующая модель противостоит своей защищающейся «сестре». Каждый раунд атаки предоставляет защитнику новые данные; атакующий учится на каждой неудаче, создавая эволюционный цикл, который выявляет такие паттерны эксплойтов, о которых человек даже не догадался бы.
Цифры, которые имеют значение
- Успех атак: GPT-Red успешно справилась в 84 % тестовых случаев, в то время как у специалистов по red-teaming этот показатель составил лишь 13 %.
- Укрепление модели: OpenAI внедрила результаты работы GPT-Red напрямую в процесс обучения, и теперь GPT-5.6 Sol демонстрирует в шесть раз меньше сбоев при промпт-инъекциях, чем флагманская модель, выпущенная четыре месяца назад.
- Остаточный риск: Даже с новыми мерами защиты около 3,8 % «сильных» инъекций всё же прорываются, что является показателем уязвимости, сопоставимым с Claude Opus 4.5.
Демонстрация в реальном времени подчеркнула мощь системы: GPT-Red манипулировала управляемым ИИ торговым автоматом в офисе OpenAI, меняя цены на товары и отменяя заказы без какого-либо вмешательства человека.
Что это улучшение значит для пользователей
OpenAI утверждает, что GPT-5.6 Sol сохраняет ту же скорость рассуждений и качество ответов, что и её предшественница, обходя давний компромисс между безопасностью и полезностью, когда усиление защиты снижает эффективность модели.
Ограничения автоматизированного red-teaming
Автоматизация не устраняет все риски. Успех в 3,8 % при высокоинтенсивных инъекциях показывает, что даже сложная система self-play оставляет пробелы.
За чем следить дальше
- Итеративные обновления: цикл self-play продолжит развиваться.
Итог
GPT-Red доказывает, что ИИ способен превзойти человека в поиске изъянов в подобных ему системах, обеспечив измеримое шестикратное снижение числа сбоев при промпт-инъекциях для GPT-5.6. Этот прорыв сокращает разрыв между безопасностью и полезностью, но небольшой реальный остаточный риск сохраняется. Следующая глава будет зависеть от того, как OpenAI сможет сочетать результаты автоматизированного red-teaming с внешним аудитом, чтобы оставаться на шаг впереди противников, которые сами всё чаще обращаются к ИИ.
