OpenAI가 AI 공격자로 눈을 돌린 이유
전통적인 레드팀(red-team) 훈련은 보안 엔지니어가 수동으로 모델을 조사해야 하므로, 인간의 상상력에 제한을 받는 느리고 비용이 많이 드는 과정입니다. OpenAI는 공격 모델과 방어 모델을 서로 맞붙이는 셀프 플레이(self-play) 시스템인 GPT-Red로 이에 대응했습니다. 각 공격 라운드는 방어 모델에 새로운 데이터를 제공하며, 공격 모델은 모든 실패로부터 학습합니다. 이를 통해 인간은 생각조차 하지 못할 취약점 패턴을 찾아내는 진화적 루프를 형성합니다.
주목해야 할 수치들
- 공격 성공률: 인간 레드팀의 성공률이 13%인 것에 비해, GPT-Red는 테스트 케이스의 84%에서 성공했습니다.
- 모델 강화: OpenAI는 GPT-Red의 통찰력을 훈련 파이프라인에 직접 반영했으며, 그 결과 GPT-5.6 Sol은 4개월 전에 출시된 플래그십 모델보다 프롬프트 인젝션(prompt-injection) 실패 사례가 6배 더 적게 기록되었습니다.
- 잔존 위험: 새로운 방어 체계에도 불구하고, "강력한" 인젝션의 약 3.8%가 여전히 통과하며, 이는 Claude Opus 4.5와 유사한 실패율입니다.
라이브 데모는 이 시스템의 강력함을 입증했습니다. GPT-Red는 OpenAI 사무실에 있는 AI 제어 자판기를 조작하여, 인간의 개입 없이도 상품 가격을 변경하고 주문을 취소했습니다.
이번 개선이 사용자에게 의미하는 바
OpenAI는 GPT-5.6 Sol이 이전 모델과 동일한 추론 속도와 답변 품질을 유지한다고 밝혔습니다. 이는 보안을 강화할수록 유용성이 떨어지는 고질적인 '안전성-유용성 트레이드오프(safety-utility tradeoff)' 문제를 해결한 것입니다.
자동화된 레드팀의 한계
자동화가 모든 위험을 제거하는 것은 아닙니다. 고강도 인젝션에 대한 3.8%의 성공률은 정교한 셀프 플레이 시스템조차 빈틈을 남길 수 있음을 보여줍니다.
향후 주목할 점
- 반복적인 업그레이드: 셀프 플레이 루프는 계속해서 진화할 것입니다.
요약
GPT-Red는 AI가 동종의 결함을 찾는 데 있어 인간보다 더 뛰어난 사고력을 발휘할 수 있음을 증명했으며, GPT-5.6의 프롬프트 인젝션 실패를 6배 감소시키는 가시적인 성과를 거두었습니다. 이러한 돌파구는 안전성과 유용성 사이의 간극을 좁혔지만, 작지만 실질적인 잔존 위험은 여전히 남아 있습니다. 다음 단계는 OpenAI가 자동화된 레드팀의 통찰력을 외부의 검증과 어떻게 결합하여, 점점 더 AI를 활용하는 적대 세력보다 앞서 나갈 수 있느냐에 달려 있습니다.
