OpenAI는 오늘 자동화된 레드팀 해커 역할을 수행하는 대규모 언어 모델인 GPT-Red를 출시했습니다. 이 시스템은 이미 회사의 최신 GPT-5.6 모델을 강화하고 있으며, 시뮬레이션된 공격의 성공률을 90% 이상에서 23% 미만으로 대폭 낮추었습니다.
GPT-Red가 레드팀 작업을 자동화하는 방식
시스템을 의도적으로 파괴하거나 하이재킹하려는 레드팀 테스트는 전통적으로 보안 전문가에게 의존해 왔습니다. LLM이 웹 브라우징, 코드 실행, 서드파티 서비스 호출 등을 학습함에 따라, 오용될 수 있는 방식은 인간 팀이 탐색할 수 있는 속도보다 더 빠르게 증가하고 있습니다.
OpenAI는 연구자들이 '도조(dojo)'라고 부르는 시뮬레이션 환경 내에서 모델의 복사본 하나를 다른 하나와 대결시키는 '셀프 플레이 루프(self-play loop)'로 이에 대응했습니다. 이 샌드박스에서 GPT-Red는 공격자 역할을 맡고, 하나 이상의 방어 모델이 이에 저항합니다. 양측은 수많은 라운드를 진행하며, 각 반복 과정을 통해 공격자는 더 미세한 결함을 찾아내고 방어자는 새로운 방어법을 학습하게 됩니다. OpenAI는 이 프로세스를 GPT-5.6을 생성한 학습 파이프라인에 통합했으며, 이 모델은 회사가 지금까지 출시한 제품 중 가장 강력한 모델이라고 홍보하고 있습니다.
새로운 유형의 공격: 가짜 사고 사슬(fake chain of thought)
셀프 플레이 실행 결과 놀라운 '가짜 사고 사슬(fake chain of thought)' 공격이 발견되었습니다. LLM은 종종 최종 답변을 유도하는 단계별 추론 과정인 '사고 사슬(chain of thought)'을 생성합니다. GPT-Red는 이 추론 과정에 허위 항목을 삽입하여, 모델이 이미 잘못된 전제를 검증했다고 착각하게 만드는 법을 학습했습니다. 예를 들어, 공격자는 모델에게 "1 + 1 = 3"이 확인되었다고 믿게 만들어, 시스템이 조작된 결과에 기반하여 출력을 생성하도록 유도할 수 있습니다.
이 공격은 순수 텍스트 생성기에만 국한되지 않습니다. 외부 연구소에서 구축한 자판기 스타일의 에이전트인 'Vendy'를 대상으로 한 테스트에서, GPT-Red는 가격 필드를 조작하고 주문을 취소함으로써 이 기술이 사용자 명령에 따라 작동하는 특화된 에이전트에게도 유효함을 입증했습니다.
측정 가능한 보안 향상
OpenAI는 GPT-Red를 통한 학습의 효과를 보여주는 수치를 공개했습니다. 새 모델이 생성한 가장 강력한 공격을 8월에 출시된 GPT-5에 실행했을 때는 90% 이상의 성공률을 보였습니다. 그러나 동일한 공격을 GPT-5.6에 실행했을 때는 성공률이 23% 미만으로 떨어졌습니다.
GPT-Red와 인간 레드팀원을 대결시킨 2025년 실험에서, AI는 인간보다 더 효율적으로 공격 변형을 발견하고 정교화했습니다. 이는 적대적 모델(adversarial model)이 더 짧은 시간 내에 취약성 공간의 더 넓은 영역을 탐색할 수 있음을 시사합니다.
한계와 지속적인 인간 전문성의 필요성
GPT-Red가 인간 보안 분석가를 대체하는 것은 아닙니다. 이 모델은 공격자가 여러 차례의 대화를 통해 서사를 구축하는 다회차 대화형 공격(multi-turn conversational attacks)이나, 이미지 내에 악성 텍스트를 숨기는 시각적 프롬프트 주입(visual prompt injections)에는 여전히 취약합니다. OpenAI는 이 모델을 1차 탐지 도구로 사용하여, 유망한 공격 아이디어를 도출하면 인간 전문가가 이를 조사하고 확장하는 방식으로 활용할 계획입니다.
이 도구는 독점 기술로 유지되므로, 외부 연구자들이 그 능력을 직접 테스트하거나 보고된 성능 향상을 검증할 수는 없습니다.
