당신이 금융 서비스 기업의 시니어 애플리케이션 보안 엔지니어라고 상상해 보십시오. 내부적으로 개발된 인증 코드 스니펫을 최첨단 AI 모델에 입력하고 로직 결함을 찾아달라고 요청합니다. 하지만 분석 대신 훈계가 돌아옵니다. 모델은 당신이 그 정보를 "시스템을 공격하는 데" 사용할 수 있다는 이유로 거부합니다. 당신은 범죄자가 아닙니다. 범죄자를 막기 위해 고용된 사람입니다. 하지만 가드레일은 두 역할을 구분하지 못합니다.

이러한 시나리오는 일상이 되고 있습니다. 대형 AI 연구소들이 악의적인 오용을 방지하기 위해 안전 프로토콜을 강화함에 따라, 정당한 사이버 보안 전문가들의 워크플로우와 정면으로 충돌하고 있습니다. 그 결과 하나의 커다란 역설이 발생하고 있습니다. 소프트웨어 엔지니어링의 생산성을 높여줄 도구로 홍보되던 바로 그 도구들이, 정작 핵심 인프라를 보호하는 전문가들에게는 제공되지 않고 있는 것입니다.

안전(Safety)과 보안(Security) 사이의 마찰

주요 AI 개발사들이 사이버 보안 커뮤니티를 완전히 무시한 것은 아닙니다. OpenAI는 Trusted Access for Cyber라는 프로그램을 운영하고 있으며, Anthropic은 Cyber Verification Program을 운영하고 있습니다. 두 프로그램 모두 검증된 사용자가 정당한 연구를 수행할 수 있도록 특정 거부 메커니즘을 우회할 수 있게 설계되었습니다. 이론적으로 이러한 관문은 선한 행위자와 악한 행위자를 구분해 줍니다.

하지만 실제로는 많은 공격 보안 연구원과 네트워크 방어자들이 이를 관료적인 장애물로 경험합니다. 검증 프로세스는 불투명할 수 있고, 승인 기간도 불분명합니다. 승인을 받은 후에도 연구원들은 향상된 액세스 권한이 서로 다른 모델 버전이나 대화 스레드에서 항상 안정적으로 작동하지는 않는다고 보고합니다. 활발한 공격 상황에서 취약점을 패치하기 위해 경주하는 팀들에게 이러한 마찰은 매우 치명적입니다.

워싱턴과 실리콘밸리 사이의 긴장은 미국 정부가 Anthropic의 MythosFable 모델에 수출 통제를 부과했을 때 주목할 만한 분기점에 도달했습니다. 이러한 제한 조치는 개인이 모델의 안전 가드레일을 우회하여 사이버 공격을 용이하게 했다는 보고 이후에 내려졌습니다. 규제 당국은 이러한 시스템을 독보적으로 위험한 수출 품목으로 취급하기 위해 신속하게 움직였습니다. 이후 통제는 해제되거나 수정되었지만, 이 사건은 명확한 신호를 보냈습니다. 고성능 AI 모델이 범용 기술 도구가 아닌, 잠재적인 종말의 도구(doomsday devices)로 점점 더 간주되고 있다는 사실입니다. 이 모델들에 의존하는 방어자들에게 이러한 인식은 더 엄격한 조사, 느린 접근 권한, 그리고 보안 연구가 그저 '해킹'의 다른 이름일 뿐이라는 근저에 깔린 의구심으로 이어집니다.

방어와 공격이 분리될 수 없는 이유

갈등의 핵심은 행정적인 것이 아니라 기술적인 것입니다. 네트워크를 방어하는 데 필요한 역량과 네트워크를 공격하는 데 필요한 역량은 거의 동일합니다.

NCC Group의 수석 과학자인 Chris Anley는 간단한 비유를 듭니다. AI는 망치와 같습니다. 집을 짓는 데 사용할 수도 있고, 창문을 깨는 데 사용할 수도 있습니다. 도구 자체는 그 차이를 알지 못합니다. 사이버 보안에서 이러한 이중성은 피할 수 없습니다. 실무자가 모델에 "이 코드를 수정해 줘"라고 요청하면, 그 요청은 방어적인 동작을 유발합니다. 하지만 수정을 만들어내는 추론 과정—안전하지 않은 함수 식별, 신뢰할 수 없는 입력 추적, 실행 흐름 매핑—은 필연적으로 취약점이 어떻게 트리거될 수 있는지를 드러냅니다. 그 설명이 곧 공격을 위한 로드맵 역할을 하게 되는 것입니다.

AI 안전 팀은 종종 공격의 냄새가 나는 모든 프롬프트를 거부하도록 모델을 학습시키기 때문에, 시스템은 종종 과잉 교정을 합니다. 사용자 입력을 어떻게 정화(sanitize)하는지 묻는 연구자에게는 답변을 제공합니다. 하지만 어떻게 a