Anthropic과 OpenAI는 각각 검증된 보안 팀이 대부분의 안전 필터가 제거된 AI 모델을 사용할 수 있도록 하는 새로운 연구 트랙을 개설했습니다. Anthropic의 “Cyber Verification Program”과 OpenAI의 “Trusted Access for Cyber”는 승인된 연구자들에게 제한 없는 코드, 프롬프트 및 지침을 생성할 수 있는 강력한 언어 모델에 대한 직접적인 접근 권한을 부여합니다. 이러한 움직임은 AI 공급망에 명확한 분기점을 만든다는 점에서 중요합니다. 즉, 소수의 내부자는 가장 취약한 버전을 조사할 수 있는 반면, 나머지 세상은 더 강력한 가드레일 뒤에 머물게 됩니다.
프로그램이 등장한 이유
두 기업 모두 이번 이니셔티브가 자사 서비스에 대해 무기화될 수 있는 취약점의 발견을 가속화하는 것을 목표로 한다고 밝혔습니다. 통제된 전문가 그룹에게 제한이 적은 샌드박스를 제공함으로써, 악의적인 행위자가 이를 발견하기 전에 공격 벡터를 찾아내기를 기대하고 있습니다. 이 접근 방식은 개발자가 선택된 대상에게 “bug-bounty” 빌드를 공개하는 전통적인 소프트웨어 보안 방식과 유사합니다.
방어자를 위한 새로운 리스크 계산
반면, 모든 조직이 “연구자”와 “해커” 사이의 경계를 설정해야 하는 2단계 접근 모델이라는 측면도 있습니다. 이제 그 경계 자체가 잠재적인 공격 표면이 됩니다. 공격자가 자격 증명을 탈취하거나, 내부자의 권한을 악용하거나, 검증 프로세스를 속일 경우 대부분의 사용자를 보호하는 가드레일을 우회할 수 있습니다. 일단 내부로 침투하면, 제한 없는 모델을 다음과 같은 용도로 유도할 수 있습니다:
- 탐지를 회피하는 피싱 스크립트 생성
- 상세한 코드 스니펫을 포함한 제로데이 익스플로잇 제작
- 특정 타겟에 맞춘 설득력 있는 사회 공학적 프롬프트 생성
AI 출력이 항상 필터링된다는 가정하에 방어 체계를 구축한 보안 팀은 이러한 전제를 재고해야 합니다.
방어자가 대응할 수 있는 방법
- 프로그램을 위협 벡터로 간주하십시오. 공격자가 검증 파이프라인에 침투를 시도할 것이라고 가정하고, AI 플랫폼에서 비정상적인 로그인 패턴을 모니터링하십시오.
- 클라우드 너머로 탐지 범위를 확장하십시오. 외부로 나가는 트래픽, 특히 권한이 있는 계정에서 AI가 생성한 코드나 텍스트가 있는지 확인하십시오.
- 정책 제어를 시스템적으로 강제하십시오. 외부 AI 서비스를 내부적으로 사용할 때 엄격한 “최소 권한(least-privilege)” 규칙을 적용하고, 탈취된 자격 증명으로 접근할 수 있는 환경을 분리하십시오.
- 벤더와 협력하십시오. Anthropic 및 OpenAI의 보안 연락 채널과 지속적으로 소통하여 접근 기준의 변경이나 발견된 오용 사례에 대한 경고를 받으십시오.
반론
찬성론자들은 심층 조사를 위한 안전한 채널이 없다면 취약점이 실제 공격에 사용될 때까지 숨겨져 있을 것이라고 주장합니다. 따라서 이 프로그램은 결함을 조기에 발견함으로써 전체적인 공격 표면을 줄일 수 있습니다. 다만, “보호가 덜 된” 단계가 기회주의적인 악용을 초래할 수 있다는 점이 트레이드오프입니다.
주목해야 할 사항
- 양사의 검증 프로세스 업데이트
- 해당 프로그램에서 비롯된 오용 보고
- AI 관련 공격 표면을 분류하는 방식의 업계 전반적인 변화
결론적으로, 새로운 연구 트랙은 보안 연구자들에게 강력한 도구를 제공하지만, 관문을 통과할 수 있는 누구에게나 동일한 도구를 쥐여주는 셈이기도 합니다. 방어 팀은 이 프로그램을 통찰력의 원천인 동시에 새로운 공격 경로로 간주해야 합니다.
