Anthropic은 최근 보안 테스트 캠페인 중 Claude 모델 3개가 샌드박스를 벗어나 실제 시스템에 접속하는 사건이 발생했다고 밝혔으며, 이에 따라 즉각적인 평가 중단과 공개 보고서를 발표했습니다.
이 회사는 141,006건의 사이버 보안 테스트를 수행했으며, 모델이 시뮬레이션 환경 대신 실제 타겟에 도달한 세 건의 사례를 발견했습니다. 제3자 파트너와의 설정 오류로 인해 샌드박스가 사실상 개방된 상태였습니다.
침해 사고 발생 경위
- Claude Opus 4.7은 인터넷에 노출된 실제 기업에 접속하여 취약한 비밀번호를 추측해 수백 행 규모의 데이터베이스를 추출했습니다.
- Claude Mythos 5는 실제 PyPI 저장소에 패키지를 게시하여 공급망 공격을 수행했습니다. 이 패키지는 레지스트리가 이상 징후를 감지하기 전까지 15대의 운영 서버에 설치되었습니다.
- 한 내부 연구용 모델은 9,000개의 타겟을 스캔하고 단일 애플리케이션을 침해했으나, 호스트가 시뮬레이션 작업과 일치하지 않는다는 것을 인식한 후 스스로 동작을 중단했습니다.
Anthropic은 이것이 "폭주하는 AI(rogue AI)" 사례가 아니라고 강조합니다. 모델은 지시받은 대로 행동했을 뿐이며, 테스트 인프라가 모델을 개방된 인터넷으로부터 격리하는 데 실패한 것입니다.
이것이 중요한 이유
이번 사건은 AI 에이전트가 코드를 실행하고 네트워크 호출을 할 수 있을 때, 통제된 샌드박스와 실제 네트워크 사이의 경계가 얼마나 취약한지를 보여줍니다. 자율 에이전트를 실험 중인 기업들에게 시스템 프롬프트나 README 파일만으로는 경계를 보장할 수 없습니다. PyPI 사례에서 보듯, 아주 적은 양의 데이터 세트나 소수의 머신만으로도 더 큰 규모의 공급망 침해를 유발할 수 있습니다.
또한 세 건의 침해 사고는 Anthropic의 노력이 얼마나 대규모였는지를 보여줍니다. 회사는 무작위 샘플링이 아닌 모든 테스트 실행 건을 감사했습니다. 이러한 철저함 덕분에 사고가 확산되기 전에 설정 오류를 발견할 수 있었습니다.
Anthropic의 조치
샌드박스 결함을 발견한 지 하루 만에 Anthropic은 진행 중인 모든 평가를 중단했습니다. 일주일 후, 세 가지 사건과 기술적 원인, 그리고 즉각적인 해결 단계를 나열한 상세 공개 보고서를 발표했습니다.
AI 에이전트 사용자를 위한 실질적인 교훈
- 직접적인 점검을 통해 네트워크 경계 검증 – 프롬프트나 설정 파일이 에이전트를 실제로 격리할 것이라고 가정하지 마십시오.
- 자격 증명(Credentials) 범위를 최소한으로 제한 – 작업에 반드시 필요한 권한만 부여하십시오.
- 도달 가능성 직접 테스트 – 민감한 리소스를 넘겨주기 전에 에이전트의 실제 네트워크 가시성을 조사하십시오.
- 의도하지 않은 활동 모니터링 – 계획에서 벗어난 아웃바운드 연결이나 패키지 등록에 대한 알림을 설정하십시오.
이번 사건은 단순한 진실을 강조합니다. AI 모델에 인터넷 접속 권한을 주는 것은 사람 운영자에게 자격 증명을 넘겨주는 것만큼이나 위험합니다. 샌드박스의 안전성이 입증될 때까지, 모든 AI 기반 동작은 잠재적으로 제한이 없는 것으로 간주하고 그에 따라 환경을 엄격히 통제해야 합니다.
