Anthropic의 Opus 5, 브라우저 프롬프트 인젝션 성공률 0% 달성

Anthropic은 Opus 5를 출시하며 AI 보안 분야에서 기념비적인 돌파구를 마련했으며, 이는 자율 에이전트의 가장 고질적인 취약점 중 하나를 해결할 가능성을 보여주었습니다. 이 모델은 이중 계층 방어 시스템을 구현함으로써 브라우저 기반 프롬프트 인젝션 공격에 대해 거의 완벽한 면역력을 입증했습니다.

AI 에이전트의 프롬프트 인젝션 위기

프롬프트 인젝션은 현재 AI 시대의 "아킬레스건"으로 남아 있습니다. 이 취약점은 공격자가 웹페이지 내에(종종 보이지 않는 텍스트를 통해) 악의적인 지침을 숨겨두고, AI 에이전트가 브라우징 중에 이를 읽게 될 때 발생합니다. 일단 처리되면, 이러한 지침은 모델을 하이재킹하여 안전 프로토콜을 우회하거나 승인되지 않은 작업을 실행하도록 강제할 수 있습니다. OpenAI와 같은 업계 리더들은 이전에 프롬프트 인젝션이 LLM의 해결 불가능한 내재적 결함일 수 있다고 시사해 왔으나, Anthropic의 최신 데이터는 이러한 비관적인 전망에 도전하고 있습니다.

0% 벤치마크 달성

Anthropic의 시스템 카드에 따르면, Opus 5는 브라우저 에이전트를 위해 특별히 설계된 129가지의 서로 다른 테스트 시나리오에서 놀라운 0%의 공격 성공률을 기록했습니다. 이는 이전 버전들에 비해 비약적인 발전입니다. 보안 기업 Gray Swan이 실시한 일반적인 프롬프트 인젝션 테스트에서 Opus 5는 이전 모델보다 극적인 개선을 보여주었습니다. 15번의 시도 후, 공격 성공률은 Opus 4.8에서 관찰된 5.5%에서 단 2.0%로 떨어졌습니다.

이러한 성능을 바탕으로 Opus 5는 Gray Swan IPI 벤치마크의 최상위에 올랐으며, Mythos 5(2.6%) 및 Fable 5(2.8%)와 같은 다른 상위 모델들을 능가했습니다.

비결: Auto Mode와 이중 계층 방어

이번 돌파구는 단순히 모델의 지능 덕분만이 아니라, 특화된 소프트웨어와의 통합 덕분입니다. "0%" 성공률은 특히 Claude Cowork와 같은 제품에서 Auto Mode를 사용하는 것과 밀접하게 연관되어 있습니다. Anthropic은 에이전트를 보호하기 위해 정교한 2계층 방어 아키텍처를 활용합니다:

  1. Pre-processing Scan (전처리 스캔): 기본 LLM이 텍스트를 처리하기 전에 전용 계층이 모든 입력 데이터를 스캔하여 숨겨지거나 조작된 지침이 있는지 확인합니다.
  2. Execution Blocking (실행 차단): 보조 계층이 에이전트의 의도된 동작을 모니터링하여, 브라우저 환경에서 실행되기 전에 위험한 명령을 차단합니다.

흥미롭게도, 데이터에 따르면 모델 단독으로는 만능 해결책이 아닙니다. 이러한 보호 소프트웨어 계층이 없다면 Opus 5의 취약성은 3.7%에 달합니다. 실제로 특화된 Sonnet 5 모델은 단독 실행 시 0.93%의 성공률로 약간 더 나은 성능을 보입니다. 보안 임계값을 거의 완벽에 가깝게 끌어올린 것은 핵심 모델과 방어 소프트웨어 스택 사이의 시너지 효과입니다.

이것이 AI의 미래에 중요한 이유

자율 AI 에이전트를 구축하는 개발자와 창업자들에게 이번 발전은 패러다임의 전환입니다. 만약 프롬프트 인젝션이 단순히 모델 학습이 아닌 아키텍처 계층을 통해 중화될 수 있다면, AI가 이메일, 브라우저 및 민감한 데이터를 관리하는 신뢰할 수 있는 "에이전트적(agentic)" 워크플로우로 가는 길이 훨씬 더 안전해집니다. Anthropic은 업계가 "해결 불가능하다"는 서사를 넘어 견고하고 즉시 상용화 가능한 AI 자율성을 향해 나아갈 수 있는 청사진을 제시했습니다.

핵심 요약

  • 업계 선도적인 보안: Auto Mode를 사용할 때 Opus 5는 129가지 브라우저 기반 프롬프트 인젝션 시나리오에서 0%의 성공률을 달성했습니다.
  • 심층 방어(Defense-in-Depth): 전처리 데이터 스캔과 선제적인 동작 차단을 포함하는 이중 계층 접근 방식을 통해 보안을 실현합니다.
  • 벤치마크 압도: Opus 5는 Gray Swan IPI 벤치마크를 주도하며, 이전 모델 버전에 비해 공격 성공률을 크게 낮추었습니다.