보안 연구원 Håkon Måløy는 Word 파일에 흰색 배경에 흰색 글자를 숨기는 간단한 트릭만으로 Microsoft Copilot for Word를 자기 복제형 AI 웜(worm)으로 만들 수 있음을 보여주었습니다. 이 웜은 사용자가 Copilot에게 감염된 문서를 처리하도록 요청할 때 자동으로 확산되며, SharePoint, Teams, Outlook을 통해 동료들에게 전달됩니다. 또한 전통적인 악성코드 페이로드 없이도 작동합니다.
웜의 작동 원리
이 공격은 Copilot과 같은 대규모 언어 모델(LLM)이 문서를 입력받는 방식을 악용합니다. 공격자는 표준 .docx 파일에 보이지 않는 지침(흰색 배경에 흰색 텍스트)을 삽입합니다. 사용자가 파일을 열고 Copilot에게 "요약"하거나 기타 처리를 요청하면, 모델은 사용자가 해당 명령을 직접 입력한 것처럼 숨겨진 텍스트를 읽습니다. 숨겨진 명령은 일반적으로 다음 세 가지 작업을 수행합니다:
- 콘텐츠 조작 – 문서 내의 숫자나 기타 데이터를 변경하도록 Copilot에 지시합니다.
- 자기 복제 – Copilot이 새로 생성된 문서에 숨겨진 지침 블록을 복사하도록 유도합니다.
- 전파 – 동일한 숨겨진 지침을 포함하게 된 새 문서가 다시 공유되면서 사이클이 반복됩니다.
모델은 문서 전체를 하나의 명령 창(instruction window)으로 취급하기 때문에, 사용자가 내린 프롬프트와 파일에 삽입된 텍스트를 구분할 수 없습니다. 그 결과 사용자의 코드 실행 없이도 확산되는 웜이 발생합니다.
이것이 지금 중요한 이유
Copilot이 Office 제품군에 통합되면서 많은 기업에서 AI 지원이 일상적인 현실이 되었습니다. 이 웜은 근본적인 설계 결함을 드러냅니다. 즉, LLM은 모든 것을 처리하기 위해 단일 명령 창을 사용한다는 점입니다. Microsoft는 이를 해결하기 위해 144일 동안 두 차례의 완화 조치를 발표했습니다. 하지만 개념 증명(PoC)은 여전히 작동하며, 이는 모델 업그레이드만으로는 이 격차를 메울 수 없음을 보여줍니다.
조직 입장에서 위험은 두 가지 측면이 있습니다. 첫째, 재무 보고서의 숫자와 같이 데이터 무결성이 눈에 띄는 흔적 없이 조용히 변경될 수 있습니다. 둘째, 웜은 단 하나의 감염된 문서를 내부 협업 도구를 휩쓰는 벡터로 전환하여, 공격 표면을 원래의 진입점보다 훨씬 더 넓게 확장할 수 있습니다.
더 넓은 맥락
이전의 우려 사항은 공격자가 LLM을 속여 내부 정보를 드러내거나 의도하지 않은 동작을 실행하게 만드는 프롬프트 인젝션(prompt injection)에 집중되었습니다. 이 웜은 그 개념을 문서 처리 영역으로 확장하여 "콘텐츠"와 "명령" 사이의 경계를 모호하게 만듭니다.
개발자 및 IT 팀이 오늘 할 수 있는 일
- 모든 외부 문서를 신뢰할 수 없는 것으로 간주하십시오 – 파일이 평범해 보이더라도 숨겨진 지침이 있을 수 있다고 가정하십시오.
- 보이지 않는 콘텐츠를 스캔하십시오 – 파일을 Copilot에 입력하기 전에 흰색 배경의 흰색 텍스트, 제로 너비 문자(zero-width characters) 또는 기타 숨겨진 마크업을 감지하는 도구를 사용하십시오.
- 배포 전 AI 출력물을 검토하십시오 – 생성된 텍스트가 의도한 콘텐츠와 일치하는지, 예상치 못한 변경 사항이 포함되어 있지 않은지 확인하십시오.
- Copilot의 액세스 범위를 제한하십시오 – 어시스턴트의 권한을 특정 작업에 필요한 최소한의 폴더 또는 라이브러리 세트로 제한하십시오.
- 필요하지 않은 경우 Copilot을 비활성화하십시오 – 설정에서 기능을 끄면 저위험 사용자에 대한 공격 벡터를 완전히 제거할 수 있습니다.
이러한 단계가 AI 웜의 이론적 가능성을 완전히 제거하지는 못하지만, 공격자가 성공하는 데 필요한 노력을 높이고 근본적인 모델 아키텍처가 재검토되는 동안 조직에 실질적인 방어선을 제공합니다.
반론: 이것은 현실적인 위협인가, 아니면 연구용 데모인가?
모델의 입력 처리 방식이 재설계될 때까지 이 취약점은 지속되며, 그 위험을 단순히 학술적인 것으로 치부할 수 없습니다.
향후 주목해야 할 점
이 AI 웜은 중요한 교훈을 강조합니다. AI 어시스턴트가 일상적인 소프트웨어에 스며들수록, 그들이 접하는 모든 데이터는 잠재적인 공격 표면이 됩니다. AI를 프로그래밍 가능한 인터페이스가 아닌 블랙박스 기능으로 취급하는 조직은 새로운 텍스트 기반 위협에 노출될 위험이 있습니다.
핵심 요약: 숨겨진 텍스트 웜은 AI 기반 문서 편집의 편리함이 보이지 않는 문자만으로도 무기화될 수 있음을 보여줍니다. 근본적인 모델 설계가 바뀌기 전까지 가장 안전한 태도는 모든 수신 문서를 의심스럽게 취급하고, 숨겨진 지침을 스캔하며, AI 액세스를 엄격히 필요한 범위로만 제한하는 것입니다.
