Anthropic은 합성 콘텐츠를 기계 판독이 가능한 방식으로 명확하게 표시해야 한다는 EU AI 법(EU AI Act)의 요구 사항을 충족하기 위해 Claude가 생성한 텍스트에 워터마크를 도입했습니다. 이 회사는 이 기술이 모델의 속도를 늦추거나 추가 토큰을 사용하지 않고도 AI가 작성한 텍스트를 식별할 수 있다고 밝히고 있으며, 규제 당국과 경쟁사들이 곧 이 주장을 검증할 예정입니다.
워터마크가 중요한 이유
워터마크는 단어 선택 결정 과정에 개인 키(private key)와 주변 문맥을 반영하여 패턴을 심습니다. 독자는 이 패턴을 볼 수 없지만, 키를 알고 있는 검증기는 이를 찾아낼 수 있습니다. 실제로 다운스트림 도구가 문서를 스캔하여 Claude가 생성했는지 여부를 보고합니다.
규제 압박
EU AI 법은 생성형 시스템 제공업체가 합성 콘텐츠에 탐지 가능한 신호를 삽입하도록 강제합니다.
비즈니스 트레이드오프
기업들은 이러한 표식을 채택할지 결정할 때 세 가지 사항을 고려해야 합니다:
- 추적성 한계 – 워터마크는 텍스트가 AI 모델에서 생성되었음을 확인해 주지만, 결과물을 특정 사용자나 계정과 연결할 수는 없습니다. 이러한 공백은 AI 생성 콘텐츠가 오용될 때 책임 소재를 불분명하게 만듭니다.
- 수익 위험 – 일부 제공업체는 눈에 보이는 워터마크가 경쟁력이나 개인정보 보호를 이유로 표식 없는 텍스트를 선호하는 고객의 최대 3분의 1을 이탈하게 만들까 봐 우려합니다.
- 기술적 제약 – 패턴을 삽입하면 모델 출력물의 창의성이 다소 저하될 수 있으며, 특히 워터마크가 활용할 단어가 적은 매우 짧은 문구에서 더욱 그렇습니다. 또한 사용자가 텍스트의 일부를 수동으로 재구성함으로써 신호를 희석시켜 탐지를 어렵게 만들 수도 있습니다.
Anthropic은 자사의 방식이 이러한 단점의 대부분을 피할 수 있다고 확신합니다. 토큰 선택 과정에 키를 결합함으로써 지연 시간(latency) 페널티나 추가 토큰 비용 없이 유료 고객이 기대하는 사용자 경험을 유지할 수 있다고 주장합니다.
기술적 과제
탐지 가능성은 검증기가 생성 시 사용된 것과 동일한 개인 키를 보유하고 있는지에 달려 있습니다. 짧은 텍스트는 통계적 패턴이 덜 뚜렷하여 미탐률(false-negative rates)이 높아지는 취약점으로 남아 있습니다. 또한 워터마크는 다운스트림 편집을 막지 못합니다. 문단의 절반을 다시 쓰는 사용자는 사실상 마커를 지워버릴 수 있습니다.
시사점: Anthropic의 워터마크는 새로운 법적 명령에 대한 대응책이지만, 그 영향력은 탐지 가능성과 유연성 저하 및 우회 위험 사이의 균형을 얼마나 잘 맞추느냐에 달려 있습니다.
