Anthropic은 Claude 모델이 생성하는 모든 텍스트와 파일에 숨겨진 디지털 서명을 삽입할 예정이며, 이는 유럽 연합(EU)의 새로운 AI 투명성 규정을 준수하기 위한 조치입니다. 이 변경 사항은 EU AI 법(EU AI Act)의 투명성 코드(Transparency Code)가 발효된 8월 2일 이후 출시된 모든 모델에 적용되며, Claude의 API, Code, Cowork 및 Tag 인터페이스 전반에 걸쳐 자동으로 나타납니다.
EU 규정이 중요한 이유
투명성 코드는 개발자가 AI로 생성하거나 편집한 콘텐츠에 표시를 남겨, 하위 시스템이 해당 콘텐츠의 합성 기원을 식별할 수 있도록 의무화합니다. 이 규정은 허위 정보 확산을 억제하고, 사용자가 기계가 제작한 자료를 접할 때 명확한 신호를 제공하는 것을 목표로 합니다. Anthropic의 대응 방식인 모델 수준의 워터마킹은 제품 UI에 표시를 덧붙이는 대신 출력물에 직접 마커를 삽입합니다.
다른 AI 거대 기업들도 유사한 약속을 하고 있습니다. Google, Meta, Microsoft, OpenAI 및 Black Forest Labs는 모두 EU의 표준을 준수하겠다고 밝혔습니다. 텍스트가 아닌 자산의 경우, Anthropic은 이미지, 비디오 및 기타 미디어에 출처 데이터를 삽입하기 위한 공개 문서화된 방식인 C2PA 오픈 표준을 사용할 예정입니다. Anthropic은 공개 사양을 따름으로써 자사의 표시가 저널리스트, 플랫폼 및 팩트 체크 담당자들이 이미 사용 중인 도구들과 호환되기를 기대하고 있습니다.
워터마크 작동 방식
Anthropic은 워터마크가 모델의 텍스트 생성 프로세스에 내장되어 있다고 설명합니다. 실제로 이 서명은 모델이 방출하는 토큰 스트림의 일부가 됩니다. 사용자가 텍스트를 워드 프로세서, 이메일 또는 소셜 미디어 게시물로 복사할 때, 숨겨진 패턴도 함께 이동합니다. 회사 측은 워터마크가 약간의 편집에도 유지될 수 있다고 언급했지만, 표시가 사라지기 위해 몇 글자가 바뀌어야 하는지는 공개하지 않았습니다.
“Claudefishing”에 대한 우려
Anthropic의 이번 도입은 거대 언어 모델(LLM)의 오용에 대한 경각심이 커지는 가운데 이루어졌습니다. Substack의 CEO Chris Best는 최근 특정 작가의 말투를 흉내 내어 기만적인 콘텐츠를 제작하는 데 AI를 사용하는 것을 설명하기 위해 “Claudefishing”이라는 용어를 만들었습니다. 합성 텍스트를 인간의 글과 구별하기가 점점 더 어려워짐에 따라, 출처를 자동으로 탐지하는 기술이 중요한 방어선이 되고 있습니다.
안전장치를 추가하는 것은 Anthropic뿐만이 아닙니다. 음악 생성 플랫폼 Suno와 뉴스레터 서비스 Substack은 콘텐츠가 AI로 생성되었을 때 독자에게 알리는 플래깅(flagging) 메커니즘을 도입했습니다. Anthropic은 소스 단계에서 워터마크를 삽입함으로써 신호를 제거하기 어렵게 만들고, 하위 필터가 이를 더 쉽게 처리할 수 있도록 하는 것을 목표로 합니다.
핵심 요약
- 규제 준수: Anthropic은 8월 2일부터 시행된 EU AI 법의 투명성 코드를 준수하기 위해 워터마킹을 구현하고 있습니다.
- 모델 수준 통합: 워터마크는 모델 수준에서 적용되므로 모든 제품(API, Claude Code 등)에서 유지되며 복사 및 붙여넣기 작업 후에도 사라지지 않습니다.
- 표준화된 파일 표시: 파일의 경우, Anthropic은 디지털 콘텐츠의 상호 운용성과 투명성을 보장하기 위해 C2PA 오픈 표준을 사용할 것입니다.
