Anthropicは、Claudeモデルが生成するすべてのテキストおよびファイルに、隠されたデジタル署名を埋め込みます。これは、欧州連合(EU)の新しいAI透明性規則に準拠するための動きです。この変更は、8月2日にEU AI法の透明性コードが施行された後にリリースされたすべてのモデルに適用され、ClaudeのAPI、Code、Cowork、およびTagインターフェース全体で自動的に適用されます。

なぜEUの規則が重要なのか

透明性コードは、後続のシステムが合成された起源を特定できるように、AIによって生成または編集されたコンテンツにマークを付けることを開発者に義務付けています。この規則は、誤情報の拡散を抑制し、ユーザーが機械によって作成された素材を扱っている際に明確なシグナルを与えることを目的としています。Anthropicの対応である「モデルレベルのウォーターマーキング」は、製品のUIに後付けするのではなく、出力の中に直接マーカーを配置するものです。

他のAI大手も同様の約束をしています。Google、Meta、Microsoft、OpenAI、およびBlack Forest Labsはすべて、EUの基準を満たすと表明しています。テキスト以外の資産については、AnthropicはC2PAオープンスタンダードを使用します。これは、画像、ビデオ、その他のメディアにプロバナンス(来歴)データを埋め込むための公開された手法です。オープンな仕様に従うことで、Anthropicは自社のマーキングが、ジャーナリスト、プラットフォーム、ファクトチェッカーがすでに使用しているツールと連携することを期待しています。

ウォーターマークの仕組み

Anthropicによると、ウォーターマークはモデルのテキスト生成プロセスに組み込まれています。実際には、署名はモデルが放出するトークンストリームの一部となります。ユーザーがテキストをワードプロセッサ、メール、またはソーシャルメディアの投稿にコピーすると、隠されたパターンも一緒に移動します。同社は、ウォーターマークは多少の編集には耐えられると述べていますが、マークが消失するまでに何文字変更する必要があるかについては明らかにしていません。

「Claudefishing」への懸念

Anthropicの導入は、大規模言語モデル(LLM)の悪用に対する懸念が高まる中で行われます。SubstackのCEOであるChris Best氏は、特定の著者の声を模倣した欺瞞的なコンテンツを作成するためにAIを使用することを指して、最近「Claudefishing(クロードフィッシング)」という言葉を作りました。合成テキストと人間の文章の区別が困難になるにつれ、プロバナンス(来歴)の自動検出は極めて重要な防御線となります。

セーフガードを追加しているのはAnthropicだけではありません。音楽生成プラットフォームのSunoやニュースレターサービスのSubstackは、コンテンツがAIによって作成された場合に読者に通知するフラグ立ての仕組みを導入しています。ソース(発生源)でウォーターマークを埋め込むことにより、Anthropicはシグナルを剥がしにくくし、後続のフィルターが対応しやすくすることを目指しています。

主なポイント

  • 規制遵守: Anthropicは、8月2日に施行されたEU AI法の透明性コードを満たすために、ウォーターマーキングを実装しています。
  • モデルレベルの統合: ウォーターマークはモデルレベルで適用されるため、すべての製品(API、Claude Codeなど)にわたって維持され、コピー&ペースト操作後も残ります。
  • 標準化されたファイルマーキング: ファイルについては、AnthropicはC2PAオープンスタンダードを使用し、デジタルコンテンツにおける相互運用性と透明性を確保します。