GPTBotをブロックしても、ChatGPTの回答欄からサイトが消えるわけではありません。robots.txtでボットを拒否するルールを追加したサイト運営者が、ChatGPTで特定のトピックについて尋ねた際に、自分の記事がリンクや抜粋付きで表示されるのを見て驚くことがあります。ブロック自体は機能していましたが、対象となるクローラーが間違っていたのです。
学習用ボット vs. 引用用ボット
AIプロバイダーは、2種類の異なるクローラーを運用しています。
- 学習用ボット (Training bots): 公開されているページをスクレイピングしてテキストを取り込み、大規模言語モデル(LLM)のファインチューニングに使用します。これらはソースへのリンクを返さず、サイトへのトラフィックも発生させません。
- 引用用ボット (Citation bots): クエリ実行時に動作します。ユーザーが質問をすると、ボットはウェブを検索して関連するスニペットを抽出し、ソース名とURLを添えてチャットウィンドウに表示します。これらのヒットは、実際の訪問者につながる可能性があります。
学習用ボットをブロックすると、モデルはあなたのページから学習できなくなります。引用用ボットをブロックすると、ChatGPTのライブ回答からページが消えます。混乱が生じる理由は、多くのサイトが「GPTBot」をブロックしていますが、同じ名前が引用のワークフローには現れないことに気づいていないためです。
主要プロバイダーによるクローラーの分類
| プロバイダー | 学習用ボット名 | 引用用ボット名 |
|---|---|---|
| OpenAI | GPTBot | OAI-SearchBot, ChatGPT-User |
| Anthropic | ClaudeBot | Claude-SearchBot, Claude-User |
| Google-Extended | Googlebot | |
| Perplexity | — (両方とも引用に使用) | PerplexityBot, Perplexity-User |
将来のモデル学習にコンテンツを含めたくない場合は、「学習用ボット名」の項目のみを拒否(deny)する必要があります。ChatGPTのリアルタイム回答に表示させたい場合は、引用用ボットを許可したままにする必要があります。
robots.txt の正しい設定方法
「GPTBot」を対象とした汎用的な Disallow: / 行は、学習用クローラーをブロックしますが、引用用ボットには影響を与えません。明示的に行うには、各学習用ボットを拒否しつつ、引用用ボットを許可するルールを追加してください。
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
# Allow citation bots
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Googlebot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
汎用的な「*」のみをブロックするデフォルトの robots.txt に頼らないでください。一括ブロックを行うと、学習用と引用用の両方のボットが排除され、AI駆動型検索がもたらすトラフィックを遮断してしまうため、この区別は非常に重要です。
Cloudflareユーザーの方へ:AI Crawl Controlパネルを使用する
ドメインがCloudflareの後ろにある場合、robots.txt ファイル内に「Cloudflare management marker」が表示されることがあります。ファイルを直接編集すると、次回のCloudflareのアップデート時に変更が上書きされる可能性があります。代わりに、CloudflareのAI Crawl Controlインターフェースに移動し、該当するボットのスイッチを切り替えてください。このパネルは、裏側で正しいディレクティブを書き込み、それらを永続的に保持します。
なぜこの細かな違いが重要なのか
- 知的財産の保護 – 学習用ボットをブロックすることで、あなたの文章が無料で収集され、将来のモデルに組み込まれるのを防ぎます。
- リファラルトラフィック – 引用用ボットを許可することで、ChatGPT内でスニペットを見たユーザーがあなたのサイトにクリックして遷移できるようになり、実際の訪問を創出できます。
- ブランドの認知度 – AIアシスタントが多くのユーザーにとって主要な情報源となる中で、AI拡張検索に存在し続けることは、コンテンツの発見しやすさを維持することにつながります。
反論
一部のパブリッシャーは、引用目的であってもテキストを使用することは、より広範なAIエコシステムに貢献するものであり、引用用ボットを拒否することはリーチを損なう可能性があると主張しています。トレードオフは明確です。クレジットなしでモデルに作品を学習させるか、引用させてトラフィックを誘導するかです。選択は、即時的なクリックを重視するか、言葉の再利用に対する長期的なコントロールを重視するかによって決まります。
今後の注意点
AI企業は、クローラーの命名やルーティングの方法を現在も改良し続けています。開発者ドキュメントにおけるユーザーエージェント文字列の更新に注意を払ってください。新しい引用用ボットが別の名前で登場したり、以前ブロックされていた学習用ボットの名前が変更されたりする可能性があります。最新のクローラーリストに合わせるため、定期的に robots.txt とCloudflareの設定を監査してください。
まとめ: コンテンツを将来のモデル学習から除外するには、学習用ボットのユーザーエージェントのみをブロックし、ChatGPTがユーザーをあなたのサイトへ誘導できるように引用用ボットは有効にしたままにしてください。適切な robots.txt ルールを適用し、必要に応じてCloudflareのAI Crawl Controlを使用することで、知的財産を保護しながらAI駆動型のトラフィックを獲得することができます。
