2026年の分析によると、上位107サイトの44.9%が少なくとも1つのAIクローラーをブロックしています。リスクは単なるトラフィックの損失にとどまりません。ユーザーが今日情報を得ている新しいチャネルから、存在そのものが消失してしまう可能性があるのです。
問題の範囲
robots.txtは、Googlebotやその他の従来の検索クローラーに対して、どのページをインデックスするかを伝えるための標準的なファイルでした。現在、同様のファイルがAIクローラー(ChatGPT、Claude、Perplexityなどのツールに回答を生成するためにウェブコンテンツを読み取るソフトウェアエージェント)を制御しています。調査によると、調査対象サイトの44.9%が、意図的にこれらのボットのうち少なくとも1つを拒否しています。OpenAIのモデルで使用されるクローラーであるGPTBotが、ブロックされたエージェントのリストでトップにあります。
ブロックの驚くべき割合は、Cloudflareなどのサービスにおけるワンクリック設定によるもので、サイト所有者がセキュリティを強化しようとする過程で、意図せずAIへのアクセスを拒否してしまっている場合があります。
「AIクローラビリティ」の真の意味
クローラビリティ(Crawlability)とは、ボットがページを取得できる能力のことです。AIにとって、クローラビリティは、ユーザーが質問した際に、モデルがブランド、製品、またはサービスに関する最新の事実を引き出せるかどうかを決定します。サイトがクローラブルでない場合、AIは引用するソースを持たず、ブランドは回答フィードから消えてしまいます。
従来のSEOの定石は、Googlebotがページをクロールし、リンクのリストの中でランク付けされることに焦点を当てていました。AIのクローラビリティは、その目標を転換させます。ランキングではなく、対話型の回答内での「推奨」が成果となるのです。
トレーニングボット vs アンサーボット
すべてのAIクローラーが同じ目的を果たしているわけではありません。
- トレーニングボット (Training bots) – 例として、GPTBot、ClaudeBot、Google-Extendedなどが挙げられます。これらはウェブの広範囲をスクレイピングし、基盤となる言語モデルを動かす大規模なデータセットに供給します。独自のコンテンツを将来のモデル学習に使わせたくない場合、サイト所有者はこれらをブロックできます。
- アンサーボット (Answer bots) – 例として、OAI-SearchBot、Claude-SearchBot、PerplexityBotなどが挙げられます。これらはリアルタイムで動作し、ユーザーのクエリに答えるために特定のスニペットを取得します。アンサーボットをブロックすると、たとえ同じページが従来の検索エンジンによってインデックスされていても、対話型の回答の中でサイトのコンテンツが表示されることはなくなります。
分析によると、多くのサイトがこの2つを混同しており、結果として「すべてのAIをブロックする」という包括的なルールを適用してしまい、実際の知的財産(IP)を保護することなく、視認性を損なっています。
なぜ誤ったボットがブロックされるのか
設定ミスには、いくつかの要因があります。
- デフォルトのセキュリティプリセット – 「AIをブロック」という単一のトグルを提供するプラットフォームは、サイトが実際に到達してほしいアンサーボットを含む、既知のすべてのクローラーにそれを適用してしまうことがよくあります。
- 認識不足 – ほとんどのウェブマスターはGooglebot用のrobots.txtについては知っていますが、新しいAI特有のディレクティブについては馴染みが薄いのが現状です。
- データの悪用への懸念 – 所有者は、トレーニングボットがコンテンツを将来のモデルに組み込むことを懸念しています。これは正当な懸念ですが、オンデマンドでデータを取得するだけのアンサーボットには当てはまりません。
正しいバランスを実現する方法
- robots.txtを編集する – 到達してほしいアンサーボットを明示的に許可します。
User-agent: OAI-SearchBot\nAllow: /のような行を追加することで、他のエージェントをブロックしたまま、OpenAIのアンサーボットにサイト全体をクロールさせることができます。 - トレーニングデータの扱いを決める – 独自の素材の保護を優先する場合は、GPTBot、ClaudeBot、および同様のトレーニングエージェントに対して
Disallowルールを維持します。 - llms.txtを採用する – この新興の標準規格を使用すると、パブリッシャーはAIが消費するのに最も重要なページを強調表示でき、アンサーボットの発見プロセスを迅速化できます。
- サードパーティの設定を監査する – AIクローラーを自動的にブロックしている可能性のあるセキュリティやCDNの設定を確認し、ルールを手動で調整します。
検討すべきトレードオフ
アンサーボットを許可すると、AI主導の会話におけるブランドの露出は向上しますが、コンテンツがユーザー向けの回答内で逐語的に再現される可能性があることも意味します。トレーニングボットをブロックすれば、データが将来のモデルの重みに組み込まれるのを防げますが、アンサーボットが同じ公開ページを取得することを止めることはできません。
企業の核心的な価値が知的財産(IP)の厳格な管理にある場合、より厳格なブロックが正当化されるかもしれませんが、その代償として、現在多くのユーザーが調査を開始するチャネルにおける存在感が低下します。逆に、製品の発見によって成長するeコマースサイトにとっては、いくつかの引用スニペットが表示されるわずかなリスクよりも、AIクローラビリティを備えていることのメリットの方が大きいでしょう。
次に注目すべきこと
- llms.txtの普及 – この標準規格が普及するにつれ、それを解析するツールが、AI回答ボットが高価値なコンテンツを見つけ出すための主要な手段となる可能性があります。
- AIプロバイダーによるポリシーの転換 – OpenAIやAnthropicなどは、クローラーポリシーを洗練させ、より詳細なオプトイン・メカニズムを提供する可能性があります。
- AI学習データに関する法的指針 – スクレイピングされた公開コンテンツをモデルの学習に使用できるかどうかを巡る継続的な議論は、多くのサイトが学習ボットを完全にブロックするかどうかの判断に影響を与える可能性があります。
結論として、ユーザーがキーワードを入力するのではなく質問を投げかけることが増えている場所で、ブランドがその存在感を示し続けたいのであれば、サイトをAIがクロール可能な状態にする必要があります。第一歩は単純なrobots.txtの編集であり、第二歩は、次世代の検索に対してどのデータを共有してもよいかという明確な意思決定です。学習ボットと回答ボットの区別を無視することは、情報の探し方を再構築しているまさにその領域において、企業の姿を消してしまうことにつながりかねません。
