Cloudflare、この9月からAIエージェントのクローラーをデフォルトでブロックへ

人工知能による無制限のウェブスクレイピングの時代が終わりを迎えようとしています。9月15日より、CloudflareはAIエージェントのクローラーをデフォルトでブロックするという大幅なポリシー変更を実施し、許可ベースのデータアクセスという新しい時代を強制することになります。

受動的なスクレイピングから能動的な許可への転換

長年、AIモデルや自律型エージェントは、オープンなウェブを巡回してデータをスクレイピングし、ユーザーにリアルタイムの回答を提供することで機能してきました。しかし、Cloudflareの最近の発表は、ウェブインフラストラクチャがこれらの「エージェント型」ボットをどのように扱うかにおける重要な転換点となります。検索エンジンが情報の検索のためにページをインデックス化する従来のクローラーとは異なり、AIエージェントのクローラーは、ユーザーに代わって特定のタスクを実行したり、複雑なクエリに答えたりするために、リアルタイムでコンテンツを取得します。

9月15日以降、Cloudflareによって保護されているウェブの大部分において、これらのエージェントが自動的に制限されます。この動きは、ウェブサイトの所有者やパブリッシャーが、独自のデータやクリエイティブなコンテンツが大規模言語モデル(LLM)や自律型エージェントによってどのように取り込まれるかについて、より多くの制御権を持てるように設計されています。ウェブは「自由放任」の状態から、ボットが明示的にアクセスをリクエストしなければならない「ゲート型(制限付き)」モデルへと移行しつつあります。

開発者やサイト所有者がアクセスを許可する方法

デフォルト設定は制限的ですが、Cloudflareは有益なAIツールの機能を損なうことを目的としているわけではありません。むしろ、クローラーとホストとの間に構造化された「ハンドシェイク(握手)」を確立することを目指しています。開発者やサイト管理者にとって、これは「すべてをスクレイピングする」という考え方から、管理されたアプローチへと移行することを意味します。

正当で価値の高いAIエージェントが引き続きウェブサイトの特定の部分にアクセスできるようにするために、所有者は特定の許可設定を実装する必要があります。これにより、企業はOpenAI、Anthropic、Googleなどが提供するどのAIエージェントにコンテンツを読み取らせるか、また、どのような条件で行うかを管理できるようになります。AI業界全体としては、エージェントの開発者が自身を特定し、ウェブサーバーに対してその正当性を証明するための、より洗練された方法が必要になります。

なぜこれがAIエコシステムにとって重要なのか

この展開は、コンテンツクリエイターとAI企業の両方にとって、極めて重要な転換点となります。パブリッシャーにとっては、コンテンツが最終的に元のクリエイターと競合する可能性のあるモデルのトレーニングに使用される「データスクレイピング疲れ」に対する、切実に求められていた防御メカニズムとなります。制御権を取り戻すことで、パブリッシャーは知的財産を保護し、AIアクセスに対する新しい収益化モデルを模索できる可能性があります。

エージェント型ワークフローを構築しているAI開発者や創業者にとって、この変更は新たな複雑さをもたらします。エージェントは、公開されているすべてのHTMLにアクセスできるという前提に頼ることはできなくなります。AIエージェントを将来にわたって有効に機能させるためには、「コンプライアンスを意識」し、許可レイヤーをナビゲートし、Cloudflareのような主要なインフラプロバイダーによって確立された新しいプロトコルを尊重する能力が求められるでしょう。

主なポイント

  • デフォルトでのブロック: 9月15日より、Cloudflareは明示的な許可がない限り、保護されたサイト上のAIエージェントのクローラーを自動的にブロックします。
  • パブリッシャーへの制御権: この動きは権限をウェブサイトの所有者に還元し、どの特定のAIエンティティがリアルタイムデータを取得できるかを決定できるようにします。
  • エージェントの新しい標準: AI開発者は、ウェブの許可設定をより尊重するようにエージェントを適応させ、構造化された許可ベースのクローリングモデルへと移行する必要があります。