Wikimediaのエンジニアリングチームによると、AI搭載のクローラーがプラットフォームの最もコストのかかるトラフィックの65%を生成しており、一見無害に見えるボットの急増が、サーバー料金の明細項目へと変わっています。同じパターンが、現在では小さなブログや趣味のサイトでも見られます。
なぜこの急増が重要なのか
人間の訪問者は、ホームページ、特集記事、その他の有名なコンテンツといった人気のあるページに滞在します。CDNはそれらのページをエッジロケーションにキャッシュするため、オリジンサーバーが重い処理を行うことはめったにありません。対照的に、AIクローラーは一度の実行で数千もの無名のURLをスクレイピングします。それらのページはキャッシュされていることがほとんどないため、すべてのリクエストがWikimediaのオリジンインフラストラクチャまで直接届きます。その結果、総トラフィックに占める割合は比較的小さいにもかかわらず、計算、ストレージ、ネットワークの使用量が不釣り合いに増大しています。
データを公開したエンジニアリングブログは、ボットが全リクエストに占める割合はわずかであるものの、「コストのかかる」カテゴリーを支配していると指摘しています。
誰がその痛みを感じているのか
小規模な運営者には、そのような緩衝材がありません。隠れたコストは金銭面だけではなく、正当な訪問者に対するパフォーマンス低下のリスクも伴います。
サイトオーナーにできること
- まずはレート制限から – 短期間に単一のIPが行えるリクエスト数を制限します。これにより、アクセスを完全に拒否することなく、攻撃的なクローラーの速度を落とすことができます。
- 可視性とコストを天秤にかける – 検索エンジンのボットをブロックすればトラフィックを削減できるかもしれませんが、ページがインデックスから外れ、オーガニックな発見可能性を損なう可能性もあります。
- ボットを分類する – すべてのクローラーが同じではありません。トラフィックをもたらす正当な検索ツールもあれば、何の価値も提供しない純粋なスクレイパーもあります。
- プルーフ・オブ・ワーク(PoW)の課題を導入する – ページを配信する前に、小さな計算パズルを要求します。人間のブラウザは即座に解決できますが、ボットは余分な計算サイクルを消費する必要があり、そのコストが増大します。
- CDNアナリティクスを活用する – ほとんどのCDNはボットごとのリクエストメトリクスを表示できます。どのエージェントが最も頻繁にオリジンにアクセスしているかを特定し、それに応じてルールを調整してください。
結論は単純です。AIクローラーはもはや単なる珍しい存在ではなく、測定可能なコストセンターとなっています。世界的な百科事典を運営していても、単一ページのポートフォリオであっても、ボットのトラフィックをインフラ予算の明細項目として扱うことで、予期せぬ請求を防ぎ、実際のユーザーに対してサイトのレスポンスを維持することができます。
