Wikimedia 的工程团队表示,AI 驱动的爬虫产生了该平台最昂贵流量的 65%,将看似无害的机器人激增变成了服务器账单上的明细项。同样的模式现在也出现在微型博客和兴趣网站上。
为什么这种激增至关重要
人类访问者会在热门页面停留——如首页、精选文章和其他知名内容。CDN 会在边缘节点缓存这些页面,因此源服务器很少需要承担繁重的工作。相比之下,AI 爬虫在单次运行中会抓取数千个冷门的 URL。这些页面很少被缓存,因此每个请求都会直接回溯到 Wikimedia 的源基础设施。结果是:在总流量占比相对较小的情况下,消耗了不成比例的计算、存储和网络资源。
发布该数据的工程博客指出,虽然机器人仅占总请求量的很小一部分,但它们却占据了“高成本”这一类别的主导地位。
谁在承受痛苦
小型运营者缺乏这种缓冲能力。隐藏的成本不仅是金钱,还可能导致合法访问者的性能下降。
网站所有者可以做什么
- 从速率限制(rate-limiting)开始 – 限制单个 IP 在短时间内可以发起的请求数量。这可以在不直接拒绝访问的情况下减缓激进爬虫的速度。
- 权衡可见性与成本 – 屏蔽搜索引擎机器人可能会减少流量,但也可能导致你的页面从索引中消失,从而损害自然搜索的发现能力。
- 对机器人进行分类 – 并非所有爬虫都是一样的。有些属于带来流量的正规搜索工具;而另一些则是毫无价值的纯粹抓取工具。
- 部署工作量证明(proof-of-work)挑战 – 在提供页面之前要求完成一个小型的计算谜题。人类浏览器可以瞬间解决;而机器人必须消耗额外的计算周期,从而提高其成本。
- 利用 CDN 分析功能 – 大多数 CDN 都会提供针对每个机器人的请求指标。识别哪些代理最频繁地访问源站,并据此定制规则。
结论很简单:AI 爬虫不再仅仅是某种“搭便车”的现象,它们已成为可衡量的成本中心。无论你运营的是全球性的百科全书还是单页作品集,将机器人流量视为基础设施预算中的一个明细项,可以防止意外账单的出现,并确保你的网站对真实用户保持响应。
