Cloudflare 将于今年 9 月起默认拦截 AI 智能体爬虫

人工智能不受限制的网络抓取时代即将终结。从 9 月 15 日开始,Cloudflare 将实施一项重大政策转变,默认拦截 AI 智能体(AI agent)爬虫,从而迫使数据访问进入基于权限的新时代。

从被动抓取向主动授权的转变

多年来,AI 模型和自主智能体一直通过遍历开放网络、抓取数据来为用户提供实时回答。然而,Cloudflare 最近的公告标志着网络基础设施处理这些“智能体式”(agentic)机器人的方式发生了重大转向。与为了检索而对页面进行索引的传统搜索引擎爬虫不同,AI 智能体爬虫会实时获取内容,以便代表用户执行特定任务或回答复杂的查询。

从 9 月 15 日起,受 Cloudflare 保护的大部分网站将自动限制这些智能体。此举旨在让网站所有者和出版商能够更好地控制其专有数据和创意内容如何被大语言模型(LLM)及自主智能体摄取。互联网正从“任其抓取”的状态向“门禁模式”转型,即机器人必须明确请求访问权限。

开发者和网站所有者如何授予访问权限

虽然默认设置具有限制性,但 Cloudflare 的目的并非破坏有益 AI 工具的功能。相反,其目标是在爬虫与主机之间建立一种结构化的“握手”机制。对于开发者和网站管理员而言,这意味着要从“抓取一切”的心态转向一种受管理的方式。

为了确保合法且高价值的 AI 智能体仍能访问网站的特定部分,所有者需要实施特定的权限设置。这允许企业筛选哪些 AI 智能体(例如由 OpenAI、Anthropic 或 Google 提供支持的智能体)可以读取其内容,并可能规定相应的条款。对于更广泛的 AI 生态系统而言,这要求智能体开发者必须采用更复杂的方式来表明身份,并向 Web 服务器证明其合法性。

为什么这对 AI 生态系统至关重要

这一进展对于内容创作者和 AI 公司来说都是一个关键的转折点。对于出版商而言,它提供了一种急需的防御机制,以应对“数据抓取疲劳”——即内容被用于训练那些最终可能与原创作者竞争的模型。通过重新获得控制权,出版商可以保护其知识产权,并可能探索 AI 访问的新变现模式。

对于构建智能体工作流(agentic workflows)的 AI 开发者和创始人来说,这一变化引入了新的复杂性。智能体不能再依赖“所有公开的 HTML 都是可访问的”这一假设。为了使 AI 智能体具备面向未来的能力,它们需要具备“合规意识”,能够应对权限层级,并遵守像 Cloudflare 这样主要基础设施提供商所建立的新协议。

核心要点

  • 默认拦截: 从 9 月 15 日开始,除非获得明确授权,否则 Cloudflare 将在受保护的网站上自动拦截 AI 智能体爬虫。
  • 出版商掌控权: 此举将权力重新交还给网站所有者,允许他们决定哪些特定的 AI 实体可以摄取其实时数据。
  • 智能体的新标准: AI 开发者必须调整其智能体,使其更加尊重网络权限,向结构化的、基于权限的爬取模式转型。