屏蔽 GPTBot 并不能让你的网站从 ChatGPT 的回答面板中消失。那些在 robots.txt 中添加了针对该机器人的规则的网站所有者惊讶地发现,当用户询问 ChatGPT 相关话题时,他们的文章仍然会带着链接和摘要出现。屏蔽确实生效了——只是它屏蔽了错误的爬虫。
训练型机器人 vs. 引用型机器人
AI 提供商运行着两种截然不同的爬虫:
- 训练型机器人 (Training bots) 抓取公开可用的页面,摄取文本,并将其用于微调大语言模型。它们从不返回来源链接,也不会为网站带来流量。
- 引用型机器人 (Citation bots) 在查询时运行。当用户提出问题时,机器人会搜索网络,提取相关的片段,添加来源名称和 URL,并将其展示在聊天窗口中。这些点击可以带来真实的访问量。
如果你屏蔽了训练型机器人,模型就无法再从你的页面中学习。如果你屏蔽了引用型机器人,页面就会从 ChatGPT 的实时回答中消失。这种困惑源于许多网站在屏蔽 “GPTBot” 时,并未意识到相同的名称并不会出现在引用工作流中。
大型厂商如何划分其爬虫
| 提供商 | 训练型机器人名称 | 引用型机器人名称 |
|---|---|---|
| OpenAI | GPTBot | OAI-SearchBot, ChatGPT-User |
| Anthropic | ClaudeBot | Claude-SearchBot, Claude-User |
| Google-Extended | Googlebot | |
| Perplexity | — (两者均用于引用) | PerplexityBot, Perplexity-User |
如果你想让你的内容不被用于未来的模型训练,只需拒绝“训练型机器人名称”下的条目。如果你希望出现在 ChatGPT 的实时回答中,则应允许引用型机器人。
正确配置 robots.txt
一个针对 “GPTBot” 的通用 Disallow: / 行会屏蔽训练型爬虫,但会让引用型机器人不受影响。为了明确起见,请添加拒绝每个训练型机器人但允许引用型机器人的规则:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
# Allow citation bots
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Googlebot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
不要依赖仅屏蔽通用 “*” 的默认 robots.txt。这种区分非常重要,因为全盘屏蔽会同时将训练型和引用型机器人拒之门外,从而切断 AI 驱动搜索可能带来的流量。
Cloudflare 用户:使用 AI Crawl Control 面板
如果你的域名托管在 Cloudflare 之后,你可能会在 robots.txt 文件中看到 “Cloudflare management marker”。手动编辑文件可能会导致更改在下次 Cloudflare 更新时被覆盖。相反,请导航至 Cloudflare AI Crawl Control 界面,并切换相关机器人的开关。该面板会在后台写入正确的指令并保持其持久性。
为什么这种细微差别很重要
- 知识产权保护 – 屏蔽训练型机器人可以防止你的文字被免费采集并整合到未来的模型中。
- 引流流量 – 允许引用型机器人意味着在 ChatGPT 中看到片段的用户可以点击进入你的网站,从而产生真实的访问。
- 品牌曝光度 – 随着 AI 助手成为许多用户的主要信息来源,出现在 AI 增强搜索中可以让你的内容保持可发现性。
反方观点
一些出版商认为,任何对他们文本的使用(即使是为了引用)都在为更广泛的 AI 生态系统做出贡献,拒绝引用型机器人可能会损害他们的影响力。权衡很明显:你要么让模型在没有署名的情况下从你的作品中学习,要么让它引用你并为你带来流量。选择取决于你如何权衡即时点击量与对文字被重复利用的长期控制权。
后续关注点
AI 公司仍在不断迭代其爬虫的命名和路由方式。请密切关注其开发者文档中 user-agent 字符串的更新。一个新的引用型机器人可能会以不同的名称出现,而之前被屏蔽的训练型机器人可能会被重新命名。定期审计你的 robots.txt 和 Cloudflare 设置,以保持与最新的爬虫名单同步。
核心要点: 仅屏蔽训练型机器人的 user agent,以防止你的内容被用于未来的模型训练,但要保持引用型机器人处于启用状态,以便 ChatGPT 仍能将用户引导回你的网站。通过正确的 robots.txt 规则(必要时通过 Cloudflare 的 AI Crawl Control 应用),你可以在保护知识产权的同时,获取 AI 驱动的流量。
