Bloquear o GPTBot não apaga o seu site do painel de respostas do ChatGPT. Proprietários de sites que adicionaram uma regra no robots.txt contra o bot ficaram surpresos ao ver que seus artigos ainda aparecem com links e trechos quando os usuários perguntam ao ChatGPT sobre o assunto. O bloqueio funcionou – ele apenas parou o crawler errado.
Bots de treinamento vs. bots de citação
Os provedores de IA operam dois tipos distintos de crawlers:
- Bots de treinamento fazem o scraping de páginas publicamente disponíveis, ingerem o texto e o utilizam para o ajuste fino (fine-tuning) de grandes modelos de linguagem. Eles nunca retornam um link para a fonte e não geram tráfego para o site.
- Bots de citação operam no momento da consulta. Quando um usuário faz uma pergunta, o bot pesquisa na web, extrai um trecho relevante, adiciona o nome e a URL da fonte e o apresenta na janela de chat. Esses acessos podem gerar visitantes reais.
Se você bloquear o bot de treinamento, o modelo não poderá mais aprender com suas páginas. Se você bloquear o bot de citação, a página desaparecerá das respostas em tempo real do ChatGPT. A confusão surge porque muitos sites bloqueiam o “GPTBot” sem perceber que o mesmo nome não aparece no fluxo de citação.
Como os grandes players dividem seus crawlers
| Provedor | Nome do bot de treinamento | Nomes dos bots de citação |
|---|---|---|
| OpenAI | GPTBot | OAI-SearchBot, ChatGPT-User |
| Anthropic | ClaudeBot | Claude-SearchBot, Claude-User |
| Google-Extended | Googlebot | |
| Perplexity | — (ambos usados para citações) | PerplexityBot, Perplexity-User |
Apenas as entradas sob “Nome do bot de treinamento” precisam ser negadas se você quiser manter seu conteúdo fora do treinamento de modelos futuros. Os bots de citação devem permanecer permitidos se você desejar aparecer nas respostas em tempo real do ChatGPT.
Configurando o robots.txt da maneira correta
Uma linha genérica Disallow: / que visa o “GPTBot” bloqueia o crawler de treinamento, mas deixa os bots de citação intactos. Para ser explícito, adicione regras que neguem cada bot de treinamento, enquanto permitem os bots de citação:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
# Allow citation bots
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Googlebot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
Não confie em um robots.txt padrão que bloqueia apenas o “*” genérico. A distinção é importante porque um bloqueio generalizado manteria tanto os bots de treinamento quanto os de citação fora, cortando o tráfego que a busca impulsionada por IA pode fornecer.
Usuários do Cloudflare: use o painel AI Crawl Control
Se o seu domínio estiver atrás do Cloudflare, você poderá ver um “marcador de gerenciamento do Cloudflare” dentro do arquivo robots.txt. Editar o arquivo manualmente pode fazer com que as alterações sejam sobrescritas na próxima atualização do Cloudflare. Em vez disso, navegue até a interface AI Crawl Control do Cloudflare e alterne as chaves para os bots relevantes. O painel escreve as diretivas corretas nos bastidores e as mantém persistentes.
Por que essa nuance é importante
- Proteção de propriedade intelectual – Bloquear bots de treinamento evita que sua prosa seja extraída gratuitamente e incorporada em modelos futuros.
- Tráfego de referência – Permitir bots de citação significa que os usuários que virem um trecho no ChatGPT podem clicar e ir para o seu site, gerando visitas reais.
- Visibilidade da marca – A presença em buscas aumentadas por IA mantém seu conteúdo descoberto à medida que os assistentes de IA se tornam uma fonte primária de informação para muitos usuários.
O contra-argumento
Alguns editores argumentam que qualquer uso de seu texto, mesmo para citação, contribui para o ecossistema de IA mais amplo e que recusar bots de citação poderia prejudicar seu alcance. A troca é clara: ou você deixa o modelo aprender com seu trabalho sem dar crédito, ou você permite que ele cite você e gere tráfego. A escolha depende de como você valoriza cliques imediatos versus o controle de longo prazo sobre como suas palavras são reutilizadas.
O que observar a seguir
As empresas de IA ainda estão iterando sobre como nomeiam e direcionam seus crawlers. Fique de olho nas atualizações das strings de user-agent em suas documentações para desenvolvedores. Um novo bot de citação pode aparecer sob um nome diferente, e um bot de treinamento anteriormente bloqueado pode ser renomeado. Audite regularmente seu robots.txt e suas configurações do Cloudflare para se manter alinhado com a lista mais recente de crawlers.
Resumo: Bloqueie apenas os user agents dos bots de treinamento para manter seu conteúdo fora do treinamento de modelos futuros, mas deixe os bots de citação habilitados para que o ChatGPT ainda possa direcionar os usuários para você. As regras corretas de robots.txt, aplicadas através do AI Crawl Control do Cloudflare quando necessário, permitem que você proteja sua propriedade intelectual enquanto colhe o tráfego gerado por IA.
