Eu construí um site que deseja ser citado por assistentes de IA e, em vez de apenas supor, coloquei em prática três sinais amplamente recomendados: uma entrada no robots.txt que permite a entrada de crawlers do tipo GPT, um arquivo llms.txt que lista todas as páginas e um schema JSON-LD que descreve o conteúdo. Após testar cada um, descobri que apenas um pode falhar sem aviso, e os outros não fazem o que a maioria das pessoas afirma.
Por que os três sinais importam
Webmasters têm sido informados de que crawlers focados em IA precisam de permissão explícita, que um índice de texto simples "llms.txt" ajuda modelos de linguagem de grande escala (LLMs) a localizar passagens relevantes e que dados estruturados em JSON-LD aumentam as chances de serem citados. A promessa é simples: adicione esses arquivos e seu site começará a aparecer em respostas geradas por IA, impulsionando o tráfego e a visibilidade da marca.
1. Permitindo a entrada de crawlers de IA no robots.txt
A linha no robots.txt que menciona o GPTBot (ou qualquer outro bot de IA) é apenas uma solicitação. Se uma rede de entrega de conteúdo (CDN) ou um firewall bloquear o bot, a solicitação nunca chegará ao site, e o crawler não conseguirá ler o arquivo de forma alguma. A única maneira confiável de saber se o bot consegue acessá-lo é verificar o código de status HTTP para cada bot principal. Uma resposta 403 (proibido) ou 503 (serviço indisponível) significa que o restante da infraestrutura é irrelevante — sem bot, sem indexação, sem citação.
2. O arquivo llms.txt
Um arquivo llms.txt é apenas uma lista em markdown de URLs, destinada a fornecer aos LLMs um mapa limpo de um site para que eles não precisem inferir a navegação apenas pelo HTML. Na prática, a documentação do Google diz que ele ignora o arquivo, e nenhum grande mecanismo de busca se comprometeu a usá-lo para fins de citação. Mantê-lo não custa quase nada e pode ser útil para agentes de IA personalizados, mas não deve ser anunciado como um atalho para obter mais citações de IA.
3. Schema JSON-LD
O JSON-LD incorpora dados estruturados — nomes de autores, datas de publicação, IDs de produtos — diretamente em uma página. Muitos profissionais de marketing presumem que adicionar schema fará com que suas páginas apareçam com mais frequência em respostas de IA, mas um estudo de 1.885 páginas não encontrou nenhum aumento mensurável em citações apenas pelo uso de marcação de schema. O real valor do JSON-LD reside na resolução de entidades: ele diz a uma máquina que "Jane Doe" em uma página é a mesma "Jane Doe" em outra, evitando confusões entre pessoas ou produtos com nomes semelhantes.
O verdadeiro gargalo: indexação
Todos os três sinais são apenas a infraestrutura básica; eles só funcionam se a página for indexada, para começar. Uma página que nunca aparece em um índice não pode ser recuperada, não importa quantas permissões de crawler ou tags de schema você adicione. O indicador mais confiável de uma indexação saudável é o relatório de cobertura no Google Search Console (ou a ferramenta equivalente para outros mecanismos). Se uma página aparecer como "não indexada", você precisa corrigir isso antes de se preocupar com quaisquer sinais específicos de IA.
Um checklist prático
- Verifique o acesso do crawler – Teste a resposta HTTP para o GPTBot, ClaudeBot ou qualquer outro crawler de IA que seja importante para você. Esta etapa pode falhar silenciosamente; um bloqueio não gerará um aviso em suas análises.
- Confirme a cobertura de indexação – Use o Search Console para ver quais páginas estão indexadas, quais estão excluídas e o porquê. Resolva quaisquer "erros de rastreamento" ou diretivas "noindex" primeiro.
- Adicione a infraestrutura básica – Assim que o acesso e a indexação estiverem sólidos, insira o llms.txt e o JSON-LD. Trate-os como auxiliares de baixa manutenção, em vez de garantias de citação.
Contraponto
Alguns fornecedores ainda comercializam geradores de llms.txt e plugins de schema como impulsionadores de SEO para IA. Os dados que coletei, somados à posição oficial dos principais mecanismos de busca, sugerem que essas afirmações são exageradas. As ferramentas não são prejudiciais, mas não devem ser o ponto central de uma estratégia de citação por IA.
O que observar a seguir
Monitore os logs do crawler, fique de olho nos alertas do Search Console e teste periodicamente seu JSON-LD com ferramentas de validação para manter o fluxo de dados constante.
Resumo: Se você quer que seu site seja citado por IA, pare de tratar llms.txt e schema como bilhetes mágicos. Certifique-se de que os bots consigam realmente alcançá-lo e que suas páginas estejam indexadas; só então os arquivos extras cumprirão seu papel modesto e de suporte.
Fonte: o post original no dev.to
