Um Terço do Conteúdo da Web Pós-ChatGPT Apresenta Sinais de Autoria por IA

Um estudo inovador do Pew Research revelou uma mudança massiva no cenário digital, descobrindo que uma parte significativa do novo conteúdo da web está sendo gerada por inteligência artificial. À medida que os Grandes Modelos de Linguagem (LLMs) são integrados aos fluxos de trabalho de conteúdo, a fronteira entre o texto gerado por humanos e por máquinas está se tornando rapidamente tênue.

O Surto de Conteúdo Gerado por IA

Para quantificar o impacto da IA generativa na internet, o Pew Research analisou quase 500.000 páginas da web em inglês usando o arquivo web Common Crawl. Ao empregar a tecnologia de detecção da Open Pangram, o estudo buscou diferenciar textos de autoria humana de textos assistidos por IA.

Embora uma amostra aleatória de 10.000 páginas de julho de 2026 tenha mostrado uma taxa de autoria por IA de 10%, esse número foi distorcido pela inclusão de conteúdos legados publicados antes do boom da IA generativa. No entanto, quando os pesquisadores filtraram o conjunto de dados para incluir apenas páginas publicadas após o lançamento do ChatGPT em novembro de 2022, os números dispararam. O estudo descobriu que mais de um terço (35%) de todas as páginas da web publicadas nesta era recente apresentam sinais significativos de terem sido escritas ou "substancialmente editadas" por IA.

Disparidades de Domínio e o "Loop de Bots"

A proliferação de conteúdo de IA não é uniforme em toda a web. O estudo destacou um contraste gritante entre diferentes domínios de topo (TLDs), sugerindo que interesses comerciais estão impulsionando a adoção mais agressiva de ferramentas de escrita por IA.

De acordo com os dados, URLs com domínio .com exibem autoria por IA em uma taxa aproximadamente 10 vezes maior do que sites acadêmicos ou governamentais. Especificamente, os domínios .edu e .gov mostraram uma taxa de apenas 1% de autoria por IA, enquanto os domínios .org ficaram em 4,6%. Essa tendência aponta para uma web comercializada, onde a velocidade e a escala — frequentemente alcançadas por meio de LLMs — são priorizadas em detrimento da supervisão editorial tradicional.

Esse surto de conteúdo de IA chega junto com um marco preocupante relatado pela Cloudflare: o tráfego de bots superou oficialmente o tráfego humano na web. Isso cria um potencial loop de feedback de "internet morta" (dead internet), onde bots estão cada vez mais navegando e extraindo conteúdo que foi, ele próprio, escrito por outros bots.

Pistas Linguísticas e Desafios de Detecção

O estudo também identificou padrões linguísticos específicos que servem como "pistas" para textos gerados por IA. À medida que os LLMs se tornaram mais sofisticados, suas impressões digitais estilísticas tornaram-se mais previsíveis. Os pesquisadores observaram uma prevalência crescente de estruturas sintáticas específicas, tais como:

  • Uso extensivo de travessões e vírgulas de Oxford.
  • Padrões de frases rítmicas como "Não é X, é Y".
  • Tendências estilísticas específicas otimizadas para legibilidade, mas que carecem de nuance humana.

Embora o estudo reconheça que ferramentas de detecção de IA como o Pangram não são infalíveis e podem sofrer com falsos positivos, a escala dos dados sugere que essas descobertas indicam a tendência correta. Para desenvolvedores e fundadores, isso destaca um desafio crítico: à medida que a web se torna saturada com dados sintéticos, manter a qualidade dos conjuntos de treinamento para modelos futuros torna-se cada vez mais difícil.

Principais Conclusões

  • Mudança Massiva na Criação de Conteúdo: 35% das páginas da web publicadas desde o lançamento do ChatGPT mostram sinais claros de autoria por IA ou edição pesada por IA.
  • Dominância Comercial: Domínios .com são os principais impulsionadores de conteúdo de IA, superando os domínios .edu e .gov em um fator de 10.
  • O Ecossistema de Bots: O aumento no conteúdo escrito por IA coincide com o tráfego de bots superando o tráfego humano, sinalizando uma mudança para um ecossistema de web dominado por máquinas.