ChatGPT 发布后,三分之一的网络内容显示出 AI 创作迹象

Pew Research 的一项开创性研究揭示了数字领域的巨大转变,发现很大一部分新的网络内容是由人工智能生成的。随着大语言模型 (LLMs) 被集成到内容工作流中,人类创作与机器生成文本之间的界限正在迅速模糊。

AI 生成内容的激增

为了量化生成式 AI 对互联网的影响,Pew Research 利用 Common Crawl 网络存档分析了近 50 万个英语网页。通过采用 Open Pangram 的检测技术,该研究试图区分人类创作与 AI 辅助的文本。

虽然 2026 年 7 月的 10,000 个页面的随机样本显示 AI 创作率为 10%,但由于包含了生成式 AI 热潮之前发布的旧内容,这一数字受到了偏差影响。然而,当研究人员过滤数据集,仅包含 2022 年 11 月 ChatGPT 发布后发表的页面时,数据出现了激增。研究发现,在这一近期时代发表的所有网页中,超过三分之一 (35%) 显示出由 AI 编写或经过 AI “大幅编辑”的显著迹象。

域名差异与“机器人循环”

AI 内容的激增在整个网络中并不均匀。研究强调了不同顶级域名 (TLDs) 之间的鲜明对比,表明商业利益正在推动 AI 写作工具最激进的应用。

数据显示,.com 域名的 URL 显示出 AI 创作率比学术或政府网站高出约 10 倍。具体而言,.edu 和 .gov 域名的 AI 创作率仅为 1%,而 .org 域名为 4.6%。这一趋势指向了一个商业化的网络,其中通过 LLMs 实现的速度和规模被置于传统的编辑监督之上。

AI 内容的激增伴随着 Cloudflare 报告的一个令人担忧的里程碑:机器人流量已正式超过人类网络流量。这创造了一个潜在的“死网 (dead internet)”反馈循环,即机器人越来越多地在浏览和抓取由其他机器人编写的内容。

语言特征与检测挑战

研究还识别出了作为 AI 生成文本“特征 (tells)”的特定语言模式。随着 LLMs 变得越来越复杂,它们的风格指纹也变得越来越可预测。研究人员注意到某些特定句法结构的流行程度有所增加,例如:

  • 大量使用破折号和牛津逗号。
  • 节奏性的短语模式,如“不是 X,而是 Y”。
  • 针对可读性进行了优化但缺乏人类细微差别的特定风格倾向。

虽然研究承认像 Pangram 这样的 AI 检测工具并非万无一失,且可能会出现误报,但数据的规模表明这些发现具有方向性的准确性。对于开发者和创始人来说,这凸显了一个关键挑战:随着网络被合成数据饱和,为未来模型维持训练集的质量变得越来越困难。

核心结论

  • 内容创作的巨大转变: 自 ChatGPT 发布以来发表的网页中,有 35% 显示出明显的 AI 创作或深度 AI 编辑迹象。
  • 商业主导: .com 域名是 AI 内容的主要驱动力,其比例是 .edu 和 .gov 域名的 10 倍。
  • 机器人生态系统: AI 编写内容的增加与机器人流量超过人类流量相吻合,预示着向机器主导的网络生态系统的转变。