你的页面可能在 Google 排名第一,但在 ChatGPT 中却完全不可见
Google 的爬虫会运行你的 JavaScript,将渲染后的 HTML 拉取到其索引中,并能将客户端渲染(client-side rendered)的网站放在搜索结果的第一页。然而,当通过 ChatGPT 或 Bing 的 AI 搜索进行查询时,同一个页面却会消失,因为驱动这些服务的机器人从不执行 JavaScript。结果就是:一个排名靠前的网站,却无法被任何 AI 助手检索到。
为什么 AI 爬虫会错过你的内容
两种使用最广泛的 AI 爬虫——OpenAI 的 GPTBot 和 Anthropic 的 ClaudeBot——根本不会渲染 JavaScript。Vercel 和 MERJ 在 2024 年 12 月的一项研究表明,这两种机器人只是下载原始 HTML 和任何链接的 JavaScript 文件,然后就停止了。脚本从未运行,因此机器人看到的只是一个空壳。
相比之下,Googlebot 会将页面放入队列,执行脚本,并对生成的 DOM 进行索引。这种根本性的差异意味着,使用纯客户端框架(如 React、Vue 等)构建的网站可以对 Google 完全可见,但在 AI 驱动的搜索中却是一片空白。
Google vs. AI:渲染差距
Google 长期以来一直致力于无头渲染(headless rendering)。它的机器人可以处理复杂的单页应用(SPA),对其进行注水(hydrate),并提取初始加载后出现的结构化数据。然而,AI 爬虫仍处于“仅下载”模式。它们可能会解析通过 react-helmet 等工具注入的 JSON-LD,但前提是该标记必须存在于原始 HTML 中。
开发者工具可能会产生误导。Chrome 中的 Elements 面板显示的是 JavaScript 运行后的页面,这会给人一种标记已包含在源码中的错觉。使用“查看源代码”(或不使用浏览器的 curl)可以揭示机器人实际接收到的内容。如果内容或结构化数据在那里缺失,AI 爬虫就永远看不到它。
问题是如何显现的
一个依赖客户端渲染的典型 React 网站,在 Google 上搜索“最佳咖啡机”或“如何修理漏水的水龙头”等关键词时会获得高排名。然而,当用户询问 ChatGPT“哪些是最好的咖啡机?”时,得到的答案会完全忽略该网站。同样的差距也存在于 Bing 的 AI 中,它承载了 ChatGPT 约 92% 的智能体(agent)查询。Bing 的 JavaScript 渲染能力有限,因此仅限客户端的网站对这两大主流 AI 搜索提供商来说都是不可见的。
这个问题是无声的。追踪 Google 排名的 SEO 仪表板会报告良好的排名位置,而来自 AI 助手的网站流量却始终为零。这种差异可能会让企业失去日益增长的发现流量,尤其是随着越来越多的用户依赖对话式界面来获取快速答案。
开发者在哪些方面做错了
许多团队认为,如果 Google 能读取页面,那么任何爬虫都能。他们经常:
- 依赖
react-helmet或类似的库在页面加载后注入 JSON-LD,认为标记已经“在那里”了。 - 仅在浏览器的 Elements 视图中进行测试,而不是在原始源码中测试。
- 跳过了简单的
curl检查,忽略了标题或关键词从未出现在初始 HTML 响应中的事实。
这些做法营造了 SEO 健康的假象,却让网站在 AI 搜索面前变得“盲目”。
如何修复
补救措施是在第一个 HTTP 响应中交付真实内容。三种经过验证的方法行之有效:
- 服务端渲染 (SSR) – 服务器运行 JavaScript,渲染完整的 HTML,并将其发送给客户端。页面到达时已经填充了内容。
- 静态生成 (Static Generation) – 在构建时,框架创建包含所有内容的静态 HTML 文件。不需要运行时渲染。
- 预渲染 (Prerendering) – 中间件服务渲染页面一次,缓存结果,并将静态快照提供给爬虫。
Next.js (React) 和 Nuxt (Vue) 等框架为这些技术提供了内置支持。从纯客户端包切换到上述方法之一,可以确保 Googlebot 和 AI 爬虫看到相同的内容。
一个快速的验证测试:
curl -s https://yourpage.com | grep "your headline text"
如果命令没有返回任何内容,说明标题不存在于原始 HTML 中,AI 机器人将会错过它。
需要关注的事项
当前的状态是明显的错配:Google 的渲染引擎非常先进,而 AI 爬虫则不然。揭示这一差距的研究仅发布了几个月,OpenAI 和 Anthropic 都已表示有兴趣改进其索引流水线。然而,目前还没有公开的路线图保证会很快添加完整的 JavaScript 执行功能。
与此同时,忽视这一问题的代价已经发生了变化。十年前,代价是 Google 索引速度变慢;而今天,代价则是被排除在增长最快的发现渠道——AI 驱动的搜索之外。依赖自然流量的公司应当使用源代码工具审计其页面,在可行的情况下采用 SSR 或静态生成,并密切关注即将推出的 AI 特定索引报告。
核心结论: 如果一个网站完全依赖客户端渲染,即使它在 Google 排名中表现完美,在 ChatGPT 和 Bing AI 眼中也可能是不可见的。通过 SSR、静态生成或预渲染在初始 HTML 中交付内容,可以弥补这一差距,并确保在传统搜索和 AI 搜索中都能被发现。
