我建立了一个希望被 AI 助手引用的网站,与其靠猜,不如我将三种被广泛推荐的信号付诸实践:一个允许 GPT 类爬虫进入的 robots.txt 条目、一个列出所有页面的 llms.txt 文件,以及描述内容的 JSON-LD schema。在对每一项进行测试后,我发现只有一项可能会在没有任何警告的情况下静默失败,而其他两项的效果并不像大多数人声称的那样。
为什么这三种信号很重要
站长们一直被告知,面向 AI 的爬虫需要明确的许可,纯文本的 “llms.txt” 索引有助于大语言模型 (LLMs) 定位相关段落,而 JSON-LD 结构化数据则能提高被引用的概率。这个承诺很简单:添加这些文件,你的网站就会开始出现在 AI 生成的回答中,从而带来流量和品牌曝光度。
1. 在 robots.txt 中允许 AI 爬虫进入
提及 GPTBot(或任何其他 AI 机器人)的 robots.txt 行仅仅是一个请求。如果内容分发网络 (CDN) 或防火墙拦截了该机器人,请求就永远无法到达网站,爬虫也根本无法读取该文件。了解机器人是否可以访问你的唯一可靠方法是检查每个主要机器人的 HTTP 状态码。403 (forbidden) 或 503 (service unavailable) 响应意味着后续的所有“管道工程”都变得毫无意义——没有机器人,就没有索引,也就没有引用。
2. llms.txt 文件
llms.txt 文件只是一个 URL 的 Markdown 列表,旨在为 LLM 提供一个清晰的网站地图,这样它们就不必仅从 HTML 中推断导航结构。在实践中,Google 的文档称其会忽略该文件,而且目前还没有任何主流搜索引擎承诺将其用于引用目的。保留它几乎没有任何成本,而且对于自定义 AI 代理来说可能很有用,但不应将其宣传为获得更多 AI 引用的捷径。
3. JSON-LD schema
JSON-LD 将结构化数据(作者姓名、发布日期、产品 ID)直接嵌入到页面中。许多营销人员认为添加 schema 会让他们的页面更多地出现在 AI 回答中,但一项针对 1,885 个页面的研究发现,仅靠 schema 标记并不能带来可衡量的引用提升。JSON-LD 的真正价值在于实体解析 (entity resolution):它告诉机器,一个页面上的 “Jane Doe” 与另一个页面上的 “Jane Doe” 是同一个人,从而防止在姓名或产品相似时产生混淆。
真正的瓶颈:索引
这三种信号都属于“管道工程”;只有在页面首先被索引的情况下,它们才会起作用。无论你添加多少爬虫许可或 schema 标签,一个从未出现在索引中的页面都是无法被检索到的。衡量索引健康状况最可靠的指标是 Google Search Console(或其他搜索引擎的同类工具)中的覆盖率报告。如果一个页面显示为“未编入索引”,在担心任何 AI 特定信号之前,你需要先解决这个问题。
实用清单
- 验证爬虫访问权限 – 测试 GPTBot、ClaudeBot 或任何你关心的 AI 爬虫的 HTTP 响应。这一步可能会静默失败;拦截操作不会在你的分析工具中生成警告。
- 确认索引覆盖范围 – 使用 Search Console 查看哪些页面已编入索引,哪些被排除在外,以及原因。首先解决任何“抓取错误”或 “noindex” 指令。
- 添加“管道工程” – 一旦访问和索引都稳固了,再加入 llms.txt 和 JSON-LD。将它们视为低维护成本的辅助工具,而不是引用的保证。
反方观点
一些供应商仍将 llms.txt 生成器和 schema 插件作为 AI SEO 的助推器进行营销。我收集的数据加上主流搜索引擎的官方立场表明,这些说法言过其实。这些工具本身并无害处,但不应成为 AI 引用策略的核心。
下一步关注点
监控爬虫日志,留意 Search Console 的警报,并定期使用验证工具测试你的 JSON-LD,以保持数据流的畅通。
核心结论: 如果你希望你的网站被 AI 引用,请不要再把 llms.txt 和 schema 当作“万能钥匙”。确保机器人能够真正访问到你,并且你的页面已被编入索引;只有这样,这些额外的文件才能发挥其微小且辅助的作用。
来源:dev.to 上的原文
