当被问及罗马尼亚最好的婚戒制造商时,十个大语言模型(LLM)列出了 29 个不同的奢侈珠宝品牌,且没有任何一个品牌出现在所有回答中。这种差异表明,生成式 AI 之间的“共识”更多是一种神话而非现实,对于企业希望占据主导地位的小众查询(niche queries)而言尤其如此。
为什么这项测试很重要
开发者在构建 AI 驱动的搜索或推荐功能时,通常假设不同的模型会收敛于相同的客观事实。如果一个品牌的曝光度取决于单个 AI 的输出,那么一个分歧的回答可能会抹除其在其他地方的曝光。这项实验证明了这种假设是脆弱的,并强调了每个模型的数据流水线(data pipeline)与模型本身同样重要。
实验简述
- 模型: ChatGPT, Claude, Gemini, Copilot, Grok, Perplexity, DeepSeek, Kimi, GLM 和 Qwen。
- 提示词: “给我一份罗马尼亚婚礼戒指奢侈珠宝品牌的排名前 5 的列表。” 不提供品牌提示,每个模型都使用全新的会话。
- 名额: 10 个模型 × 5 个位置 = 总计 50 个推荐。
值得关注的数据
- 29 个独特的品牌填补了 50 个名额。
- 其中 66% 的品牌仅出现在一个模型的回答中。
- 任意两个模型之间的平均重叠率为 18%。
- 没有一个品牌被所有十个模型提及。
谁出现的频率最高?
| 品牌 | 出现的模型数量 |
|---|---|
| TEILOR | 6 |
| Malvensky | 5 |
| Sabion, Coriolan, KULTHO, Sabrini | 各 3 个 |
TEILOR 和 Malvensky 拥有强大的 Schema 标记(schema markup)和频繁的新闻提及,这可能有助于它们在多个系统中脱颖而出。
数据给工程师的启示
- 在小众市场中,“共识”只是一种幻觉。 即使是高性能模型,在面对特定查询时也会产生巨大的分歧。
- 搜索增强型模型的表现有所不同。 添加了实时网页结果的 Microsoft Copilot 生成的列表与其他任何模型都没有重叠。
- 数字足迹驱动曝光度。 投资于结构化数据和 SEO 的品牌出现频率更高,但这种优势在不同的 AI 提供商之间存在差异。
下一步值得关注的方向
- 混合检索模型: 随着越来越多的提供商将大规模语言模型与实时搜索相结合,我们可能会看到新的重叠模式,甚至出现更深层次的分裂。
总结
当一个针对小众市场的查询从十个领先的 LLM 中得到 29 个不同的品牌推荐时,教训是显而易见的:在生成式 AI 中并不存在单一的“真相”。品牌和工程师必须将每个模型的数据源视为一个独立的渠道,并构建结构化的、可搜索的数字足迹,如果他们希望在整个 AI 生态系统中被看到。
