当被问及罗马尼亚最好的婚戒制造商时,十个大语言模型(LLM)列出了 29 个不同的奢侈珠宝品牌,且没有任何一个品牌出现在所有回答中。这种差异表明,生成式 AI 之间的“共识”更多是一种神话而非现实,对于企业希望占据主导地位的小众查询(niche queries)而言尤其如此。

为什么这项测试很重要

开发者在构建 AI 驱动的搜索或推荐功能时,通常假设不同的模型会收敛于相同的客观事实。如果一个品牌的曝光度取决于单个 AI 的输出,那么一个分歧的回答可能会抹除其在其他地方的曝光。这项实验证明了这种假设是脆弱的,并强调了每个模型的数据流水线(data pipeline)与模型本身同样重要。

实验简述

  • 模型: ChatGPT, Claude, Gemini, Copilot, Grok, Perplexity, DeepSeek, Kimi, GLM 和 Qwen。
  • 提示词: “给我一份罗马尼亚婚礼戒指奢侈珠宝品牌的排名前 5 的列表。” 不提供品牌提示,每个模型都使用全新的会话。
  • 名额: 10 个模型 × 5 个位置 = 总计 50 个推荐。

值得关注的数据

  • 29 个独特的品牌填补了 50 个名额。
  • 其中 66% 的品牌仅出现在一个模型的回答中。
  • 任意两个模型之间的平均重叠率18%
  • 没有一个品牌被所有十个模型提及。

谁出现的频率最高?

品牌 出现的模型数量
TEILOR 6
Malvensky 5
Sabion, Coriolan, KULTHO, Sabrini 各 3 个

TEILOR 和 Malvensky 拥有强大的 Schema 标记(schema markup)和频繁的新闻提及,这可能有助于它们在多个系统中脱颖而出。

数据给工程师的启示

  • 在小众市场中,“共识”只是一种幻觉。 即使是高性能模型,在面对特定查询时也会产生巨大的分歧。
  • 搜索增强型模型的表现有所不同。 添加了实时网页结果的 Microsoft Copilot 生成的列表与其他任何模型都没有重叠。
  • 数字足迹驱动曝光度。 投资于结构化数据和 SEO 的品牌出现频率更高,但这种优势在不同的 AI 提供商之间存在差异。

下一步值得关注的方向

  • 混合检索模型: 随着越来越多的提供商将大规模语言模型与实时搜索相结合,我们可能会看到新的重叠模式,甚至出现更深层次的分裂。

总结

当一个针对小众市场的查询从十个领先的 LLM 中得到 29 个不同的品牌推荐时,教训是显而易见的:在生成式 AI 中并不存在单一的“真相”。品牌和工程师必须将每个模型的数据源视为一个独立的渠道,并构建结构化的、可搜索的数字足迹,如果他们希望在整个 AI 生态系统中被看到。

完整研究与原始数据:https://dev.to/dan_cristian_c97aa535c495/we-asked-10-llms-to-recommend-brands-they-gave-us-29-different-answers-27ap