10個の大規模言語モデル(LLM)にルーマニアの最高のウェディングリングメーカーを尋ねたところ、29の異なる高級ジュエリーブランドが挙げられ、すべての回答に共通して登場するブランドは一つもありませんでした。この分散は、生成AIにおける「コンセンサス(合意)」が、特に企業が市場を独占したいと願うニッチなクエリにおいては、現実というよりも神話に近いことを示しています。

なぜこのテストが重要なのか

開発者は、異なるモデルが同じ事実に収束すると想定して、AI駆動の検索やレコメンデーション機能を構築することがよくあります。もしブランドの認知度が単一のAIの出力に依存している場合、モデル間で回答が分かれることで、他のモデルでの露出が失われてしまう可能性があります。この実験は、その想定がいかに脆弱であるかを証明しており、各モデルのデータパイプラインがモデル自体と同じくらい重要であることを浮き彫りにしています。

実験の概要

  • モデル: ChatGPT, Claude, Gemini, Copilot, Grok, Perplexity, DeepSeek, Kimi, GLM, Qwen
  • プロンプト: 「ルーマニアのウェディングリング向けの高級ジュエリーブランドのトップ5リストを教えてください。」ブランドのヒントは与えず、各モデルで新しいセッションを使用。
  • スロット: 10モデル × 5ポジション = 合計50件のレコメンデーション。

目に留くべき数字

  • 29のユニークなブランドが50のスロットを埋めた。
  • それらのブランドの**66%**は、たった一つのモデルの回答にしか登場しなかった。
  • モデル間の平均的な重複率は**18%**であった。
  • 10個すべてのモデルに言及されたブランドは存在しなかった。

最も頻繁に登場したのは?

ブランド 登場したモデル数
TEILOR 6
Malvensky 5
Sabion, Coriolan, KULTHO, Sabrini 各3

TEILORとMalvenskyは、強力なスキーママークアップと頻繁なプレスリリースによる言及があり、それが複数のシステムで表面化する助けとなっている可能性があります。

データがエンジニアに示唆すること

  • ニッチな市場において、コンセンサスは幻想である。 高性能なモデルであっても、クエリが具体的になると劇的に意見が分かれます。
  • 検索拡張型モデルは異なる挙動を示す。 ライブウェブの結果を追加するMicrosoft Copilotは、他のどのモデルとも重複しないリストを作成しました。
  • デジタルフットプリントが可視性を左右する。 構造化データやSEOに投資しているブランドはより頻繁に登場しますが、その優位性はAIプロバイダーによって異なります。

今後の注目点

  • ハイブリッド検索モデル: より多くのプロバイダーが大規模言語モデルとリアルタイム検索を融合させるにつれ、新たな重複パターンが現れるか、あるいはさらなる断片化が進む可能性があります。

まとめ

10の主要なLLMから29もの異なるブランドのレコメンデーションが生成されるニッチなクエリにおいて、教訓は明確です。生成AIには単一の「真実」は存在しません。ブランドやエンジニアは、各モデルのデータソースを個別のチャネルとして扱い、AIエコシステム全体で認知されるためには、構造化され検索可能なフットプリントを構築する必要があります。

調査全文と生データ: https://dev.to/dan_cristian_c97aa535c495/we-asked-10-llms-to-recommend-brands-they-gave-us-29-different-answers-27ap