10개의 대규모 언어 모델(LLM)에 루마니아 최고의 웨딩 링 제조사를 물었을 때, 총 29개의 서로 다른 럭셔리 주얼리 브랜드가 나열되었으며 모든 답변에 공통으로 등장한 브랜드는 단 하나도 없었습니다. 이러한 격차는 생성형 AI 사이의 '합의'가 현실이라기보다는 신화에 가깝다는 것을 보여주며, 특히 기업들이 시장을 점유하고자 하는 니치(niche)한 질문에서 더욱 두드러집니다.
이 테스트가 중요한 이유
개발자들은 종종 서로 다른 모델들이 동일한 사실로 수렴할 것이라고 가정하고 AI 기반 검색 또는 추천 기능을 구축합니다. 만약 특정 브랜드의 가시성이 단일 AI의 출력에 달려 있다면, 모델마다 다른 답변을 내놓음으로써 다른 곳에서의 노출이 완전히 사라질 수 있습니다. 이번 실험은 그러한 가정이 취약하다는 것을 증명하며, 각 모델의 데이터 파이프라인이 모델 자체만큼이나 중요하다는 점을 강조합니다.
실험 요약
- 모델: ChatGPT, Claude, Gemini, Copilot, Grok, Perplexity, DeepSeek, Kimi, GLM, Qwen.
- 프롬프트: “루마니아의 웨딩 링을 위한 럭셔리 주얼리 브랜드 Top 5 리스트를 알려줘.” 브랜드에 대한 힌트는 주지 않았으며, 각 모델마다 새로운 세션에서 진행했습니다.
- 슬롯: 10개 모델 × 5개 위치 = 총 50개의 추천 결과.
눈에 띄는 수치들
- 50개의 슬롯을 채운 브랜드는 29개의 고유 브랜드였습니다.
- 해당 브랜드 중 **66%**는 단 하나의 모델 답변에서만 등장했습니다.
- 두 모델 간의 평균 중복률은 **18%**였습니다.
- 10개 모델 모두가 언급한 브랜드는 없었습니다.
가장 자주 등장한 브랜드는?
| 브랜드 | 등장한 모델 수 |
|---|---|
| TEILOR | 6 |
| Malvensky | 5 |
| Sabion, Coriolan, KULTHO, Sabrini | 각 3 |
TEILOR와 Malvensky는 강력한 스키마 마크업(schema markup)과 빈번한 언론 보도를 보유하고 있어, 여러 시스템에서 노출되는 데 도움이 된 것으로 보입니다.
데이터가 엔지니어에게 주는 시사점
- 니치 시장에서 합의는 환상입니다. 질문이 구체적일 경우 성능이 뛰어난 모델조차 극명하게 갈립니다.
- 검색 증강 모델(Search-augmented models)은 다르게 동작합니다. 실시간 웹 검색 결과를 추가하는 Microsoft Copilot은 다른 어떤 모델과도 중복되지 않는 리스트를 생성했습니다.
- 디지털 발자국이 가시성을 결정합니다. 구조화된 데이터와 SEO에 투자하는 브랜드가 더 자주 등장하지만, 그 이점은 AI 제공업체마다 다릅니다.
향후 주목해야 할 점
- 하이브리드 검색 모델(Hybrid retrieval models): 더 많은 제공업체가 대규모 언어 모델과 실시간 검색을 결합함에 따라, 새로운 중복 패턴이 나타나거나 혹은 파편화가 더욱 심화될 수 있습니다.
결론
10개의 선도적인 LLM이 니치한 질문에 대해 29개의 서로 다른 브랜드 추천을 내놓는다면, 교훈은 명확합니다. 생성형 AI에는 단 하나의 '진실'이 존재하지 않는다는 것입니다. 브랜드와 엔지니어는 AI 생태계 전반에서 노출되기를 원한다면 각 모델의 데이터 소스를 별개의 채널로 취급해야 하며, 구조화되고 검색 가능한 디지털 발자국을 구축해야 합니다.
전체 연구 및 원본 데이터: https://dev.to/dan_cristian_c97aa535c495/we-asked-10-llms-to-recommend-brands-they-gave-us-29-different-answers-27ap
