Десять больших языковых моделей (LLM) назвали 29 различных люксовых ювелирных брендов в ответ на вопрос о лучших производителях свадебных колец в Румынии, при этом ни один бренд не упоминался в каждом ответе. Такой разброс показывает, что «консенсус» среди генеративного ИИ — это скорее миф, чем реальность, особенно когда речь идет о нишевых запросах, в которых компании стремятся доминировать.

Почему этот тест важен

Разработчики часто создают функции поиска или рекомендаций на базе ИИ, полагая, что различные модели придут к одним и тем же фактам. Если видимость бренда зависит от ответов одной конкретной ИИ-модели, расхождение в ответах других моделей может полностью лишить его охвата. Этот эксперимент доказывает хрупкость такого предположения и подчеркивает, что конвейер данных (data pipeline) каждой модели важен не меньше, чем сама модель.

Краткое описание эксперимента

  • Модели: ChatGPT, Claude, Gemini, Copilot, Grok, Perplexity, DeepSeek, Kimi, GLM и Qwen.
  • Промпт: «Составь список из 5 лучших люксовых ювелирных брендов Румынии, производящих свадебные кольца». Без подсказок о брендах, для каждой модели — новая сессия.
  • Слоты: 10 моделей × 5 позиций = 50 рекомендаций в общей сложности.

Показатели, которые бросаются в глаза

  • 29 уникальных брендов заняли 50 слотов.
  • 66 % этих брендов упоминались только в ответе одной модели.
  • Среднее пересечение между любыми двумя моделями составило 18 %.
  • Ни один бренд не был упомянут всеми десятью моделями.

Кто упоминался чаще всего?

Бренд Упоминался в моделях
TEILOR 6
Malvensky 5
Sabion, Coriolan, KULTHO, Sabrini по 3

TEILOR и Malvensky имеют развитую микроразметку (schema markup) и часто упоминаются в прессе, что, вероятно, помогает им появляться в ответах различных систем.

О чем говорят данные инженерам

  • Консенсус — это иллюзия на нишевых рынках. Даже высокопроизводительные модели демонстрируют резкие расхождения, когда запрос становится специфическим.
  • Модели с поисковым расширением ведут себя иначе. Microsoft Copilot, который добавляет результаты живого поиска в вебе, выдал список, который не пересекался ни с одной другой моделью.
  • Цифровой след определяет видимость. Бренды, инвестирующие в структурированные данные и SEO, появляются чаще, но это преимущество варьируется в зависимости от поставщика ИИ.

За чем следить дальше

  • Гибридные модели поиска (retrieval models): по мере того как всё больше провайдеров объединяют масштабные языковые модели с поиском в реальном времени, мы можем увидеть новые паттерны пересечения или даже еще большую фрагментацию.

Вывод

Когда нишевый запрос выдает 29 различных рекомендаций брендов от десяти ведущих LLM, урок очевиден: в генеративном ИИ не существует единой «истины». Бренды и инженеры должны относиться к источнику данных каждой модели как к отдельному каналу и создавать структурированный, доступный для поиска цифровой след, если они хотят быть заметными во всей экосистеме ИИ.

Полное исследование и необработанные данные: https://dev.to/dan_cristian_c97aa535c495/we-asked-10-llms-to-recommend-brands-they-gave-us-29-different-answers-27ap