Десять больших языковых моделей (LLM) назвали 29 различных люксовых ювелирных брендов в ответ на вопрос о лучших производителях свадебных колец в Румынии, при этом ни один бренд не упоминался в каждом ответе. Такой разброс показывает, что «консенсус» среди генеративного ИИ — это скорее миф, чем реальность, особенно когда речь идет о нишевых запросах, в которых компании стремятся доминировать.
Почему этот тест важен
Разработчики часто создают функции поиска или рекомендаций на базе ИИ, полагая, что различные модели придут к одним и тем же фактам. Если видимость бренда зависит от ответов одной конкретной ИИ-модели, расхождение в ответах других моделей может полностью лишить его охвата. Этот эксперимент доказывает хрупкость такого предположения и подчеркивает, что конвейер данных (data pipeline) каждой модели важен не меньше, чем сама модель.
Краткое описание эксперимента
- Модели: ChatGPT, Claude, Gemini, Copilot, Grok, Perplexity, DeepSeek, Kimi, GLM и Qwen.
- Промпт: «Составь список из 5 лучших люксовых ювелирных брендов Румынии, производящих свадебные кольца». Без подсказок о брендах, для каждой модели — новая сессия.
- Слоты: 10 моделей × 5 позиций = 50 рекомендаций в общей сложности.
Показатели, которые бросаются в глаза
- 29 уникальных брендов заняли 50 слотов.
- 66 % этих брендов упоминались только в ответе одной модели.
- Среднее пересечение между любыми двумя моделями составило 18 %.
- Ни один бренд не был упомянут всеми десятью моделями.
Кто упоминался чаще всего?
| Бренд | Упоминался в моделях |
|---|---|
| TEILOR | 6 |
| Malvensky | 5 |
| Sabion, Coriolan, KULTHO, Sabrini | по 3 |
TEILOR и Malvensky имеют развитую микроразметку (schema markup) и часто упоминаются в прессе, что, вероятно, помогает им появляться в ответах различных систем.
О чем говорят данные инженерам
- Консенсус — это иллюзия на нишевых рынках. Даже высокопроизводительные модели демонстрируют резкие расхождения, когда запрос становится специфическим.
- Модели с поисковым расширением ведут себя иначе. Microsoft Copilot, который добавляет результаты живого поиска в вебе, выдал список, который не пересекался ни с одной другой моделью.
- Цифровой след определяет видимость. Бренды, инвестирующие в структурированные данные и SEO, появляются чаще, но это преимущество варьируется в зависимости от поставщика ИИ.
За чем следить дальше
- Гибридные модели поиска (retrieval models): по мере того как всё больше провайдеров объединяют масштабные языковые модели с поиском в реальном времени, мы можем увидеть новые паттерны пересечения или даже еще большую фрагментацию.
Вывод
Когда нишевый запрос выдает 29 различных рекомендаций брендов от десяти ведущих LLM, урок очевиден: в генеративном ИИ не существует единой «истины». Бренды и инженеры должны относиться к источнику данных каждой модели как к отдельному каналу и создавать структурированный, доступный для поиска цифровой след, если они хотят быть заметными во всей экосистеме ИИ.
Полное исследование и необработанные данные: https://dev.to/dan_cristian_c97aa535c495/we-asked-10-llms-to-recommend-brands-they-gave-us-29-different-answers-27ap
