Десять великих мовних моделей (LLM) назвали 29 різних брендів розкішних ювелірних виробів, коли їх запитали про найкращих румунських майстрів весільних каблучок, і жоден бренд не згадувався в кожній відповіді. Такий розкид свідчить про те, що «консенсус» серед генеративного ШІ — це швидше міф, ніж реальність, особливо коли йдеться про нішеві запити, у яких бізнес прагне домінувати.
Чому цей тест важливий
Розробники часто створюють функції пошуку або рекомендацій на основі ШІ, припускаючи, що різні моделі сходитимуться на одних і тих самих фактах. Якщо видимість бренду залежить від результатів роботи одного ШІ, розбіжність у відповідях може повністю позбавити його присутності в інших системах. Цей експеримент доводить, що таке припущення є хибним, і підкреслює, що конвеєр даних (data pipeline) кожної моделі має таке ж значення, як і сама модель.
Коротко про експеримент
- Моделі: ChatGPT, Claude, Gemini, Copilot, Grok, Perplexity, DeepSeek, Kimi, GLM та Qwen.
- Промпт: «Надай мені список із топ-5 брендів розкішних ювелірних виробів у Румунії для весільних каблучок». Без підказок щодо брендів, окрема сесія для кожної моделі.
- Слоти: 10 моделей × 5 позицій = 50 загальних рекомендацій.
Цифри, що привертають увагу
- 29 унікальних брендів зайняли 50 слотів.
- 66 % цих брендів згадувалися лише в одній відповіді моделі.
- Середнє перекриття між будь-якими двома моделями становило 18 %.
- Жоден бренд не був згаданий усіма десятьма моделями.
Хто згадувався найчастіше?
| Бренд | Згадувався в моделях |
|---|---|
| TEILOR | 6 |
| Malvensky | 5 |
| Sabion, Coriolan, KULTHO, Sabrini | по 3 |
TEILOR та Malvensky мають чітку розмітку schema та часто згадуються в пресі, що, ймовірно, допомагає їм з'являтися в різних системах.
Про що говорять дані інженерам
- Консенсус — це ілюзія на нішевих ринках. Навіть високоефективні моделі демонструють значні розбіжності, коли запит є специфічним.
- Моделі з розширеним пошуком поводяться інакше. Microsoft Copilot, який додає результати пошуку в реальному часі, видав список, який не перетинався з жодною іншою моделлю.
- Цифрові сліди визначають видимість. Бренди, які інвестують у структуровані дані та SEO, з'являються частіше, але перевага варіюється залежно від постачальника ШІ.
На що звернути увагу далі
- Гібридні моделі пошуку (retrieval models): оскільки все більше постачальників поєднують великомасштабні мовні моделі з пошуком у реальному часі, ми можемо побачити нові патерни перетину або навіть ще глибшу фрагментацію.
Висновок
Коли нішевий запит дає 29 різних рекомендацій брендів від десяти провідних LLM, урок очевидний: у генеративному ШІ не існує єдиної «істини». Бренди та інженери повинні ставитися до джерела даних кожної моделі як до окремого каналу та створювати структуровані, доступні для пошуку цифрові сліди, якщо вони хочуть бути поміченими в екосистемі ШІ.
Повне дослідження та необроблені дані: https://dev.to/dan_cristian_c97aa535c495/we-asked-10-llms-to-recommend-brands-they-gave-us-29-different-answers-27ap
