Dix modèles de langage de grande taille (LLM) ont cité 29 marques de joaillerie de luxe distinctes lorsqu'on leur a demandé quels étaient les meilleurs fabricants d'alliances en Roumanie, et aucune marque n'est apparue dans toutes les réponses. Cette dispersion montre que le « consensus » parmi les IA génératives relève plus du mythe que de la réalité, en particulier pour les requêtes de niche que les entreprises espèrent dominer.
Pourquoi ce test est important
Les développeurs conçoivent souvent des fonctionnalités de recherche ou de recommandation pilotées par l'IA en supposant que différents modèles convergeront vers les mêmes faits. Si la visibilité d'une marque dépend de la réponse d'une seule IA, une réponse divergente peut anéantir cette exposition ailleurs. Cette expérience prouve la fragilité de cette hypothèse et souligne à quel point le pipeline de données de chaque modèle compte autant que le modèle lui-même.
L'expérience en bref
- Modèles : ChatGPT, Claude, Gemini, Copilot, Grok, Perplexity, DeepSeek, Kimi, GLM et Qwen.
- Prompt : « Donne-moi une liste des 5 meilleures marques de joaillerie de luxe en Roumanie pour les alliances. » Aucun indice sur les marques, une session vierge pour chaque modèle.
- Emplacements : 10 modèles × 5 positions = 50 recommandations au total.
Les chiffres marquants
- 29 marques uniques ont occupé les 50 emplacements.
- 66 % de ces marques n'apparaissaient que dans la réponse d'un seul modèle.
- Le chevauchement moyen entre deux modèles quelconques était de 18 %.
- Aucune marque n'a été mentionnée par les dix modèles.
Qui est apparu le plus souvent ?
| Marque | Apparu dans les modèles |
|---|---|
| TEILOR | 6 |
| Malvensky | 5 |
| Sabion, Coriolan, KULTHO, Sabrini | 3 chacune |
TEILOR et Malvensky bénéficient d'un balisage de schéma (schema markup) robuste et de mentions fréquentes dans la presse, ce qui les aide probablement à apparaître dans plusieurs systèmes.
Ce que les données disent aux ingénieurs
- Le consensus est une illusion sur les marchés de niche. Même les modèles les plus performants divergent de manière spectaculaire lorsque la requête est spécifique.
- Les modèles augmentés par la recherche se comportent différemment. Microsoft Copilot, qui ajoute des résultats web en direct, a produit une liste qui ne présentait aucun chevauchement avec les autres modèles.
- L'empreinte numérique favorise la visibilité. Les marques qui investissent dans les données structurées et le SEO apparaissent plus souvent, mais l'avantage varie selon les fournisseurs d'IA.
À surveiller ensuite
- Modèles de récupération hybrides : à mesure que de plus en plus de fournisseurs mélangent des modèles de langage à grande échelle avec la recherche en temps réel, nous pourrions voir apparaître de nouveaux schémas de chevauchement — ou même une fragmentation encore plus profonde.
À retenir
Lorsqu'une requête de niche génère 29 recommandations de marques différentes à partir de dix LLM de premier plan, la leçon est claire : il n'existe pas de « vérité » unique dans l'IA générative. Les marques et les ingénieurs doivent traiter la source de données de chaque modèle comme un canal distinct et construire des empreintes structurées et interrogeables s'ils veulent être visibles dans l'écosystème de l'IA.
Étude complète et données brutes : https://dev.to/dan_cristian_c97aa535c495/we-asked-10-llms-to-recommend-brands-they-gave-us-29-different-answers-27ap
