Dez modelos de linguagem de grande escala (LLMs) listaram 29 marcas distintas de joias de luxo ao serem questionados sobre os melhores fabricantes de alianças de casamento na Romênia, e nenhuma marca apareceu em todas as respostas. Essa dispersão mostra que o “consenso” entre IAs generativas é mais um mito do que uma realidade, especialmente para consultas de nicho que as empresas esperam dominar.
Por que o teste é importante
Desenvolvedores frequentemente constroem recursos de busca ou recomendação baseados em IA assumindo que diferentes modelos convergirão para os mesmos fatos. Se a visibilidade de uma marca depende do resultado de uma única IA, uma resposta divergente pode anular essa exposição em outros lugares. Este experimento prova que essa suposição é frágil e destaca como o pipeline de dados de cada modelo importa tanto quanto o próprio modelo.
O experimento em resumo
- Modelos: ChatGPT, Claude, Gemini, Copilot, Grok, Perplexity, DeepSeek, Kimi, GLM e Qwen.
- Prompt: “Dê-me uma lista das 5 melhores marcas de joias de luxo na Romênia para alianças de casamento.” Sem dicas de marcas, uma sessão nova para cada modelo.
- Slots: 10 modelos × 5 posições = 50 recomendações no total.
Os números que se destacam
- 29 marcas exclusivas preencheram os 50 slots.
- 66% dessas marcas apareceram na resposta de apenas um modelo.
- A sobreposição média entre quaisquer dois modelos foi de 18%.
- Nenhuma marca foi mencionada por todos os dez modelos.
Quem apareceu com mais frequência?
| Marca | Apareceu em modelos |
|---|---|
| TEILOR | 6 |
| Malvensky | 5 |
| Sabion, Coriolan, KULTHO, Sabrini | 3 cada |
TEILOR e Malvensky possuem um schema markup forte e menções frequentes na imprensa, o que provavelmente as ajuda a aparecer em múltiplos sistemas.
O que os dados dizem aos engenheiros
- O consenso é uma ilusão em mercados de nicho. Mesmo modelos de alto desempenho divergem drasticamente quando a consulta é específica.
- Modelos com busca aumentada se comportam de forma diferente. O Microsoft Copilot, que adiciona resultados da web em tempo real, produziu uma lista que não teve sobreposição com nenhum outro modelo.
- Pegadas digitais impulsionam a visibilidade. Marcas que investem em dados estruturados e SEO aparecem com mais frequência, mas a vantagem varia entre os provedores de IA.
O que observar a seguir
- Modelos de recuperação híbrida: à medida que mais provedores combinam modelos de linguagem de larga escala com busca em tempo real, podemos ver novos padrões de sobreposição — ou até mesmo uma fragmentação ainda maior.
Conclusão
Quando uma consulta de nicho gera 29 recomendações de marcas diferentes a partir de dez LLMs líderes, a lição é clara: não existe uma única “verdade” na IA generativa. Marcas e engenheiros devem tratar a fonte de dados de cada modelo como um canal separado e construir pegadas estruturadas e pesquisáveis se quiserem ser vistos em todo o ecossistema de IA.
Estudo completo e dados brutos: https://dev.to/dan_cristian_c97aa535c495/we-asked-10-llms-to-recommend-brands-they-gave-us-29-different-answers-27ap
