Dez modelos de linguagem de grande escala (LLMs) listaram 29 marcas distintas de joias de luxo ao serem questionados sobre os melhores fabricantes de alianças de casamento na Romênia, e nenhuma marca apareceu em todas as respostas. Essa dispersão mostra que o “consenso” entre IAs generativas é mais um mito do que uma realidade, especialmente para consultas de nicho que as empresas esperam dominar.

Por que o teste é importante

Desenvolvedores frequentemente constroem recursos de busca ou recomendação baseados em IA assumindo que diferentes modelos convergirão para os mesmos fatos. Se a visibilidade de uma marca depende do resultado de uma única IA, uma resposta divergente pode anular essa exposição em outros lugares. Este experimento prova que essa suposição é frágil e destaca como o pipeline de dados de cada modelo importa tanto quanto o próprio modelo.

O experimento em resumo

  • Modelos: ChatGPT, Claude, Gemini, Copilot, Grok, Perplexity, DeepSeek, Kimi, GLM e Qwen.
  • Prompt: “Dê-me uma lista das 5 melhores marcas de joias de luxo na Romênia para alianças de casamento.” Sem dicas de marcas, uma sessão nova para cada modelo.
  • Slots: 10 modelos × 5 posições = 50 recomendações no total.

Os números que se destacam

  • 29 marcas exclusivas preencheram os 50 slots.
  • 66% dessas marcas apareceram na resposta de apenas um modelo.
  • A sobreposição média entre quaisquer dois modelos foi de 18%.
  • Nenhuma marca foi mencionada por todos os dez modelos.

Quem apareceu com mais frequência?

Marca Apareceu em modelos
TEILOR 6
Malvensky 5
Sabion, Coriolan, KULTHO, Sabrini 3 cada

TEILOR e Malvensky possuem um schema markup forte e menções frequentes na imprensa, o que provavelmente as ajuda a aparecer em múltiplos sistemas.

O que os dados dizem aos engenheiros

  • O consenso é uma ilusão em mercados de nicho. Mesmo modelos de alto desempenho divergem drasticamente quando a consulta é específica.
  • Modelos com busca aumentada se comportam de forma diferente. O Microsoft Copilot, que adiciona resultados da web em tempo real, produziu uma lista que não teve sobreposição com nenhum outro modelo.
  • Pegadas digitais impulsionam a visibilidade. Marcas que investem em dados estruturados e SEO aparecem com mais frequência, mas a vantagem varia entre os provedores de IA.

O que observar a seguir

  • Modelos de recuperação híbrida: à medida que mais provedores combinam modelos de linguagem de larga escala com busca em tempo real, podemos ver novos padrões de sobreposição — ou até mesmo uma fragmentação ainda maior.

Conclusão

Quando uma consulta de nicho gera 29 recomendações de marcas diferentes a partir de dez LLMs líderes, a lição é clara: não existe uma única “verdade” na IA generativa. Marcas e engenheiros devem tratar a fonte de dados de cada modelo como um canal separado e construir pegadas estruturadas e pesquisáveis se quiserem ser vistos em todo o ecossistema de IA.

Estudo completo e dados brutos: https://dev.to/dan_cristian_c97aa535c495/we-asked-10-llms-to-recommend-brands-they-gave-us-29-different-answers-27ap