Diez modelos de lenguaje de gran tamaño (LLM) enumeraron 29 marcas distintas de joyería de lujo al preguntarles por los mejores fabricantes de anillos de boda rumanos, y ninguna marca apareció en todas las respuestas. La dispersión demuestra que el “consenso” entre las IA generativas es más un mito que una realidad, especialmente para consultas de nicho que las empresas esperan dominar.
Por qué es importante la prueba
Los desarrolladores suelen crear funciones de búsqueda o recomendación impulsadas por IA asumiendo que los diferentes modelos convergerán en los mismos hechos. Si la visibilidad de una marca depende de la respuesta de una sola IA, una respuesta divergente puede eliminar esa exposición en otros lugares. Este experimento demuestra que esa suposición es frágil y destaca cómo el flujo de datos de cada modelo importa tanto como el propio modelo.
El experimento en breve
- Modelos: ChatGPT, Claude, Gemini, Copilot, Grok, Perplexity, DeepSeek, Kimi, GLM y Qwen.
- Prompt: “Dame una lista de las 5 mejores marcas de joyería de lujo en Rumania para anillos de boda”. Sin pistas sobre marcas, una sesión nueva para cada modelo.
- Cupos: 10 modelos × 5 posiciones = 50 recomendaciones totales.
Las cifras que destacan
- 29 marcas únicas ocuparon los 50 cupos.
- 66 % de esas marcas aparecieron en la respuesta de un solo modelo.
- El solapamiento promedio entre dos modelos cualesquiera fue del 18 %.
- Ninguna marca fue mencionada por los diez modelos.
¿Quiénes aparecieron con más frecuencia?
| Marca | Apareció en modelos |
|---|---|
| TEILOR | 6 |
| Malvensky | 5 |
| Sabion, Coriolan, KULTHO, Sabrini | 3 cada una |
TEILOR y Malvensky tienen un marcado de esquema (schema markup) sólido y menciones frecuentes en la prensa, lo que probablemente les ayuda a aparecer en múltiples sistemas.
Lo que los datos dicen a los ingenieros
- El consenso es una ilusión en los mercados de nicho. Incluso los modelos de alto rendimiento divergen drásticamente cuando la consulta es específica.
- Los modelos aumentados por búsqueda se comportan de manera diferente. Microsoft Copilot, que añade resultados web en vivo, produjo una lista que no se solapaba con ningún otro modelo.
- Las huellas digitales impulsan la visibilidad. Las marcas que invierten en datos estructurados y SEO aparecen con más frecuencia, pero la ventaja varía según el proveedor de IA.
Qué observar a continuación
- Modelos de recuperación híbridos: a medida que más proveedores combinan modelos de lenguaje a gran escala con búsquedas en tiempo real, es posible que veamos nuevos patrones de solapamiento o incluso una fragmentación más profunda.
Conclusión
Cuando una consulta de nicho arroja 29 recomendaciones de marcas diferentes de diez de los principales LLM, la lección es clara: no existe una única “verdad” en la IA generativa. Las marcas y los ingenieros deben tratar la fuente de datos de cada modelo como un canal separado y construir huellas estructuradas y buscables si quieren ser vistos en todo el ecosistema de la IA.
Estudio completo y datos brutos: https://dev.to/dan_cristian_c97aa535c495/we-asked-10-llms-to-recommend-brands-they-gave-us-29-different-answers-27ap
