Cómo se configuró la prueba

El autor construyó un pequeño sistema de generación aumentada por recuperación (RAG) basado en dos documentos de reglamentos de pago y realizó dos comprobaciones:

  • Prueba de recall – ¿apareció la página correcta entre los cinco primeros resultados? Resultado: 60 %.
  • Prueba de respuesta – ¿fue correcta la respuesta final producida por el generador? Resultado: 90 %.

Una brecha del 40 % parecía imposible. Si el recuperador fallaba la página correcta cuatro de cada diez veces, ¿cómo podía el modelo seguir respondiendo correctamente nueve de cada diez veces?

Primeros intentos para «corregir» el recuperador

El desarrollador probó dos trucos comunes:

  • Búsqueda híbrida – mezcla de señales léxicas y vectoriales. El recall se mantuvo igual.
  • Reranker – reordenar las cinco páginas obtenidas. El recall subió al 70 %, pero seguía estando muy por debajo de la precisión de respuesta del 90 %.

Ambas herramientas solo reordenan lo que ya ha sido recuperado; no pueden hacer aparecer una página que nunca entró en el conjunto de candidatos. El problema residía en otra parte.

La métrica, no el modelo, era el problema

En lugar de juzgar el éxito por la etiqueta de la página, el autor inspeccionó los hechos reales en los fragmentos (chunks) recuperados. En tres de cada cuatro «fallos», el hecho correcto estaba presente, pero se encontraba en una página diferente a la que el script de prueba esperaba. La evaluación penalizaba al recuperador por encontrar una respuesta correcta en una página inesperada.

Cuando la métrica cambió a «¿contiene algún fragmento recuperado el hecho requerido?», el recall saltó al 90 %, igualando la precisión de la respuesta. El recuperador funcionaba; el marco de evaluación no.

Por qué el recall tradicional puede ser engañoso

  • El etiquetado a nivel de página crea fallos fantasma. Un solo hecho puede aparecer en varias páginas. Etiquetar solo una página como verdad de referencia (ground truth) trata todos los demás aciertos correctos como errores.
  • Los corpus pequeños amplifican el efecto. Con pocos documentos, una sola página mal etiquetada puede alterar drásticamente el recall mientras la precisión de la respuesta se mantiene estable.
  • El ruido de los embeddings oculta hechos. Los vectores puntúan páginas enteras; el texto legal o técnico circundante diluye la señal de relevancia de la frase objetivo, bajando la página en el ranking a pesar de que el hecho está presente.

Conclusiones prácticas para profesionales de RAG

  • Separe el ranking de los fallos de recuperación. Los rerankers solo corrigen lo primero; si el fragmento correcto nunca llega al conjunto de candidatos, el reordenamiento no sirve de nada.
  • Etiquete los datos de prueba a nivel de hecho. Vincule cada consulta a la pieza de información específica que necesita, no a un único identificador de documento.
  • No confíe en benchmarks a gran escala para conjuntos de datos diminutos. Los corpus pequeños y específicos de un dominio se comportan de manera diferente, y las puntuaciones de recall genéricas pueden ser engañosas.
  • Preste atención a la granularidad de los embeddings. Un fragmento del tamaño de una página contiene muchas palabras, y el texto legal circundante puede reducir la posición del hecho que le interesa.

En conclusión: una puntuación alta de precisión de respuesta puede coexistir con una cifra de recall tradicional baja cuando la evaluación no está alineada con la tarea. Corregir la métrica, y no el modelo, ahorra tiempo, reduce las falsas alarmas y produce despliegues de RAG más fiables.